我們很高興與您分享我們最近的國際會議論文《參數高效的多源自適應多模態服裝檢索》,該論文由我們的 MSAAI 學生劉袁柳撰寫,並被2026年人工智能与机电自动化国际学术会议(AIEA 2026)接收:
- Yuanliu Liu, Harris Sik-Ho Tsang, Richard Tai-Chiu Hsung, Tony Yulin Zhu, Xiaoxing Yang, Wai-Lun Lo, Ziyin Huang, Yui-Lam Chan, “Parameter-Efficient Multi-Source Adaptation for Multimodal Fashion Retrieval,” International Conference on Artificial Intelligence and Electromechanical Automation (AIEA), Shenzhen, China, Jun. 2026.
論文摘要
當我們嘗試用文字描述或隨意街拍來搜尋衣服時,線上網購平台往往很難精準命中,這是因為傳統 AI 難以跨越「現實生活照」與「專業影棚模特兒照」之間的巨大視覺落差。為了克服這個痛點,我們開發了 FashLoRA-SigLIP —— 一個智能的兩階段 AI 系統。首先,我們透過海量的多元風格數據集,訓練出一個強大的「時尚大腦」,使其能跨越不同視角精準識別服裝;接著,當應用到新的電商平台時,我們無需重新訓練整個龐大的大模型,而是採用輕量化的「低秩自適應(LoRA)」策略,僅需更新模型 5.6% 的核心參數。在業界標準數據集上的實測表明,此方法的表現顯著優於傳統模型,不僅大幅提升了「以圖搜圖(消費者生活照)」的查找準確率,更為電商平台省下了巨額的計算成本。
在本次會議上,我們獲得了最佳口頭報告獎。香港珠海學院始終致力於支持學生的研究工作,鼓勵他們在國際會議和期刊上發表論文。更多論文即將發表!
研究團隊成員
香港珠海學院
劉袁柳先生,資訊科學系硕士生
曾錫豪博士,資訊科學系助理教授
熊體超博士,資訊科學系副教授
朱禹林博士,資訊科學系助理教授
楊曉杏博士,資訊科學系助理教授
盧葦麟教授,資訊科學系教授兼系主任
深圳職業技術大學
黃子茵博士,人工智能本科學院
香港理工大學
陳銳霖教授,電機及電子工程學系副教授兼系副主任
部分作者及論文照片

我們提出的FashLoRA-SigLIP,(a)文字到圖像(T2I)檢索,以及(b)視圖到視圖(V2V)檢索。

我們提出的兩階段自適應框架 FashLoRA-SigLIP 用於多模態服裝檢索。

口頭報告

最佳口頭報告獎
