MSAAI 学生的研究成果发表:参数高效的多源自适应多模态服装检索

我们很高兴与您分享我们最近的国际会议论文《参数高效的多源自适应多模态服装检索》,该论文由我们的 MSAAI 学生刘袁柳撰写,并已被2026年人工智能与机电自动化国际学术会议(AIEA 2026)接收:

  • Yuanliu Liu, Harris Sik-Ho Tsang, Richard Tai-Chiu Hsung, Tony Yulin Zhu, Xiaoxing Yang, Wai-Lun Lo, Ziyin Huang, Yui-Lam Chan, “Parameter-Efficient Multi-Source Adaptation for Multimodal Fashion Retrieval,” International Conference on Artificial Intelligence and Electromechanical Automation (AIEA), Shenzhen, China, Jun. 2026.

论文摘要

当我们尝试用文字描述或随意街拍来搜寻衣服时,线上网购平台往往很难精准命中,这是因为传统 AI 难以跨越「现实生活照」与「专业影棚模特儿照」之间的巨大视觉落差。为了克服这个痛点,我们开发了 FashLoRA-SigLIP —— 一个智能的两阶段 AI 系统。首先,我们透过海量的多元风格数据集,训练出一个强大的「时尚大脑」,使其能跨越不同视角精准识别服装;接着,当应用到新的电商平台时,我们无需重新训练整个庞大的大模型,而是采用轻量化的「低秩自适应(LoRA)」策略,仅需更新模型 5.6% 的核心参数。在业界标准数据集上的实测表明,此方法的表现显著优于传统模型,不仅大幅提升了「以图搜图(消费者生活照)」的查找准确率,更为电商平台省下了巨额的计算成本。

在本次会议上,我们获得了最佳口头报告奖。香港珠海学院始终致力于支持学生的研究工作,鼓励他们在国际会议和期刊上发表论文。更多论文即将发表!

 

研究团队成员

香港珠海学院

刘袁柳先生,资讯科学系硕士生

曾锡豪博士,资讯科学系助理教授

熊体超博士,资讯科学系副教授

朱禹林博士,资讯科学系助理教授

杨晓杏博士,资讯科学系助理教授

卢苇麟教授,资讯科学系教授兼系主任

 

深圳职业技术大学

黄子茵博士,人工智能本科学院

 

香港理工大学

陈锐霖教授,电机及电子工程学系副教授兼系副主任

 

部分作者及论文照片

我们提出的FashLoRA-SigLIP,(a)文本到图像(T2I)检索,以及(b)视图到视图(V2V)检索。

我们提出的两阶段自适应框架 FashLoRA-SigLIP 用于多模态服装检索

口头报告环节

最佳口头报告奖

ADMISSION