返回首页
您的位置:首页 > 会员活动

CCF广东工业大学学生分会举办 “基于语义对齐的多媒体描述生成”学术讲座

阅读量:0 2026-07-08 收藏本文

CCF广东工业大学学生分会于2026年6月18日(周四)下午成功举办了主题为“基于语义对齐的多媒体描述生成”的学术讲座。广东工业大学“青年百人计划”高层次人才、讲师罗剑杰博士应邀为计算机学院师生作学术报告。


罗剑杰博士师从朝红阳教授、冯剑琳教授及梅涛院士,长期致力于计算机视觉、多模态机器学习及多媒体分析等方向的前沿研究,参与国家级科研项目2项。其相关研究成果已落地应用于京东智能客服、平安银行表格智能问答等产品。近年来,罗博士聚焦以视觉内容为中心的多模态学习,在视觉理解、生成与鉴伪等关键问题上持续探索,累计在CVPR、ECCV、ACM Multimedia、IEEE TCSVT等国际权威会议与期刊上发表论文十余篇。


本次讲座中,罗剑杰博士围绕多媒体描述生成技术展开分享。他首先介绍了图像、视频等多媒体内容快速增长的背景,指出多媒体描述生成能够自动生成与视觉内容相关的文本描述,在视障辅助、内容检索、智能客服等领域具有重要应用价值。同时,视觉-文本数据标注成本较高,模型跨模态语义对齐的准确性和泛化性仍有待提升,如何改良文本生成建模方式以实现快速且准确的推理,也是该领域需要解决的关键问题。


随后,罗剑杰博士以“提高跨模态语义对齐能力”为主线,按照逐步降低模型训练对人工标注视觉-文本对依赖性的逻辑,介绍了多媒体描述生成领域的四项代表性研究工作。首先,他讲解了基于显式语义对齐的扩散描述算法,通过对视觉对象、属性及关系信息进行建模,引导模型生成更加符合图像内容的描述文本。


在介绍新物体描述算法时,罗剑杰博士指出,真实开放场景中经常会出现训练阶段标注不足或未充分覆盖的新类别对象。针对这一问题,基于隐式语义对齐的方法能够利用视觉特征与文本概念之间的潜在联系,增强模型对新物体和新场景的描述能力,从而提升模型在开放环境下的泛化表现。


接着,罗剑杰博士介绍了基于隐式语义对齐的纯文本图像描述算法。他表示,当视觉-文本配对数据不足时,纯文本语料中蕴含的语言知识和语义关系可以为图像描述模型提供有效补充。通过合理利用文本侧信息,模型能够在较少人工标注的情况下学习更稳定的语言表达和语义组织方式。


报告中,罗剑杰博士还分享了基于隐式语义对齐的多模态预训练算法。他结合方法框架图,对视觉编码、文本建模和语义对齐目标之间的关系进行了说明。多模态预训练通过将图像、视频与文本映射到统一表示空间,为图像描述、视频描述、内容检索等下游任务提供了更具迁移性的基础能力。


在实验验证部分,罗剑杰博士展示了相关方法在MSCOCO、NoCaps、MSVD、MSR-VTT等主流数据集上的实验结果,并结合具体案例分析了模型生成描述的效果。他指出,语义对齐能力的提升不仅体现在评价指标上,也体现在模型能否准确抓住视觉内容中的关键对象、动作和语义关系。


讲座最后,罗剑杰博士对相关研究进行了总结。从显式语义对齐到隐式语义对齐,再到纯文本学习和多模态预训练,上述工作为降低模型对人工标注视觉-文本对的依赖、提升多媒体描述生成模型的实用性提供了方法参考。罗博士也表示,未来该方向仍需要在语义可靠性、推理效率和实际应用部署等方面继续探索。

报告结束后,现场师生围绕“跨模态语义对齐的评估方式”、“少标注条件下模型泛化能力的提升”、“多模态预训练与大模型结合的可行路径”及“多媒体描述生成技术在实际场景中的应用”等问题展开交流。通过本次讲座,师生们对多媒体描述生成领域的研究进展和未来发展方向有了更加深入的了解。