中国人民大学 多媒体与语音计算团队教师学术关系网络报告
报告生成时间:2026年8月
团队简介
中国人民大学信息学院的多媒体与语音计算方向由两支互补的实验室构成。AI·M³(Multi-level Multi-aspect Multi-modal)多媒体计算实验室由金琴教授(清华本硕、CMU LTI 博士,师承 Waibel 学派)创建并领导,研究重心为多模态大模型、视频描述生成、多模态情感计算、语音与歌声处理及具身智能,团队在 NIST TRECVID 视频描述生成(VTT,2017—2021 年间多次夺冠,实验室主页口径)、CVPR ActivityNet Dense Video Captioning、ACM MM Grand Challenge 等国际权威竞赛中屡获冠军,金琴本人担任 ACM Multimedia 2022 程序委员会主席与 ACM Multimedia 2026 大会主席。AIMC 实验室由李锡荣教授(清华本硕、阿姆斯特丹大学 ISLA 博士,Cees Snoek 门下)领导,聚焦多媒体检索与医学影像智能分析(病理图像、显微图像),曾在 ImageCLEF/MediaEval 评测中取得佳绩。
两位教授麾下还有两位中坚教师:刘桃副教授(哈工大王晓龙团队出身,中文信息处理与多模态"听音辨貌"方向,与杜小勇保持十余年的长期合作)和杨刚副教授(山东大学本硕、日本富山大学博士,郑唐门下,图像质量评价与遥感/文档图像方向)。已荣退的许洁萍副教授(中科院声学所博士)是团队语音方向的早期成员。团队研究主线覆盖从底层多媒体检索、语音信号处理到多模态大模型与具身智能的完整谱系。
报告文件列表
| 文件 | 姓名 | 职位 | 报告重点 |
|---|---|---|---|
| ruc_mm_jinqin_network.md | 金琴 | 教授、博导 | AI·M³ 实验室负责人,CMU Waibel 学派,TRECVID 冠军团队,ACM MM 2026 大会主席 |
| ruc_mm_xirongli_network.md | 李锡荣 | 教授(2022年起) | AIMC 实验室负责人,阿姆斯特丹 Snoek 门下,医学影像与多媒体检索 |
| ruc_mm_liutao_network.md | 刘桃 | 副教授 | 哈工大中文信息处理谱系,听音辨貌与文本表示学习 |
| ruc_mm_yanggang_network.md | 杨刚 | 副教授 | 富山大学郑唐门下,图像质量评价与中日合作网络 |
研究方向与圈层结构概述
团队网络以"国际师承+评测驱动+产业落地"三重纽带组织。第一重是国际师承:金琴出自 CMU LTI 的 Waibel/Informedia 体系(与 Hauptmann 合作跨越16年、Tanja Schultz 22篇),当前延续与 Shinji Watanabe(CMU/JHU)的语音合作;李锡荣出自阿姆斯特丹大学 Cees Snoek 的 ISLA 组(30篇合作)。第二重是评测共同体:从 ImageCLEF、MediaEval、TRECVID 到 ACM MM Grand Challenge,两间实验室在 2013—2021 年间形成了"金琴—李锡荣—许洁萍"的联合参赛核心(金琴与李锡荣17篇合作),杨刚与刘桃则在各自的图像质量与文本表示方向嵌入国际评测网络。第三重是产业网络:金琴团队与阿里巴巴通义实验室(mPLUG/WritingBench 系列,累计联合署名70余篇次)和小米 AI 实验室(2024年起长视频理解系列)构成当前两大支柱,IBM(SUR Award)为历史合作;李锡荣团队的医学影像方向则与医疗 AI 产业对接。
校内网络方面,团队与高瓴人工智能学院(宋睿华、卢志武、赵鑫)保持跨院合作,与 DEKE 数据库团队通过杜小勇(刘桃37篇合作、金琴与李锡荣各有若干)形成"数据库×多媒体"的交叉纽带。
产业转化与人才培养亮点
团队产业合作的标志性模式是"评测冠军→大模型研发"的演进路径:金琴团队在 TRECVID/ActivityNet 评测期积累的视频理解技术,直接转化为 2022 年后与阿里通义(mPLUG 系列)、小米(Time-R1/TimeZero 长视频系列)的联合研发;歌声处理方向通过 Muskits 开源工具与 Interspeech 2024 Challenge 进入国际语音生态。人才培养上,代表性毕业生包括陈师哲(Inria 博士后,具身智能)、梁俊卫、Jiatong Shi(JHU/CMU 语音生态)等,2024 年引入的青年教师王文轩(港中文吕荣聪门下)使 AI·M³ 进入"金琴+王文轩"双 PI 阶段,2025—2026 年在 ACL/AAAI/NeurIPS 保持密集产出。
报告生成时间:2026年8月