人大信息学院 金琴 教授
报告生成时间: 2026年8月
个人主页: https://www.jin-qin.com/ | 实验室主页:https://www.ruc-aim3.com/ | 学院师资页:http://info.ruc.edu.cn/jsky/szdw/ajxjgcx/jsjkxyjsx1/js2/260ab5295d334a67beb7620e931268b1.htm DBLP: https://dblp.org/pid/47/2670.html (pid 47/2670,ORCID 0000-0001-6486-6020) Google Scholar: 引用超过8000次(据学院招生宣传资料,2025年前后),个人 Profile 链接未能从公开检索中确认,不列具体 ID
一、学者基本信息
金琴,女,中国人民大学信息学院教授、博士生导师,计算机科学与技术系,创建并领导 AI·M³(Multi-level Multi-aspect Multi-modal)多媒体计算实验室。主要研究领域为多媒体智能计算与人机交互,近年研究重心为多模态大模型、视觉/视频描述生成、多模态情感计算、语音与歌声处理、具身智能等。其团队蝉联多项国际权威竞赛冠军:2017—2024年 NIST TRECVID 视频描述生成(VTT)冠军(实验室主页口径;人大官网教师页记为2017—2019蝉联)、2018—2020年 CVPR ActivityNet Dense Video Captioning 冠军、2017—2019年 ACM MM Audio-Visual Emotion Challenge (AVEC) 冠军、2016—2017年 ACM MM (Video to Language) Grand Challenge 冠军、2015年 ImageCLEF (Image Sentence Generation) 冠军;另获 2017 ACM Multimedia Best Grand Challenge Paper Award、2019 ICCV VATEX Outstanding Method Award、2024 ACM MM Honorable Mention Demo Award、2019 之江杯全球人工智能大赛视频内容描述生成第一名(30万元奖金)。金琴获 2016 年 IBM SUR Award,入选 AI 2000 全球最具影响力学者(多媒体领域,2022—2024连续三年)、人工智能全球女性学者榜单。担任 CCF A 类国际会议 ACM Multimedia 2022 程序委员会主席、ACM Multimedia 2026 大会主席。近三年在 NeurIPS、ICLR、ACL、CVPR 等顶会发表论文五十余篇,发表顶级国际学术会议论文百余篇。
需要澄清的两点背景信息:(1)金琴的博士学位并非在国内获得,她于美国卡内基梅隆大学(CMU)语言技术研究所(LTI)获博士(2007年),清华大学仅为本科与硕士阶段(详见第三章);(2)其领导实验室的官方名称为 AI·M³ 多媒体计算实验室,公开资料中未检索到"语音与语言计算实验室"这一名称。
教育与工作经历
| 时间 | 机构 | 职位/学位 | 导师/合作导师 |
|---|---|---|---|
| 2013.01—至今 | 中国人民大学信息学院 | 教授、博士生导师 | — |
| 2012.04—2012.12 | IBM中国研究院 | 研究员 | — |
| 2008.06—2012.03 | 美国卡内基梅隆大学 | 研究员、教师 | — |
| 2007.02—2008.05 | 美国卡内基梅隆大学 | 博士后 | — |
| 1999.08—2007.01 | 美国卡内基梅隆大学计算机学院语言技术研究所(LTI) | 博士(Language and Information Technologies) | 博士导师公开资料未明确披露(实验室为 Alex Waibel 创立的 ISL/interACT,详见第三章) |
| 1991.09—1999.01 | 清华大学计算机科学与技术系 | 学士(1996)、硕士(1999) | 公开资料未披露 |
研究方向
- 多模态大模型与视觉语言理解:视频描述生成、电影解说、长视频理解、图表理解与编辑、具身智能(VLA 模型)
- 多模态情感计算:多模态情感对话(M3ED 数据集)、情感支持对话、情感识别(AVEC 蝉联冠军)
- 语音与歌声处理:说话人识别(远场/耳语/多语种)、会议转录、歌声合成与质量评估(与 CMU/JHU 的 ESPnet 生态合作)
- 人机交互:多媒体技术、言语信息处理(讲授课程:多媒体技术、言语信息处理)
二、DBLP数据统计
身份确认
经消歧确认对应 DBLP 身份为 pid 47/2670(Qin Jin)。消歧难度较低:DBLP 中名为 "Qin Jin" 的作者仅一人有独立主页条目,其发表轨迹(1998—2003 说话人识别、2004—2008 CMU 会议转录、2013 年后中国人民大学多媒体/情感计算)与官网履历完全吻合。该 pid 记录数庞大且时间跨度28年(1998—2026),机构演进(清华→CMU→IBM→人大)在论文合作者序列中得到一手证据支持。
DBLP发表记录统计
据 DBLP 记录(截至2026年8月,pid 47/2670),共收录 343条 记录,其中剔除 arXiv(CoRR)预印本后的正式发表约 227篇。其官网/系友介绍声称"发表顶级国际学术会议论文百余篇",与 DBLP 正式发表数基本一致。
按年份分布(全部记录,含 CoRR):
| 时期 | 论文数(含CoRR) | 特征 |
|---|---|---|
| 1998—2003 | 9篇 | 清华硕士尾期+CMU早期:说话人识别(ICSLP/INTERSPEECH/ICASSP)、SuperSID 项目 |
| 2004—2008 | 13篇 | CMU 阶段:会议转录、远场说话人识别、CLEAR/CVPR 多模态身份识别 |
| 2009—2013 | 17篇 | 过渡期:IBM 中国研究院相关研究 |
| 2014—2018 | 63篇 | 入职人大后多媒体方向起步:图像/视频标注、暴力检测、情绪识别 |
| 2019—2021 | 82篇 | 爆发期:视频描述生成(TRECVID/ActivityNet 冠军产出)、情感对话 |
| 2022—2026 | 159篇 | 高产期:ACL/MM/NeurIPS 大模型方向,单年峰值52篇(2024) |
正式发表的主要会议/期刊分布(剔除 CoRR):ACM Multimedia 30篇、INTERSPEECH 24篇、ACL 主会 16篇、ICASSP 14篇、AAAI 8篇、CVPR 8篇、TRECVID 评测报告 7篇、ICMR 6篇、MediaEval 6篇、NeurIPS 5篇、IEEE Trans. on Multimedia 4篇、EMNLP(含 Findings)7篇、ICME/ISCSLP 各4篇等。2025—2026年亮点:ACL 2025 主会5篇长文+Findings 3篇(学院新闻一手确认),NeurIPS 2025 三篇(WritingBench、EgoDTM、Time-R1),ICML/ICLR/ICCV 2025 各1篇。
核心合作者统计(基于 DBLP 全量记录解析,含 CoRR)
| 合作者 | DBLP pid | 合作次数 | 合作年份 | 身份/所属机构 |
|---|---|---|---|---|
| Shizhe Chen(陈师哲) | 153/0734 | 75 | 2014—2024 | 博士生(2015/2020届人大本博,现法国 Inria 博士后,百度奖学金全球10人) |
| Liang Zhang | 50/6759 | 35 | 2021—2026 | 实验室成员(推测为学生,多篇与阿里通义联合署名) |
| Jiatong Shi | 229/3529 | 30 | 2020—2026 | 博士生(推测),语音/歌声合成方向,与 CMU/JHU Watanabe 团队深度合作 |
| Anwen Hu(胡安文) | 249/1182 | 30 | 2020—2025 | 阿里巴巴通义实验室(mPLUG 系列第一作者) |
| Jinming Zhao(赵金明) | 121/8902 | 29 | 2017—2025 | 博士生(推测),M3ED 数据集第一作者 |
| Sipeng Zheng(郑思鹏) | 251/3691 | 26 | 2019—2026 | 博士生(2018级直博生,VRDFormer 第一作者) |
| Wenxuan Wang(王文轩) | 203/1536-1 | 23 | 2017—2026 | 实验室青年教师(2024年香港中文大学博士,师从吕荣聪) |
| Yuning Wu | 301/4852-1 | 23 | 2022—2025 | 学生(推测),WritingBench 第一作者 |
| Yuqing Song | 222/3101 | 22 | 2018—2023 | 学生(推测) |
| Jia Chen | 99/6879-1 | 22 | 2013—2021 | 学生(推测),CVPR 2020 两篇第一作者 |
| Tanja Schultz | s/TanjaSchultz | 22 | 2002—2011 | CMU 阶段核心合作者/实际指导者,现任汉堡大学教授 |
| Zihao Yue(岳子豪) | 339/2864 | 19 | 2022—2026 | 学生(推测),Movie101v2 共同一作 |
| Alexander G. Hauptmann | h/AlexanderGHauptmann | 17 | 2005—2021 | CMU LTI 教授,Informedia 项目负责人 |
| Xirong Li(李锡荣) | 58/5856 | 17 | 2013—2016 | 人大信息学院教授,同事 |
| Jieping Xu(许洁萍) | 96/979 | 16 | 2013—2016 | 人大信息学院计算机系副教授(已荣退),同事 |
| Yuxun Tang | 358/9271 | 16 | 2024—2026 | 学生/合作者(推测),歌声评估方向 |
| Boshen Xu | 293/8958 | 15 | 2023—2026 | 学生(推测),ICLR 2025 第一作者 |
| Yida Zhao | 222/2669 | 15 | 2018—2022 | 学生(推测) |
| Ziheng Wang | 79/10743 | 14 | 2022—2026 | 学生(推测) |
| Dingyi Yang(杨丁一) | 266/2264 | 14 | 2023—2026 | 学生(推测),LongStoryEval 第一作者 |
| Linli Yao | 262/6579 | 13 | 2019—2026 | 学生/企业合作者(推测,Time-R1 署名含小米) |
| Fei Huang(黄非) | h/FeiHuang-2 | 13 | 2021—2025 | 阿里巴巴达摩院/通义实验室 |
| Zhaopei Huang | 305/3439 | 12 | 2021—2026 | 学生(推测) |
| Ye Wang | 44/6292 | 12 | 2024—2026 | 学生/合作者(推测),具身智能方向 |
| Shinji Watanabe | 39/3245-1 | 12 | 2022—2024 | CMU/JHU 教授,语音处理权威 |
| Tao Qian | 05/5638 | 12 | 2022—2024 | 语音方向合作者(身份待核,与 Jiatong Shi 系论文相关) |
| Ludan Ruan | 262/6356 | 12 | 2020—2023 | 学生(推测) |
| Ruichen Li | 231/3910 | 12 | 2018—2022 | 学生(推测) |
| Tiezheng Ge(葛铁铮) | 135/4944 | 11 | 2023—2026 | 阿里巴巴通义实验室 |
| Yuqi Liu | 35/9071-3 | 10 | 2022—2026 | 学生(推测) |
| Ming Yan(严明) | 51/5332-8 | 10 | 2023—2025 | 阿里巴巴通义实验室 |
| Ji Zhang(张骥) | 86/1953-11 | 10 | 2023—2025 | 阿里巴巴通义实验室 |
| Ruihua Song(宋睿华) | s/RuihuaSong | 9 | 2019—2024 | 人大高瓴人工智能学院长聘副教授,校内同事 |
| Jianlong Fu(付强) | 83/8692 | 9 | 2019—2023 | 微软亚洲研究院主任研究员 |
| Yuchen Liu | 69/10440-3 | 9 | 2021—2023 | 学生(推测) |
| Junwei Liang(梁俊卫) | 62/10704-1 | 9 | 2014—2018 | 学生(推测),后赴海外科研机构 |
| Alex Waibel | 08/2456 | 6 | 2000—2007 | CMU/KIT 教授,ISL/interACT 实验室创始人 |
| Florian Metze | 26/1652 | 6 | 2004—2012 | CMU LTI 教授 |
| Kornel Laskowski | 98/2383 | 7 | 2002—2011 | CMU ISL 成员 |
| Haizhou Li(李海洲) | 36/4118-1 | 5 | 2009—2022 | 新加坡国立大学/香港中文大学(深圳)教授,语音权威 |
| Wayne Xin Zhao(赵鑫) | 52/8700 | 5 | 2021—2023 | 人大高瓴人工智能学院教授 |
| Zhiwu Lu(卢志武) | 53/5234 | 5 | 2021—2023 | 人大高瓴人工智能学院教授 |
| Zongqing Lu(卢宗青) | 99/965-2 | 7 | 2024—2026 | 清华大学教授,具身智能 |
| Shenghua Bao / Zhong Su | 31/529 等 | 各5—13 | 2013—2016 | IBM 中国研究院时期合作者;Gang Yang(杨刚,13次,2013—2016)实为人大信息学院同事(另见本系列杨刚报告),非 IBM 合作者 |
| Qi Wu | 96/3446-1 | 5 | 2019—2020 | 阿德莱德/莫纳什大学教授 |
| Jiaya Jia(贾佳亚)、Bei Yu(于蓓) | — | 各~7 | 2025 | 香港中文大学/南方科技大学(RTime-QA 合作) |
三、博士教育背景
本科与硕士阶段(清华大学计算机系,1991—1999年)
金琴1991年至1999年在清华大学计算机科学与技术系先后获得学士(1996年)与硕士(1999年)学位。其可追溯的最早论文是1998年 ICSLP 论文 "A high-performance text-independent speaker identification system based on BCDM"(与 Luo Si、Qixiu Hu 合作),主题即文本无关说话人识别,说明其清华阶段已进入语音处理方向。清华阶段导师姓名公开资料未披露(是否为吴文虎、王作英等清华语音方向教授无法从一手来源核实,本报告不作认定)。
博士阶段(卡内基梅隆大学 LTI,1999—2007年)
金琴1999年8月赴 CMU 计算机学院语言技术研究所(LTI)攻读博士,2007年1月获 Language and Information Technologies 博士学位,随后在 CMU 从事博士后(2007—2008)并任研究员、教师(2008—2012)。
其博士及博士后期间的研究平台是 Alex Waibel 创立的 Interactive Systems Labs(ISL)/interACT 联合实验室,DBLP 一手证据显示:
- 与 Tanja Schultz 合作22篇(2002—2011),包括多语种音素串说话人识别(ICASSP/INTERSPEECH 2002)、远场说话人识别(ICASSP 2006、IEEE Trans. Speech Audio Process. 2007 "Far-Field Speaker Recognition",其博士论文主题方向的直接产出)、耳语说话人识别(ICME 2007)、语音变换对说话人识别的攻击(ICASSP 2008)等—— Schultz 是其实际的学术指导合作者,现任汉堡大学教授;
- 与实验室创始人 Alex Waibel 合作6篇(2000—2007),包括其最早的 CMU 论文(2000年 INTERSPEECH 两篇说话人识别);
- 参与 CMU ISL 会议转录系统(2004年 ICASSP,ISL rich transcription system)、CLEAR 评测多模态身份识别(2006/2007,与 Karlsruhe 的 Rainer Stiefelhagen 合作)、MIT 林肯实验室主导的 SuperSID 高层信息说话人识别项目(2003年 ICASSP);
- 与 Alexander Hauptmann 的合作始于 CMU Informedia 团队的 TRECVID 2005 评测,并延续至其回国之后(累计17篇,2005—2021)。
博士导师的正式认定: 金琴的个人主页与人大官网均未明文列出博士导师姓名。从论文署名结构看,其博士训练在 Waibel 实验室完成,Tanja Schultz 为持续多年的第一线合作者;由于 CMU LTI 博士论文的正式导师记录(论文扉页/导师署名)未能在公开渠道检索到,本报告将导师认定为"公开资料未披露,工作归属 Alex Waibel 的 ISL/interACT 实验室,Tanja Schultz 为核心指导合作者(推断)"。
需要指出:任务背景中"博士毕业于清华大学、导师可能为吴文虎或王作英"的信息不成立——多个一手来源(人大官网、个人主页、清华计算机系2025级研究生开学典礼系友介绍)一致确认其博士学位来自 CMU。
四、导师/师承分析
师承谱系
Alex Waibel(CMU/KIT 教授,ISL/interACT 实验室创始人,语音翻译先驱)
│ 实验室培养(博士导师正式记录未公开披露)
├── 金琴(博士,2007届,CMU LTI)
│ ├── CMU阶段核心指导合作者:Tanja Schultz(时为CMU资深研究员,现任汉堡大学教授,22篇合作)
│ ├── CMU阶段重要合作导师:Alexander G. Hauptmann(CMU LTI教授,Informedia,17篇合作)
│ └── 中国人民大学信息学院 教授,AI·M³ 多媒体计算实验室负责人
│ ├── 陈师哲(博士,2020届)→ 法国 Inria 博士后,百度奖学金全球10人
│ ├── 王文轩(实验室青年教师,2024年港中文博士,师从吕荣聪;2017年起与金琴合作23篇)
│ ├── 郑思鹏(2018级直博生,CVPR 2022 第一作者)
│ ├── Jiatong Shi(博士生,语音/歌声方向,与 JHU Watanabe 团队合作12篇)
│ ├── 赵金明(博士生,M3ED 多模态情感对话数据集第一作者)
│ └── 杨丁一、岳子豪、梁雨鹭、Yichen Xu 等当前在读学生群
└── (Waibel 门下其他成员构成其 CMU 学术网络:Tanja Schultz、Florian Metze、Kornel Laskowski 等)
分析:金琴的师承网络具有鲜明的"CMU 语音学派"基因——Waibel 实验室是语音识别与多语言语音翻译的奠基性团队,这解释了金琴研究中的两条主线:其一,语音处理技术功底(说话人识别、会议转录、言语信息处理课程);其二,评测驱动的科研方法论(其团队回国后连续蝉联 TRECVID/ActivityNet/AVEC 等国际评测冠军,与 CMU 时期参与 TRECVID/CLEAR 评测的训练一脉相承)。与 Alexander Hauptmann 的长期合作(直至2021年)也使她的网络与 CMU Informedia 视频检索学派保持连接。
五、现单位团队与核心合作者
AI·M³ 实验室团队
据人大信息学院官网(2024—2025年前后),AI·M³ 实验室包括约7名博士生、15名硕士生及若干本科生。核心团队成员(依据 DBLP 合作频次与学院新闻交叉确认):
| 姓名 | 角色确认 | 研究方向 | 备注 |
|---|---|---|---|
| 王文轩 | 实验室青年教师(学院新闻确认) | AI 大模型、长视频理解 | 2024年香港中文大学博士(导师吕荣聪),ACM 杰出论文奖,谷歌引用2000+;2024年加入人大 |
| 陈师哲 | 博士毕业生(2020届,本博均人大) | 具身智能、视觉语言 | 百度奖学金全球10人(唯一女性),现法国 Inria 博士后,75篇合作(全网络最高) |
| 郑思鹏 | 博士生(2018级直博) | 视频关系检测、视觉语言 | CVPR 2022 VRDFormer 第一作者 |
| 赵金明 | 博士生(推测) | 多模态情感对话 | ACL 2022 M3ED 数据集第一作者 |
| Jiatong Shi | 博士生(推测) | 语音合成、歌声合成 | Muskits/ESPnet-Codec 工具链、Interspeech 2024 Challenge 组织者之一 |
| 杨丁一、岳子豪、梁雨鹭、Yichen Xu、Jianzhe Ma、Ziheng Wang、Boshen Xu、Zhaopei Huang、张业鹏、王子恒 | 学生(推测) | 长故事评测、电影解说、图表编辑、具身智能 | ACL 2025 主会5篇长文的学生第一作者群 |
人大校内同事合作
| 姓名 | 院系 | 合作次数 | 年份 | 关系定位 |
|---|---|---|---|---|
| 李锡荣 | 人大信息学院教授 | 17 | 2013—2016 | 同事,多媒体检索方向,建组初期共同参赛 ImageCLEF/MediaEval |
| 许洁萍(Jieping Xu,DBLP 记录 96/979) | 人大信息学院副教授(已荣退) | 16 | 2013—2016 | 同事,早期联合发表 |
| 宋睿华 | 高瓴人工智能学院长聘副教授 | 9 | 2019—2024 | 校内同事,文本生成方向 |
| 赵鑫 | 人大高瓴人工智能学院教授 | 5 | 2021—2023 | 跨院合作,大模型评测(WritingBench 相关) |
| 卢志武 | 高瓴人工智能学院教授 | 5 | 2021—2023 | 校内同事,机器学习方向 |
跨机构学术合作者
| 合作者 | 机构 | 合作次数 | 领域 |
|---|---|---|---|
| Shinji Watanabe | CMU→JHU 教授 | 12 | 语音/歌声处理,ESPnet 生态,Muskits、Interspeech 2024 挑战赛 |
| Alexander G. Hauptmann | CMU LTI | 17 | 多媒体检索、TRECVID |
| Tanja Schultz | 汉堡大学(前 CMU) | 22 | 说话人识别(历史合作) |
| Zongqing Lu(卢宗青) | 清华大学 | 7 | 具身智能(Being-H0、MotionCtrl、ICML 2025 Scaling Large Motion Models) |
| Jiaya Jia(贾佳亚)/ Bei Yu(于蓓) | 港中文/南方科技大学 | ~7 | 多模态时序理解(RTime-QA) |
| Jianlong Fu(付强)/ Bei Liu | 微软亚洲研究院 | 各~7—9 | 图文生成、视频 |
| Haizhou Li(李海洲) | NUS/港中深 | 5 | 语音 |
| Qi Wu | 莫纳什大学教授(前阿德莱德) | 5 | 图像描述生成(CVPR 2020 合作) |
| 徐侃(Xuankai Chang) | JHU→清华 | 4 | 语音处理 |
六、业界合作关系深度分析
金琴团队的产学研合作呈现"基础研究+大模型落地"双线特征,与语音/大模型产业的绑定主要通过阿里通义、小米、IBM 三条渠道,腾讯与微软亦有历史合作。
1. 阿里巴巴(达摩院/通义实验室)
合作深度:★★★★★(当前最密集的产业合作,多篇顶会联合论文)
DBLP 显示与阿里系研究者的联合署名超过70篇次,核心合作者包括 Anwen Hu(30篇)、Fei Huang(13篇)、Ming Yan(10篇)、Ji Zhang(10篇)、Tiezheng Ge(11篇)、Haiyang Xu(8篇)、Jiabo Ye(6篇)等,代表性成果:
| 论文 | 会议 | 阿里方主要合作者 | 内容 |
|---|---|---|---|
| mPLUG-DocOwl2: High-resolution Compressing for OCR-free Multi-page Document Understanding | ACL 2025 | Anwen Hu, Haiyang Xu, Ming Yan, Ji Zhang, Fei Huang, Jingren Zhou | 多页文档理解 |
| WritingBench: A Comprehensive Benchmark for Generative Writing | NeurIPS 2025 | Yuning Wu, Ming Yan, Ji Zhang, Fei Huang | 生成式写作评测基准 |
| VC4VG: Optimizing Video Captions for Text-to-Video Generation | EMNLP 2025 | Tiezheng Ge, Bo Zheng 等 | 视频描述优化 |
| MCSC-Bench(多模态剧本创作) | arXiv 2026 | Tiezheng Ge | 视频内容生产 |
| Mem-PAL(长期个性化对话助手) | AAAI 2026 | Tiezheng Ge, Xubin Li | 记忆型对话智能体 |
阿里达摩院/通义实验室是金琴团队大模型评测与多模态文档理解方向最主要的产业伙伴,合作自2020年(mPLUG 前身工作)延续至今,产出覆盖 ACL/EMNLP/AAAI/NeurIPS 全部主流 CCF A 场会议。注:合作者身份归属为论文署名模式推断,除 mPLUG 系列外未逐一核实机构标注。
2. 小米(小米 AI 实验室)
合作深度:★★★★☆(2024年起快速深化的长视频理解合作)
核心合作者 Jianzhong Ju(须嘉忠)、Jian Luan(栾剑)、Zhenbo Luo、Linli Yao、Jiaze Li、Zihan Xiao 等(小米 AI 实验室语音与大模型团队),代表性成果:
| 论文 | 会议 | 内容 |
|---|---|---|
| Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding | NeurIPS 2025 | 时序视频定位的强化学习后训练 |
| TimeZero: Temporal Video Grounding with Reasoning-Guided LVLM | arXiv 2025 | 推理引导的时序定位 |
| TimeViper: A Hybrid Mamba-Transformer Vision-Language Model for Efficient Long Video Understanding | arXiv 2025 | 长视频高效理解 |
| StreamPro: From Reactive Perception to Proactive Decision-Making in Streaming Video | arXiv 2026 | 流式视频主动决策 |
| VC4VG / Mem-PAL | EMNLP 2025 / AAAI 2026 | 与阿里团队交叉合作 |
(注:Jianzhong Ju、Jian Luan 为小米 AI 实验室研究员,属公开常识性事实;具体论文的机构标注未逐一核实,标记为高置信推断。)
3. IBM
合作深度:★★★☆☆(雇佣关系+评测合作+奖项,历史合作)
- 2012年4月—12月任 IBM 中国研究院研究员(官网一手确认);
- 2013—2016年与 Shenghua Bao、Zhong Su 等 IBM 研究员联合发表约20余篇论文(多媒体标注、语音情感、音频事件检测方向);
- 2016年获 IBM SUR Award(Faculty Award 类合作资助);
- 其"Spoken English Assistant"系统曾获 IBM Bluemix 计算竞赛二等奖(实验室主页确认)。
4. 腾讯与微软
- 腾讯:2015年 "RUC-Tencent at ImageCLEF 2015" 联合参赛(一手论文证据);青年教师王文轩博士期间曾在腾讯 AI Lab 实习(学院招生宣传确认)。
- 微软亚洲研究院:与 MSRA 主任研究员 Jianlong Fu、Bei Liu 合作约10余篇(2019—2023,图文/视频生成);学生陈师哲博士期间曾访问 MSRA。
5. 学生产业与海外去向
代表性博士毕业生去向:陈师哲(2020届,法国 Inria 博士后,具身智能);梁俊卫(2018年前后毕业,海外科研机构);Jiatong Shi 与 JHU/CMU 语音生态深度绑定。团队研究主题(长视频理解、多模态文档理解、语音合成评测、对话智能体)与阿里、小米、字节等大模型厂商的业务需求高度对接。
6. 需要澄清的背景信息
任务背景中提到"语音识别系统在 Blizzard/IWSLT 等国际评测中获奖"——公开资料未检索到金琴团队在 Blizzard Challenge 或 IWSLT 的获奖记录。其一手可查的评测获奖记录为:TRECVID VTT(2017—2024蝉联,实验室主页口径;人大官网记2017—2019蝉联)、ActivityNet Dense Captioning(2018—2020蝉联)、AVEC(2017—2019蝉联)、ACM MM Grand Challenge(2016—2017蝉联)、ImageCLEF 2015、VATEX 2019(ICCV Outstanding Method)、之江杯 2019 等;其 CMU 时期的评测经历为 TRECVID(Informedia 团队)与 CLEAR。语音方向的现状体现为歌声合成/质量评估(与 Watanabe 团队的 Muskits、Interspeech 2024 Challenge)而非语音识别评测。
七、Connection 圈层总结
第一圈层(自主培养团队与实验室双核): AI·M³ 实验室是金琴网络的绝对核心。最紧密的学术关系是其博士生陈师哲(75篇合作,全网络最高频)——2020年毕业后仍以 Inria 博士后身份持续合作至2024年。2024年引入的青年教师王文轩(港中文吕荣聪门下,23篇合作,且合作可追溯至2017年其人大就读时期)标志着实验室进入"金琴+王文轩"双 PI 阶段,2025—2026年 ACL/AAAI/NeurIPS 的密集产出多由王文轩主导的图表理解、个性化对话、长视频方向贡献。
第二圈层(CMU 师承网络): Waibel 实验室体系(Tanja Schultz 22篇、Alex Waibel 6篇、Florian Metze 6篇、Kornel Laskowski 7篇、Alexander Hauptmann 17篇)是金琴的学术根基。其中与 Hauptmann 的合作跨越16年(2005—2021),从 CMU Informedia 的 TRECVID 评测延续到人大团队的视觉语言研究;与 Schultz 的合作集中于其 CMU 时期(2002—2011)。当前与 Shinji Watanabe(CMU/JHU)的合作(2022—2024,12篇)延续了 CMU 语音学派在歌声处理方向的连接。
第三圈层(国内学术同事): 人大信息学院内部与李锡荣(17篇)、杨刚(13篇)及高瓴学院宋睿华(9篇)、卢志武(5篇)、赵鑫(5篇)构成校内合作网;与清华卢宗青(7篇,2024—2026)的具身智能合作是当前扩展最快的新方向。曾任 ACM MM 2022 程序委员会主席、ACM MM 2026 大会主席的行业角色进一步扩展其学术服务网络。
第四圈层(产业合作网络): 阿里通义实验室(累计联合署名70+篇次,mPLUG/WritingBench 系列)与小米 AI 实验室(2024年起 Time-R1/TimeZero/TimeViper 长视频系列)是当前两大产业支柱;IBM(2012年任职+2016 SUR Award)为历史合作;腾讯、微软亚洲研究院为辅助渠道。合作模式以联合论文与评测基准共建为主,与任务背景中"讯飞、字节"的合作未检索到一手证据。
产出规模与趋势: DBLP 收录343条记录(正式发表约227篇),2022—2026四年产出159条,单年峰值52篇(2024),是产出体量与增长速度在人大信息学院各团队中居前列的实验室。研究主线从 CMU 时期的说话人识别(1998—2008),经多媒体评测冠军期(2014—2021,视频描述生成/情感计算),演进至当前的多模态大模型与具身智能(2022—今)。
八、数据来源与局限性说明
本报告主数据来自 DBLP 官方作者记录(pid: 47/2670,2026年8月抓取的全量 XML,共343条记录),通过程序化解析统计合著频次、年份分布与会议分布。结合以下一手信息源:
- 中国人民大学信息学院官网金琴教授师资页(教育与工作经历、科研项目、获奖记录)
- 人大信息学院官网"多媒体计算实验室"(AI·M³)页面(团队规模、评测获奖记录)
- 个人主页 www.jin-qin.com(学位年份、实验室名称)
- 人大信息学院官网新闻(ACL 2022/ACL 2025 录用报道,确认赵金明、杨丁一、岳子豪、张业鹏、王子恒等学生作者及王文轩的背景)
- 清华大学计算机系官网(2025级研究生开学典礼系友代表介绍,确认 ACM MM 2022 程序委员会主席、2026 大会主席等社会任职)
- 搜狐/知乎等渠道的 AIM3 实验室招生宣传(陈师哲、王文轩履历细节,谷歌学术引用8000+,AI 2000 学者称号)
主要局限性:
- 博士导师未正式确认:CMU LTI 博士论文的正式导师(扉页署名)未能在公开渠道检索到,本报告仅依据论文署名结构认定其属 Alex Waibel 的 ISL/interACT 实验室、Tanja Schultz 为核心指导合作者,属高置信推断而非官方记载;
- 清华阶段导师未披露:本硕导师姓名公开资料无记载;
- 学生身份多为"推测":DBLP 不含角色信息,仅陈师哲、郑思鹏、赵金明等少数学生经学院新闻一手确认;
- 产业合作者(阿里通义、小米等)的机构归属系依据合作者公开身份与署名模式推断,除 mPLUG 系列外未逐篇核对论文机构标注;任务背景提及的讯飞、字节、Blizzard/IWSLT 均未检索到一手证据;
- Google Scholar Profile 链接未能确认,引用数据(8000+)引自学院招生宣传等二手来源;
- DBLP 记录含约116条 arXiv 预印本(可能与正式发表重复计数),正式发表数约227篇为剔除 CoRR 后的估计值。