跳转至

SJTU-AudioCC听觉认知与计算声学实验室 钱彦旻 特聘研究员

报告生成时间:2026年8月25日
个人主页:Yanmin Qian / AudioCC Lab
所属团队:上海交通大学计算机学院 计算机应用研究所 / 听觉认知与计算声学实验室(AudioCC Lab,实验室负责人)


一、学者基本信息

字段 内容
姓名 钱彦旻(Yanmin Qian)
职称 特聘研究员、博士生导师(校教师名录口径;近期校方新闻与实验室官网亦见"教授"称谓,其职称演进详见下文口径说明)
所属单位 上海交通大学计算机学院计算机科学与工程系
研究所归属 计算机应用研究所
实验室职务 听觉认知与计算声学实验室(AudioCC Lab)负责人
邮箱 yanminqian@sjtu.edu.cn
人才计划 教育部长江学者特聘教授;国家优秀青年科学基金获得者;国家级高层次人才计划入选者;上海市青年英才扬帆计划
学术兼职 IEEE高级会员、ISCA会员;InterSpeech、ISCSLP等国际会议领域主席/TPC委员;IEEE T-ASLP、IEEE J-STSP、IEEE SPL等期刊审稿人
研究方向 听觉人工智能:语音识别与语音翻译、说话人与语种识别、语音增强与分离、音乐生成与理解、语音情感感知、多模态与跨模态信息处理、自然语言理解
学术成果 发表学术论文200余篇,Google Scholar引用超12000次;申请中美专利80余项;合著学术专著;Kaldi语音识别开源工具包13位创始成员之一(唯一亚洲创始成员)

消歧与姓名口径说明:"钱彦旻"的"旻"字常被误写为"钱彦敏"(女字旁)或"钱彦昊"(早期媒体转录亦出现过"钱彦昊"),均系误写,正确写法为"钱彦旻",检索文献与人名时应注意区分。

职称口径说明:据公开资料,钱彦旻在上海交通大学历任副研究员、副教授(2019年校方新闻即称"副教授")、特聘研究员。其近年部分官方与媒体材料称其为"教授",本报告H1职称按交大计算机学院教师名录口径记为"特聘研究员",职称的最新变化请以学院官网为准。

二、教育背景与职业履历

钱彦旻于2007年至2013年在清华大学攻读并获得博士学位(计算机系,语音识别方向),博士期间即深度参与国际开源项目Kaldi语音识别工具包的研发。Kaldi由Daniel Povey等人于2009年前后启动开发,钱彦旻为其13位创始成员之一,也是其中唯一的亚洲成员;该工具包此后成为国际语音识别研究与产业界事实上的标准框架之一。其博士导师姓名在公开官方资料中未明确披露,本报告不作推定。

2013年博士毕业后,他赴英国剑桥大学工程系机器智能实验室(Machine Intelligence Lab, MIL)从事博士后研究。剑桥工程系是国际语音识别研究的重镇(Phil Woodland、Mark Gales等人的语音组传统所在地,Kaldi之父Daniel Povey亦出身于此),这段经历进一步强化了其与国际语音学界核心圈的联系。

博士后出站后,钱彦旻加入上海交通大学计算机系,历任副研究员、副教授、特聘研究员。在上交期间,他长期承担思必驰—上海交大智能联合语音实验室副主任职务,推动语音技术的产业化落地;2022年前后,他创立并领导听觉认知与计算声学实验室,形成独立于俞凯X-LANCE实验室之外的另一支上交语音研究力量。需要澄清的是:钱彦旻的学术归属为AudioCC实验室(隶属计算机应用研究所),并非X-LANCE实验室或BCMI实验室成员,此前的部分报告将其与上述实验室混同,属于将"思必驰-上交联合语音实验室副主任"的行政职务误作实验室归属所致。

师承谱系树(据公开资料整理,导师关系以官方披露为准):

清华大学计算机系(博士 2013,语音识别)
└── 剑桥大学工程系 MIL(博士后 2013–2014前后)
    └── 钱彦旻
        ├── Kaldi 创始成员(2009–,与 Daniel Povey 等)
        ├── 上海交通大学:副研究员→副教授→特聘研究员
        ├── 思必驰—上交智能联合语音实验室副主任
        └── AudioCC Lab 负责人(2022前后– )

三、学生培养情况

钱彦旻在AudioCC实验室领导一支由博士生、硕士生、本科生及专职科研人员组成的三十多人研究团队。以下择要介绍公开资料可确证的代表学生。

1. 常烜恺(博士毕业生/硕士毕业生,现约翰斯·霍普金斯大学)

常烜恺本科和硕士均就读于上海交通大学,为钱彦旻指导的硕士研究生。其作为第一作者、钱彦旻作为通讯作者的论文《MIMO-Speech: End-to-End Multi-Channel Multi-Speaker Speech Recognition》获IEEE ASRU 2019唯一最佳论文奖(299篇论文中仅1篇)。2019年9月起,常烜恺赴约翰斯·霍普金斯大学语音和语言处理中心(JHU CSLP)攻读博士学位,延续上交—JHU语音研究纽带的代际传承。

2. 张王优(Wangyou Zhang,博士毕业生,2021年微软学者奖学金获得者)

张王优为钱彦旻指导的博士生(2021年"微软学者"奖学金上交计算机系唯一获得者),研究方向为音乐分离等,是ESPnet-SE工具包的共同第一作者之一,与李晨达等共同构成实验室语音增强/分离方向的中坚力量。其毕业去向以最新公开资料为准。

3. 李晨达(Chenda Li,博士毕业生,现AudioCC实验室助理研究员)

李晨达2024年在上交计算机系获博士学位后,留任AudioCC实验室任助理研究员,研究方向为语音增强与分离、通用声音分离与语音语言大模型,博士期间曾赴卡内基梅隆大学WAVLab访问。详见本系列李晨达专题报告。

4. 组内其他核心成员与新生代

据AudioCC实验室公开论文署名,Xuankai Chang、Wangyou Zhang、Leying Zhang、Haiyang Sun、Bei Liu、Tingxiao Zhou、Mengxiao Bi等均为实验室近年高频产出成员;2023级硕士生黄文(说话人验证、声学场景与事件检测方向)等见于公开学术活动介绍。实验室毕业生总体去向为国内外顶级企业和研究机构就业或深造,完整毕业生名录公开资料未系统披露。

四、学术合作网络

4.1 校内合作网络

  • 俞凯(X-LANCE实验室负责人):两人同为上交语音研究的代表性学者,曾与俞栋、邓力合著《人工智能:语音识别理解与实践》(电子工业出版社,2020年,系《解析深度学习:语音识别实践》的续作)。但两实验室各自独立运转,钱彦旻并非X-LANCE成员,其上交的学术根据地为AudioCC实验室。
  • 计算机应用研究所同事:与马利庄(所长)、张伟楠(副所长)、盛斌、易冉等为研究所序列同事关系;跨方向论文合作以署名记录为准。

4.2 国际合作网络

钱彦旻的国际合作网络集中在语音处理核心学术圈:

  • Shinji Watanabe(卡内基梅隆大学,WAVLab负责人):最重要的国际长期合作者,围绕ESPnet生态(ESPnet-SE等)持续合作,近至INTERSPEECH 2026仍有联合论文(语音分离与识别端到端整合);上交学生(含李晨达)赴CMU访问的主要渠道。
  • CMU及国际语音分离圈:与Xuankai Chang(CMU)、Samuele Cornell、Zhong-Qiu Wang等Watanabe圈学者频繁联合署名。
  • Nobutaka Ono、Yoshiki Masuyama(东京都市大学):语音分离与信号处理方向合作者。
  • 微软:Yao Qian、Zhuo Chen等微软研究员为其长期合作者(如目标声音提取方向,ICASSP 2023)。
  • Kaldi谱系:作为Kaldi创始成员,与Daniel Povey(Kaldi之父,现任小米首席语音科学家)等共享开源社区谱系联系,这是其学术网络中最具标识性的国际资产。

4.3 DBLP消歧说明

DBLP中"Yanmin Qian"条目较为干净,无明显重名合并问题;但检索其早年论文时需注意其署名历史上偶有媒体将其姓名误写为"钱彦昊",引用时应以论文原文署名为准。

五、业界合作关系深度分析

5.1 思必驰:从联合实验室到产业落地

钱彦旻长期担任思必驰—上海交大智能联合语音实验室副主任,深度参与上交语音技术的产业化。其十余年智能语音产业化经验覆盖复杂广播语音识别、说话人分割聚类等国际竞赛系统,相关系统多次获国际评测第一。2014年,他因在智能语音技术产业化方面的贡献获中国人工智能学会"吴文俊人工智能科学技术奖"。

5.2 AudioCC实验室的企业级项目网络

AudioCC实验室的研究工作除获国家脑科学计划、国家重点研发计划、国家自然科学基金等国家级资助外,还持续获得腾讯、蚂蚁、美团、荣耀等企业级项目资助。实验室可调动包括A100、H800、4090、A10在内的百余块GPU资源,具备产业级大规模AI研究能力,近5年发表数百项学术成果。

5.3 语音鉴伪与安全方向的产业合作

2025年前后,AudioCC实验室与宇生月伴公司(VUI Labs)联合发表语音鉴伪大模型研究成果,提出以数据为中心的研究范式,系统探究训练数据分布与模型泛化能力的关系,构建了兼具高性能与高泛化性的语音鉴伪大模型,直接回应当前生成式语音泛滥带来的安全挑战。

5.4 学术专著的产业界作者网络

《人工智能:语音识别理解与实践》(2020)的四位作者构成一个横跨学界与产业界的独特合作组合:俞栋(时任腾讯AI Lab副主任,IEEE Fellow)、邓力(原微软首席AI科学家)、俞凯(思必驰联合创始人)、钱彦旻,该书是中文世界深度学习语音识别领域最具影响力的专著之一,也固化了钱彦旻与语音产业界顶级人物的联系。

六、重要奖项与学术兼职

重要奖项

年份 奖项名称 备注
2014 吴文俊人工智能科学技术奖 智能语音技术产业化贡献
2019 IEEE ASRU 2019唯一最佳论文奖 MIMO-Speech,通讯作者,第一作者为其硕士生常烜恺
吴文俊人工智能自然科学奖一等奖 第一完成人
2023 "强国青年科学家"提名 公示名单
上海交通大学睿远青年科技奖(信息与空间科技奖) 第二届;表彰其在"鸡尾酒会难题"上的贡献
国际期刊/会议最佳论文奖(共3次) 含ASRU 2019
国际评测冠军(共5次,带队) 复杂广播语音识别、说话人分割聚类等
2024 DCASE国际挑战赛两项冠军、一项季军 联合多所高校和企业(低复杂度声学场景分类、工业设备异常声音检测夺冠)

另据公开简介,其团队3次获国际权威期刊和会议最优论文奖、5次带队获国际评测冠军。

学术兼职

  • IEEE高级会员、ISCA会员
  • InterSpeech、ISCSLP等国际会议领域主席/TPC委员
  • IEEE T-ASLP、IEEE J-STSP、IEEE SPL等期刊审稿人
  • 主持/参与国家自然科学基金、国家重点研发计划、国家脑科学计划、国家863、国防JKW及英国EPSRC等项目

代表性学术成果

  • Kaldi语音识别工具包:13位创始成员之一(唯一亚洲成员),国际语音识别事实标准框架。
  • MIMO-Speech(ASRU 2019唯一最佳论文):多通道多说话人端到端语音识别,直面"鸡尾酒会难题"。
  • ESPnet-SE(IEEE SLT 2021):面向ASR集成的端到端语音增强与分离工具包。
  • 《人工智能:语音识别理解与实践》(2020,合著):中文领域标杆专著。
  • DCASE 2024两冠一季:低复杂度声学场景分类与工业设备异常声音检测国际冠军。

七、Connection圈层总结

第一圈层:AudioCC实验室。三十余人的研究团队,覆盖智能语音处理、音乐与音频生成、自然语言理解和多媒体信号分析,以"完整的听觉人工智能与计算声学"为定位,是上交语音研究的两大支柱之一(另一支为俞凯的X-LANCE)。

第二圈层:清华—剑桥—Kaldi的学术根系。清华博士训练、剑桥MIL博士后经历与Kaldi创始成员身份三者叠加,使其同时接入中国语音学界核心圈、英国语音研究传统与国际开源社区谱系(Daniel Povey一脉),这是其区别于多数国内同行学者的独特网络资产。

第三圈层:CMU-Watanabe国际协作网络。与Shinji Watanabe及其WAVLab学生群体(Xuankai Chang、Samuele Cornell等)的持续合作,加上学生互访机制(李晨达等),构成中美语音研究最活跃的协作通道之一。

第四圈层:产业合作网络。以思必驰联合实验室(行政职务)为历史起点,扩展至腾讯、蚂蚁、美团、荣耀的企业项目资助与宇生月伴的联合研发,覆盖语音识别、声纹、语音鉴伪、音乐生成等落地场景;专著合作者俞栋、邓力、俞凯进一步连接腾讯、微软、思必驰的产业高层人脉。

第五圈层:代际传承网络。常烜恺(JHU CSLP)、李晨达(留校)、张王优(微软学者)等代表学生已开始在国内外顶级机构任职或深造,"钱彦旻门下"的代际网络正在形成。

总体而言,钱彦旻的学术关系网络呈现"以AudioCC实验室为核心据点、以Kaldi谱系为国际标识、以企业级项目为产业支撑"的多圈层结构,其在"鸡尾酒会难题"(语音增强与分离)方向的系统性积累,使其成为国内听觉人工智能领域最具网络密度的学者之一。

数据来源说明:本报告信息主要来自上海交通大学计算机学院教师名录、AudioCC实验室官网、上海交大新闻网、清华大学相关学术报告页及公开百科资料,统计截至报告生成时间;职称与头衔以学校官方最新口径为准。