跳转至

SJTU-X-LANCE 陈谐 副教授

报告生成时间:2026年8月20日
个人主页:陈谐(Xie Chen)
所属团队:上海交通大学跨媒体语言智能实验室(X-LANCE)


一、学者基本信息

项目 内容
中文姓名 陈谐(英文名 Xie Chen,曾用译名"谢晨")
英文名 Xie Chen
当前职位 上海交通大学计算机学院 长聘教轨副教授、博士生导师
所属单位 上海交通大学计算机学院 机器智能研究所
所属实验室 跨媒体语言智能实验室(X-LANCE Lab)
兼任 上海创智学院全时导师
邮箱 chenxie95@sjtu.edu.cn
办公地址 电院3号楼501
个人主页 https://chenxie95.github.io/
Google Scholar https://scholar.google.com/citations?user=d6u01FkAAAAJ
ORCID 0000-0001-7423-617X
人才计划 海外高层次人才(青年)计划(国家级)
研究方向 音频大模型;音频(语音、声音、音乐)信号理解与生成;语音识别、合成与翻译;基于音频的自监督学习;Agent驱动的语音交互系统;音频驱动的数字人生成

姓名说明: 该学者的中文名为"陈谐"(拼音 Chén Xié),英文名 Xie Chen(名 Xie,姓 Chen)。用户提供的"谢晨"一字为常见误写或同音替代,本报告统一以官方主页所用"陈谐(Xie Chen)"为准。


二、教育背景与职业履历

2.1 教育经历

时间 院校 学位 院系 导师
2005–2009 厦门大学 本科 电子工程系
2009–2012 清华大学 硕士 电子工程系 刘加教授
2012–2016 剑桥大学(University of Cambridge) 博士 信息工程系 Prof. Mark Gales

陈谐的博士导师 Mark Gales 教授是剑桥大学机器智能实验室(Machine Intelligence Lab)的核心教授,国际语音识别领域的权威学者,在噪声鲁棒语音识别(模型补偿方法 PMC)、生成式模型(HMM)、判别式训练等领域有深远影响,IEEE Fellow。陈谐在剑桥期间的研究方向集中于语音识别与噪声鲁棒处理,曾与同在剑桥的 Yoshioka 等人合作发表关于单通道去混响对会议转录系统影响的论文(ICASSP 2014)。

2.2 职业履历

时间 机构 职位 导师/团队
2011–2012 微软研究院(Microsoft Research) 语音组研究实习生 Frank Seide
2016–2017 剑桥大学 博士后研究员 Prof. Mark Gales
2018–2021 微软(美国)语言与对话研究组 高级研究员(Senior Researcher)→ 资深研究员(Principal Researcher)
2021–至今 上海交通大学 计算机学院 副教授(长聘教轨) X-LANCE Lab

微软经历说明: 陈谐在微软美国(Redmond)语言与对话研究组(Language and Dialog Research Group)工作了约三年(2018–2021),从高级研究员晋升为资深研究员(Principal Researcher)。该研究组是微软语音识别与对话技术的核心团队,与 Yifan Gong、Jinyu Li、Takuya Yoshioka、Naoyuki Kanda、Zhong Meng 等知名研究员同组。陈谐在微软期间的主要研究方向包括端到端语音识别、多通道语音分离、说话人日志(diarization)以及语言模型自适应等。此外,2011–2012 年的微软实习经历中,导师为 Frank Seide(语音识别与深度学习方向知名研究员)。


三、学生培养情况

陈谐于2021年加入上海交通大学,截至本报告撰写时已指导学生约4–5年。根据个人主页的招生信息和公开论文署名情况,其培养学生信息如下(部分学生信息基于公开论文署名推断,具体在读/毕业状态以官方为准):

姓名 层次 方向 备注
Xuankai Chang(常轩凯) 博士研究生(推断) 离散语音表征、语音合成 参与组织 Interspeech 2024 Speech Processing Using Discrete Speech Units Challenge
Ziyang Ma(马子阳) 博士研究生(推断) 音频大模型、音频理解 参与组织 Interspeech 2026 Audio Reasoning Challenge
Ruiyang Xu(徐瑞阳) 博士研究生(推断) 音频推理 参与组织 Interspeech 2026 Audio Reasoning Challenge
Bohan Li(李博涵) 博士研究生(推断) 音频理解、多模态 参与组织 Interspeech 2026 Audio Reasoning Challenge
多名硕士/本科生 主页注明持续招收本科科研实习、硕士和博士生

说明: 由于陈谐的个人主页未直接列出学生名单,上述学生信息主要依据其在国际会议 Challenge 组织者列表和论文合作者中出现的线索进行审慎推断。X-LANCE 实验室整体有教师7人(1位特聘教授、4位副教授、1位助理教授、1位科研助理)、在读学生130余人,陈谐作为实验室核心教师之一,指导的学生是其中的重要组成部分。


四、学术合作网络

4.1 X-LANCE 实验室内部合作

X-LANCE 实验室(前身为 SpeechLab,2012年由俞凯创立,后扩展为跨媒体语言智能实验室)现有教师7人,陈谐是其中之一。实验室内部核心合作者包括:

合作者 职位 合作关系
俞凯(Kai Yu) 特聘教授、实验室主任、机器智能研究所所长 实验室最高负责人,ISCA Fellow、IEEE Fellow,剑桥大学工程系博士。与陈谐同属剑桥校友网络(俞凯2006年剑桥博士,陈谐2016年剑桥博士),研究方向互补:俞凯侧重对话系统与语音交互,陈谐侧重语音识别与音频生成。共同组织 Interspeech 2026 Audio Reasoning Challenge。
钱彦旻(Yanmin Qian) 特聘研究员、实验室副主任 鲁棒性、多语言、低资源语音识别方向,Kaldi 唯一亚洲作者。与陈谐在语音识别领域有交叉合作,共同参与 X-LANCE 论文发表。
吴梦玥(Mengyue Wu) 副研究员/副教授 语音感知与生成、多模态语音、计算精神健康方向,墨尔本大学博士。在 X-LANCE 内部与陈谐在音频理解方向有合作。
陈露(Lu Chen) X-LANCE 成员,研究方向涉及口语语言理解。在 ICASSP 2024 论文中与俞凯等人合作发表多意图数据集相关工作。

剑桥校友网络: 陈谐与俞凯均毕业于剑桥大学,形成 X-LANCE 的"剑桥系"核心。此外,两人均曾在剑桥大学工程系/信息工程系学习,导师体系相近,这一学术血脉联系是 X-LANCE 音频方向的重要凝聚力量。

4.2 微软研究院合作网络

陈谐在微软工作期间(2018–2021)与多位微软语音组核心研究员建立了深厚的合作关系,这些合作延续至其加入上海交大之后:

合作者 机构 合作内容
Jinyu Li(李锦煜) 微软(美国) 端到端语音识别、语言模型自适应。共同发表 ICASSP 2022 论文"Factorized Neural Transducer for Efficient Language Model Adaptation"
Zhong Meng(孟钟) 微软(美国) 语言模型自适应、语音识别。多个 ICASSP 论文合作者
Naoyuki Kanda 微软(美国) 多通道语音分离、说话人日志
Takuya Yoshioka 微软(美国) 会议转录、去混响。陈谐剑桥时期即有合作(ICASSP 2014)
Yifan Gong(龚义凡) 微软(美国) 语音识别系统架构
Yu Wu(吴宇) 微软(美国) 语音识别
Frank Seide 微软亚洲研究院 陈谐2011–2012年实习导师,语音识别与深度学习方向
Furu Wei(韦福如) 微软亚洲研究院 X-LANCE 与微软联合发表的 Interspeech 2022 语音分离论文合作者

微软合作延续: 陈谐加入 SJTU 后,X-LANCE 实验室与微软在语音分离、语音识别等领域保持联合发表论文的传统。例如 Interspeech 2022 接收的10篇 X-LANCE 论文中,多篇标注"合作单位:微软"。

4.3 跨机构学术合作

合作方/机构 合作者 合作内容
卡内基梅隆大学(CMU) Shinji Watanabe 等 离散语音表征 Challenge(Interspeech 2024)的组织者之一
新加坡南洋理工大学(NTU) Eng Siong Chng 共同组织 Interspeech 2026 Audio Reasoning Challenge
京都大学 Xuankai Chang, Jiatong Shi 离散语音表征研究
中国人民大学 Qin Jin 共同组织 Interspeech 2024 Speech Processing Using Discrete Speech Units Challenge
香港中文大学(深圳) 多位学者 参与学术研讨会与讨论(2024年大模型时代语音处理研讨会引导发言)
清华大学 刘加教授(硕士导师) 学术传承关系
IEEE SPS 2025年起担任 SLTC 委员(2025–2027)

五、业界合作关系深度分析

5.1 微软(Microsoft)

陈谐与微软的关系是其学术生涯中最核心的业界联系,贯穿三个阶段:

  1. 实习阶段(2011–2012): 在微软研究院语音组实习,导师为 Frank Seide,从事语音识别相关研究。
  2. 全职研究员阶段(2018–2021): 在微软美国语言与对话研究组任高级/资深研究员,是该组的核心成员之一。期间研究涵盖端到端语音识别(Neural Transducer)、语言模型自适应(Internal Language Model Adaptation)、多通道语音分离与说话人日志等。代表论文包括"Factorized Neural Transducer for Efficient Language Model Adaptation"(ICASSP 2022,与 Zhong Meng、Jinyu Li 等合作)和"Internal Language Model Adaptation with Text-Only Data for End-to-End Speech Recognition"(arXiv 2021,与 Zhong Meng、Yashesh Gaur、Naoyuki Kanda、Jinyu Li、Yu Wu、Yifan Gong 合作)。
  3. 学术合作阶段(2021–至今): 加入 SJTU 后,陈谐维持与微软的学术合作关系。X-LANCE 实验室与微软在语音分离、会议转录等方向持续联合发表论文。

博士后的微软合作节点: 陈谐的学术路径中,剑桥博士后(2016–2017)与微软全职研究员(2018–2021)之间有紧密衔接。剑桥博士导师 Mark Gales 与微软语音组有长期合作关系(如 AMI 项目),这一网络为陈谐进入微软提供了学术通道。

5.2 思必驰(AISpeech)与其他企业合作

企业/机构 关系 详情
思必驰(AISpeech) 间接关联 实验室主任俞凯为思必驰联合创始人及首席科学家。X-LANCE 实验室与思必驰在语音交互技术有产学研合作,陈谐作为实验室核心教师,间接参与相关合作生态
横向项目 主持 根据上海交大教师主页,陈谐在研项目包括"全双工语音交互系统""面向真实场景的语音对话与交互系统研究""基于大模型的音频生成""小语种方言ASR技术合作项目""面向东南亚和中东地区的多语种语音识别评测基准构建"等,部分项目涉及企业合作
开源社区 参与 参与 Speech Processing Using Discrete Speech Units Challenge(Interspeech 2024)和 Audio Reasoning Challenge(Interspeech 2026)等国际评测赛事的组织

企业合作特点: 陈谐的业界合作以微软为核心锚点,辅以 X-LANCE 实验室整体的思必驰生态。回国后,其项日方向从微软时期的语音识别逐步扩展到音频大模型和语音交互系统,体现出从工业研究到学术探索的转型。


六、重要奖项与学术兼职

6.1 人才计划与奖项

称号 时间 备注
海外高层次人才(青年)计划 2021年回国时获评 国家级人才计划

6.2 学术兼职

兼职 时间
Associate Editor, IEEE Transactions on Audio, Speech and Language Processing (TASLP) 2025–
IEEE SPS Speech and Language Processing Technical Committee (SLTC) Member 2025–2027
Local Arrangements Chair, ICASSP 2025 Satellite Event (Suzhou, China) 2025
Invited Speaker Chair, SLT 2024 2024
Technique Program Chair, NCMMSC (全国人机语音通讯会议) 2023, 2024
Workshop Chair, MER25 @ ACM Multimedia MRAC25 Workshop 2025
Co-organizer, Speech Processing Using Discrete Speech Units Challenge @ Interspeech 2024 2024
Co-organizer, Audio Reasoning Challenge @ Interspeech 2026 2026
Co-organizer, Question Answering and Reasoning on Audio and Time-Series Data Special Session @ ICASSP 2026 2026
Special Session organizer, "Speech Processing in LLM Era" @ ISCSLP 2024 2024

6.3 学术报告(Tutorial)

题目 会议 年份
多语言语音识别与合成 ICASSP Tutorial 2026
基于离散表征的语音合成 ICASSP Tutorial 2025
基于离散表征的语音合成 NCMMSC Tutorial 2024
多模态大语言模型 ISCSLP Tutorial 2024
基于信息解耦的端到端语音识别系统和高效语言模型自适应 全国人机语音通讯青年论坛 2022

七、Connection圈层总结

陈谐(Xie Chen)的学术关系网络呈现出清晰的"三圈层"结构:

核心圈层——X-LANCE 实验室: 以俞凯(实验室主任、ISCA/IEEE Fellow)为核心,与钱彦旻(语音识别)、吴梦玥(多模态语音)等教师构成紧密的内部合作团队。陈谐与俞凯的剑桥校友关系是这一圈层的学术血脉纽带。实验室整体与思必驰公司有产学研联系。

第二圈层——微软研究院人脉: 陈谐在微软美国语言与对话研究组工作三年(2018–2021),与 Jinyu Li、Zhong Meng、Naoyuki Kanda、Takuya Yoshioka、Yifan Gong 等建立了深度合作关系。这一网络不仅体现在论文合作上,也延续到回国后 X-LANCE 与微软的联合发表论文中。微软经历是陈谐区别于其他国内语音学者的独特优势。

第三圈层——国际学术网络: 以剑桥导师 Mark Gales 为起点,延伸至 CMU(Shinji Watanabe)、NTU(Eng Siong Chng)、中国人民大学(Qin Jin)等机构的合作者,覆盖语音识别、离散表征、音频推理等前沿方向。陈谐同时活跃于 IEEE SLTC(2025–2027委员)和 TASLP 副主编等学术服务岗位,处于国际语音处理社区的中青年学术骨干地位。

圈层特征: 陈谐的学术网络具有"剑桥学术血统 + 微软工业研究经验 + 国内顶尖高校平台"三重优势。其研究方向从博士阶段的传统语音识别与噪声鲁棒处理,经微软时期的端到端语音识别与语言模型自适应,发展为当前聚焦的音频大模型与音频理解生成,研究轨迹与国际语音AI领域的技术演进高度同步。回国后,陈谐正逐步将微软时期积累的工业研究经验转化为 X-LANCE 实验室在音频大模型方向的新增长点,并通过组织国际 Challenge 和 Tutorial 活跃于学术前沿。