NWPU-ASLP 谢磊 教授
报告生成时间:2026年8月20日
个人主页:谢磊
所属团队:西北工业大学音频语音与语言处理实验室(ASLP@NPU)/ 计算机学院
一、学者基本信息
| 项目 | 内容 |
|---|---|
| 中文姓名 | 谢磊(Lei Xie) |
| 当前职位 | 西北工业大学计算机学院教授、博士生导师 |
| 所属单位 | 西北工业大学计算机学院 |
| 所属实验室 | 音频语音与语言处理实验室(ASLP@NPU),实验室负责人 |
| 依托平台 | 空天地海一体化大数据应用技术国家工程实验室;陕西省语音与图像信息处理重点实验室 |
| 兼任职务 | 西北工业大学计算机学院院长助理(曾任) |
| 邮箱 | lxie@nwpu.edu.cn |
| 办公地址 | 西安市长安区西北工业大学长安校区计算机学院 207 室 |
| 个人主页 | https://lxie.nwpu-aslp.org/ |
| 实验室官网 | http://www.nwpu-aslp.org/ |
| Google Scholar | https://scholar.google.com/citations?user=Qddov9wAAAAJ |
| 论文数量 | 400 余篇同行评议论文 |
| 引用与指数 | Google Scholar 引用超 18000 次,H-index 63(据个人主页最新数据;部分早期公开资料记为 18000+/63) |
| 出生地 | 河北石家庄 |
| 研究方向 | 语音处理、对话式人工智能、语音识别/合成/增强、音频语言大模型、面向语音与语言技术的先进神经网络模型与大模型技术 |
二、教育背景与职业履历
谢磊的学术轨迹具有典型的"本土博士 + 海外研究 + 回国任教"特征,其职业时间线如下:
教育经历。 谢磊于西北工业大学获得计算机工程博士学位,博士阶段主要从事语音识别研究,约于 2004 年完成博士学位。关于其博士导师,公开的官方简介中未明确点名。但从其 2004 年前后发表于《西北工业大学学报》等期刊的论文署名来看(如"谢磊、冯伟、赵荣椿"署名的听视觉语音识别论文,以及"蒋冬梅、谢磊、Ilse Ravyse、赵荣椿、Hichem Sahli、Jan Cornelis"署名的 Viseme 连续语音识别论文),西北工业大学计算机科学与工程系的赵荣椿教授(1937 年生,1960 年毕业于哈军工,曾任西工大计算机科学与工程系主任,数字图像处理方向的开拓者,曾任中国图像图形学会副理事长、中国体视学学会副理事长)多次以资深作者身份出现,按中文学术界通讯/导师署名惯例,赵荣椿教授极有可能是谢磊的博士导师或博士阶段的核心指导教师。这一推断与蒋冬梅教授(2000 年获西工大博士学位,同属 ASLP 核心教师)的学术谱系高度一致——蒋冬梅同样长期与赵荣椿、Hichem Sahli 等合作者联合署名,暗示赵荣椿是 ASLP 实验室早期学术谱系的共同源头。由于缺乏官方明确标注,此处仅作审慎推断。
海外研究经历。 在加入西北工业大学任教之前,谢磊曾在三个海外/境外机构从事科研工作:
- 2000–2001 年:比利时布鲁塞尔自由大学(Vrije Universiteit Brussel, VUB),电子与信息工程系(ETRO)访问学者,参与中国-比利时政府间国际合作课题。VUB 方面的合作导师为核心教授 Hichem Sahli(VUB ETRO 部门教授,从事音视频信号处理、计算机视觉与情感识别研究)以及 Jan Cornelis 教授,研究助理 Ilse Ravyse 亦为重要合作者。这一中比合作持续多年,成为 ASLP@NPU 国际合作网络的起点。
- 2004–2006 年:香港城市大学(City University of Hong Kong),媒体技术研究中心(Media Technology Research Centre)博士后研究员。该中心从事多媒体与语音处理研究。关于具体的合作导师姓名,公开资料未予明确记载。
- 2006–2007 年:香港中文大学(The Chinese University of Hong Kong),微软—香港中大利群计算及界面科技联合实验室(Microsoft-CUHK Joint Laboratory for Human-Centric Computing and Interface Technologies)博士后研究员。该联合实验室由微软研究院与香港中文大学共建,从事人机交互与计算技术前沿研究。关于具体的合作导师,公开资料未予明确记载。
回国任教及晋升。
- 2007 年: 被西北工业大学以"海外人才引进"特聘为副教授,并入选首批"西北工业大学翱翔之星"高层次人才培养计划。
- 2008 年: 入选教育部"新世纪优秀人才支持计划"。
- 2010 年: 破格晋升为教授,同年获陕西省青年科技新星称号。
- 2011 年 12 月: 英国东英吉利大学(University of East Anglia)访问教授。
- 2017 年至今: 持续担任 ASLP@NPU 负责人,西工大计算机学院教授、博导。
谢磊回国后长期深耕西安,将 ASLP@NPU 从 1995 年成立时的小型研究组发展为国内外语音、音频与语言智能领域具有广泛影响力的研究团队,实验室规模达三位教授、一位副教授、九位海外兼职教授和 50 余名硕博士研究生。
三、学生培养情况
学生培养是谢磊教授工作的重中之重。据西北工业大学计算机学院官方报道,从业 15 余年间,谢磊为社会培养了大量计算机专业优秀人才,毕业生凭借扎实的基础、过硬的技术和创新的能力,受到众多企业青睐,进入阿里、百度、腾讯、美团、字节、小米等国内头部公司以及 Google、微软等国际著名企业,获得优秀人才计划,逐步成长为部门骨干、行业专家和领军人才。实验室主页 2026 年 4 月公告显示,2026 届硕士同学顺利毕业,人均 6+ offer,多人获选腾讯青云计划、京东顶尖青年技术天才计划等,入职阿里巴巴、腾讯、京东等业界头部企业或读博深造。
以下列出代表性学生/团队成员(部分信息依据公开论文署名与实验室公告审慎推断,具体在读/毕业状态及去向以官方为准):
1. 张斌斌(Binbin Zhang)(地平线机器人 Horizon Robotics 研究员 / WeNet 核心开发者,博士毕业生)
张斌斌是 WeNet 语音识别工具包和 WenetSpeech 数据集的第一作者与核心推动者。在 WeNet 系列论文(WeNet、WeNet 2.0)和 WenetSpeech 论文中,张斌斌均为第一作者,谢磊为通讯作者,二人构成 ASLP@NPU 在端到端语音识别方向最核心的师生组合。张斌斌毕业后加入地平线机器人(Horizon Robotics),同时活跃于 WeNet 开源社区,是连接学术界与工业界开源生态的关键人物。其论文署名邮箱为 binbin.zhang@horizon.ai。
2. 吕航(Hang Lv)(ASLP@NPU 在读/近期博士,语音识别方向)
吕航是 WeNet 与 WenetSpeech 系列论文的核心作者之一,署名邮箱为 hanglv@nwpu-aslp.org,属 ASLP@NPU 内部成员。在 WeNet 2.0 论文中,吕航与张斌斌、谢磊共同构成核心作者群,长期参与端到端语音识别工具包的开发与维护,是实验室在开源基础设施方向的重要骨干。
3. 姚卓远(Zhuoyuan Yao)(ASLP@NPU 博士生,端到端语音识别方向)
姚卓远是 WeNet 2.0 论文的核心作者之一,署名属 ASLP@NPU(西北工业大学)。在端到端语音识别的统一两遍框架(U2++)等方向有持续贡献,是实验室语音识别方向的新生代骨干。
4. 姚继珣(Jixun Yao)(腾讯,博士毕业生,获腾讯青云计划)
据实验室主页 2026 年 4 月公告,姚继珣博士获得腾讯青云计划并入职腾讯。其在 ICASSP 2026 论文 MeanVC(轻量级流式零样本语音转换)中为合作者,研究涉及语音转换与生成方向。姚继珣是谢磊指导的博士毕业生中进入头部科技企业并获重要人才计划的代表性案例。
5. 郭鹏程(Pengcheng Guo)(语音识别与数据方向,WenetSpeech 核心作者)
郭鹏程是 WenetSpeech 论文的核心作者之一,参与 1 万小时中文语音识别数据集的构建工作。该数据集由 ASLP Lab、出门问问、希尔贝壳联合发布,是迄今最大的开源中文普通话语音识别语料库之一。
6. 穆炳申(Bingshen Mu)(多语言对话式语音语言模型方向,核心学生/成员)
穆炳申是多语言对话式语音语言模型挑战赛(MLC-SLM)系列工作的核心作者,在 ICASSP 2026 上以第一作者发表 MLC-SLM 挑战赛综述论文,并参与组织该国际挑战赛。其研究方向跨越语音识别与语音大模型,是实验室在语音语言大模型方向的重要骨干。
7. 邵明辰(Mingchen Shao)(音频理解与大模型方向,核心学生/成员)
邵明辰在 ACM MM 2026 和 ICASSP 2026 上均有第一作者论文发表,研究方向涵盖长音频理解(LAT-Audio)、低资源语言语音大模型(XLSR-Thai)等前沿方向,是实验室在音频语言大模型方向的新生代代表。
8. 马国斌(Guobin Ma)(语音转换方向,核心学生/成员)
马国斌是 ICASSP 2026 MeanVC 论文的第一作者,研究方向为零样本语音转换与流式推理,与姚继珣、宁子谦、蒋跃鹏等共同构成实验室语音转换方向的研究力量。
培养特点总结: 谢磊的学生培养具有三个鲜明特征。一是产业落地导向,实验室鼓励学生将研究应用到实际场景中,毕业生普遍进入头部科技企业的核心技术岗位;二是开源贡献,以 WeNet 和 WenetSpeech 为代表的开源项目由学生深度参与开发和维护,培养了兼具学术深度与工程能力的人才;三是国际化视野,实验室每年派出众多学生赴海外高校顶尖实验室深造和头部企业实习交流,海外合作伙伴包括南洋理工大学、新加坡国立大学、约翰霍普金斯大学、华盛顿大学、VUB 等。
四、学术合作网络
4.1 ASLP@NPU 实验室内部合作
ASLP@NPU 的核心教师团队由四位学术带头人构成,谢磊为实验室负责人,其余三位为长期合作的核心教师:
| 合作者 | 职位 | 研究方向 | 合作关系 |
|---|---|---|---|
| 蒋冬梅(Dongmei Jiang) | 教授、博导 | 听视觉融合的语音处理、听视觉情感分析与识别、带表情的说话人面部动画合成 | 蒋冬梅,女,1973 年 7 月生,2000 年于西北工业大学获计算机科学与技术工学博士学位,2003 年起任教于计算机学院,2010 年晋升教授。她是 ASLP@NPU 与 VUB 长期合作的桥梁人物,2005 年起担任西北工业大学与布鲁塞尔自由大学"听视觉信号处理"联合实验室中方联系人,2011 年起担任中欧 LIAMA 研究联盟西工大联系人。她与谢磊同为西工大计算机系培养,学术谱系高度相近(均与赵荣椿教授、Hichem Sahli 教授长期联合署名),是实验室内部合作最紧密的同仁之一。 |
| 付中华(Zhonghua Fu) | 副教授 | 语音与图像信息处理 | 付中华是实验室语音与图像信息处理方向的核心成员。在 ICASSP 2022 AEC 挑战赛中,西北工业大学团队(含张世民、王梓腾、孙嘉瑶、付毓辉、田彪、付强、谢磊等)取得词准确率第一名,体现了实验室在语音前端处理方向的集体攻关能力。 |
| 张蓬(Peng Zhang) | 教授、博导 | 计算机视听觉机理及方法、模式识别与机器学习 | 张蓬教授同属西北工业大学计算机学院博导队伍,在计算机视听觉机理及方法方向与谢磊形成互补,共同支撑实验室的多模态研究方向。 |
实验室内部合作特征: ASLP@NPU 四位学术带头人各有侧重——谢磊统领语音识别/合成/大模型方向,蒋冬梅深耕听视觉融合与情感识别,付中华聚焦语音前端与图像处理,张蓬覆盖视听觉机理与模式识别。这一分工使实验室形成了从语音前端处理到语音识别、语音合成、多模态情感识别的完整技术链条。
4.2 跨机构学术合作
谢磊及 ASLP@NPU 的跨机构合作网络覆盖国内外高校、研究机构与开源社区:
| 合作方/机构 | 合作者 | 合作内容 |
|---|---|---|
| 比利时布鲁塞尔自由大学(VUB) | Hichem Sahli 教授、Jan Cornelis 教授、Ilse Ravyse、Werner Verhelst | 中比政府间国际合作项目,听视觉信号处理联合实验室。合作始于 2000 年谢磊访学 VUB,持续至今逾 20 年,推动两校签署多项合作协议并加入中欧 LIAMA 联盟。 |
| WeNet 开源社区 | 张斌斌(地平线)、杨超(地平线)、潘复平(地平线)等 | WeNet 端到端语音识别工具包和 WenetSpeech 数据集的开源共建,成为连接学术界与工业界的重要基础设施。 |
| 出门问问(Mobvoi)、希尔贝壳(SeaShell) | 徐昕(Xin Xu)、步辉(Hui Bu)等 | WenetSpeech 1 万小时中文语音数据集联合发布,腾讯会议天籁实验室、华为昇思 MindSpore、西安未来人工智能计算中心提供支持。 |
| Soul APP、MoonStep AI | — | 联合开源多说话人语音转写模型 SoulX-Transcriber,在多个公开基准上获最佳性能。 |
| 新加坡南洋理工大学(NTU)、新加坡国立大学(NUS)、新加坡资讯通讯研究院(I2R) | — | 实验室长期国际合作伙伴,在语音处理方向开展合作研究。 |
| 美国约翰霍普金斯大学(JHU)、华盛顿大学(UW) | — | 实验室海外合作伙伴,学生交流与联合研究。 |
| 清华大学 | 钱彦旻教授(上海交大-思必驰联合实验室,曾参与 CCF ADL 培训同台)等 | 通过学术会议和评测竞赛建立学术联系。 |
| 中国科学技术大学 | 凌震华教授等 | 通过声音大模型论坛等学术活动建立联系,共同探讨语音合成与大模型技术。 |
4.3 国际合作
谢磊在国际学术共同体中扮演活跃角色,其国际合作主要体现为:
- VUB 长期合作(2000 至今): 这是谢磊国际合作网络的起点和核心。Hichem Sahli 教授作为 VUB 方核心合作者,与蒋冬梅、谢磊联合发表了大量听视觉语音处理、情感识别、面部动画合成方向的论文,推动了西北工业大学与 VUB 建立硕士双学位联合培养机制和中欧 LIAMA 联盟成员关系。
- 国际评测竞赛: 实验室参加多个国际评测并获得第一名,如 ICASSP 2022 AEC 挑战赛获词准确率第一名(0.817)、MOS 第三名。
- 国际挑战赛组织: 联合组织第二届多语言对话式语音语言模型挑战赛(MLC-SLM,Interspeech 2025/ICASSP 2026),吸引 78 支来自 13 个国家的团队参与;联合组织 IEEE SLT 2026 SmartGlasses 挑战赛。
- 国际学术兼职: 担任 ISCA SIG-CSLP 副主席、IEEE/ACM TASLP 与 IEEE SPL 高级领域编委、IEEE SLTC 委员等,处于国际语音处理社区的中坚学术骨干地位。
- Distinguished Lecturer: 获亚太信号与信息处理协会(APSIPA)Distinguished Lecturer 称号,受邀在国际学术会议和机构作特邀报告。
五、业界合作关系深度分析
5.1 产业合作
ASLP@NPU 奉行"校企合作,研究落地"的宗旨,与众多行业头部企业建立了广泛深入的科研合作关系。谢磊自 2010 年起主推产学研深度融合,具体合作企业包括:
| 企业/机构 | 合作形式 | 详情 |
|---|---|---|
| 腾讯 | 联合实验室 | 建有"西北工业大学-腾讯媒体信息技术联合实验室",是实验室最重要的联合实验室之一。腾讯会议天籁实验室支持 WenetSpeech 数据集发布。2026 届毕业生多人入职腾讯并获腾讯青云计划。 |
| 云知声 | 联合实验室 | 建有"西北工业大学-云知声智能语音交互联合实验室",与明星创业公司云知声在智能语音交互方向开展深度合作。 |
| 华为 | 科研合作 + 荣誉 | 长期科研合作关系,华为昇思 MindSpore 支持 WenetSpeech 数据集发布。谢磊获"华为云 AI 名师""华为优秀技术合作成果奖""华为云优秀创新合作团队奖"等荣誉。 |
| 出门问问(Mobvoi) | 数据联合发布 | 与 ASLP Lab、希尔贝壳联合发布 WenetSpeech 1 万小时中文语音数据集。 |
| 字节跳动 | 科研合作 | 列入实验室校企合作企业名单,毕业生进入字节跳动。 |
| 阿里巴巴 | 科研合作 + 人才输送 | 列入实验室校企合作企业名单,毕业生进入阿里巴巴。 |
| 百度 | 科研合作 | 早期合作企业之一,列入实验室校企合作企业名单。 |
| 美团 | 科研合作 + 奖项 | 谢磊获"美团科研合作实践奖",毕业生进入美团。 |
| 微软 | 科研合作 + 人才输送 | 列入实验室校企合作企业名单,毕业生进入微软。 |
| 小米、京东、网易、爱奇艺、滴滴 | 科研合作 | 均列入实验室校企合作企业名单,在智能语音赛道构建长期战略合作关系。 |
| IBM、三星、中兴、搜狗、Roobo、哈曼 | 科研合作 | 早期即列入实验室校企合作企业名单,开展广泛深入的科研合作。 |
| 地平线机器人(Horizon Robotics) | 开源共建 + 人才输送 | 张斌斌、杨超、潘复平等 WeNet 核心开发者毕业后加入地平线,同时通过 WeNet 开源社区持续与 ASLP 合作。 |
5.2 产学研融合
谢磊的产学研合作理念具有鲜明的"三赢"特征:企业通过校企合作储备人才,学生通过合作实习锻炼实力并找到合适工作,学校借助企业的实践应用平台验证技术、转化论文价值并培养视野广阔的人才。这一理念的具体体现包括:
- 联合实验室模式: 以腾讯、云知声联合实验室为代表,建立稳定的产学研合作实体,推动长期深度合作。
- 开源基础设施模式: 以 WeNet 工具包和 WenetSpeech 数据系列为代表,通过开源项目连接学术界与工业界,WeNet 已被学术界和工业界广泛采用,成为中文语音识别领域最重要的开源基础设施之一。实验室持续开源 MeanVC2、SoulX-Transcriber、DiffRhythm、OSUM、WenetSpeech-Chuan/Yue/Wu 等项目。
- 数据资源共建模式: WenetSpeech 数据集由 ASLP Lab、出门问问、希尔贝壳联合发布,腾讯会议天籁实验室、华为昇思 MindSpore、西安未来人工智能计算中心等机构支持,体现了多方协同的产学研生态。
- 技术评测与挑战赛模式: 实验室参加多个国际技术评测获得冠军,联合组织 MLC-SLM、SmartGlasses 等国际挑战赛,将学术研究与产业需求紧密对接。
- 成果转化: 实验室多项研究成果已应用于智能手机、智能音箱等多种产品,诸多研究成果已实现产业落地。实验室曾入选 2019《互联网周刊》十大顶尖高校人工智能实验室。
六、重要奖项与学术兼职
6.1 人才计划与奖项
| 称号/奖项 | 时间 | 备注 |
|---|---|---|
| 西北工业大学翱翔之星(首批) | 2007 年 | 高层次人才培养计划 |
| 教育部新世纪优秀人才支持计划 | 2008 年 | |
| 陕西省青年科技新星 | 2010 年 | 同年破格晋升教授 |
| 西安市青年科技奖 | — | |
| 霍英东青年基础研究基金获得者 | — | |
| 亚太信号与信息处理协会(APSIPA)Distinguished Lecturer | — | |
| 全球前 2% 顶尖科学家 | — | 斯坦福大学 & Elsevier 联合发布 |
| 华为云 AI 名师 | — | |
| 华为优秀技术合作成果奖 | — | |
| 华为云优秀创新合作团队奖 | — | |
| 美团科研合作实践奖 | — | |
| 西北工业大学海外引进人才 | 2007 年 | |
| 多项国际会议最佳论文奖 | — | |
| 多项国际评测竞赛冠军 | — | 如 ICASSP 2022 AEC 挑战赛词准确率第一名 |
6.2 学术兼职
| 兼职 | 备注 |
|---|---|
| ISCA 中文口语语言处理兴趣组(SIG-CSLP)副主席 | 国际语音通信协会 |
| IEEE/ACM Transactions on Audio, Speech and Language Processing(TASLP)高级领域编委(SAE) | |
| IEEE Signal Processing Letters(SPL)高级领域编委(SAE) | |
| IEEE 语音和语言技术委员会(SLTC)委员 | |
| 中国计算机学会(CCF)语音听觉与对话专委会常务委员 | |
| 中国中文信息学会理事 | |
| 全国人机语音通讯学术会议(NCMMSC)常设机构副主席 | |
| APSIPA 语音语言与音频学术委员会委员 | |
| 中国计算机学会多媒体专业委员会委员 | |
| 中国图形图像学会多媒体专业委员会委员 | |
| CCF 高级会员、ACM 会员、ISCA 会员 | |
| 中国语言学会语音学分会会员 | |
| CCF YOCSEF 西安分论坛学术委员 | |
| 香港研资局(RGC)评审专家 |
七、Connection 圈层总结
谢磊的学术关系网络呈现出清晰的"四圈层"结构:
核心圈层——ASLP@NPU 实验室内部。 以谢磊为实验室负责人,蒋冬梅(听视觉融合与情感识别)、付中华(语音前端与图像处理)、张蓬(视听觉机理与模式识别)为核心教师团队,形成覆盖语音前端处理到语音识别、语音合成、多模态情感识别的完整技术链条。蒋冬梅与谢磊同出西工大计算机系学术谱系,且同为 VUB 合作网络的核心人物,是实验室内部合作最紧密的同仁。实验室现有 50 余名硕博士研究生,以张斌斌、吕航、姚卓远、穆炳申、邵明辰等为代表的学生群体构成实验室的研究主力。
第二圈层——VUB 国际合作血脉。 以比利时布鲁塞尔自由大学的 Hichem Sahli 教授为核心,自 2000 年谢磊访学 VUB 起,这一中比合作持续逾 20 年,建立了听视觉信号处理联合实验室、硕士双学位联合培养机制和中欧 LIAMA 联盟成员关系。Jan Cornelis、Ilse Ravyse、Werner Verhelst 等 VUB 学者构成这一圈层的比利时学术网络。VUB 合作是谢磊学术网络的国际化起点,也是 ASLP@NPU 区别于其他国内语音实验室的独特优势。
第三圈层——国内产学研生态。 以"西北工业大学-腾讯媒体信息技术联合实验室"和"西北工业大学-云知声智能语音交互联合实验室"两大联合实验室为锚点,辐射华为、字节跳动、阿里巴巴、百度、美团、京东、小米、网易、出门问问、地平线等众多头部企业。谢磊获华为云 AI 名师、华为优秀技术合作成果奖、美团科研合作实践奖等多项企业荣誉,体现了其产学研合作的深度与广度。毕业生广泛进入阿里、百度、腾讯、美团、字节、小米、Google、微软等企业,形成强大的校友产业网络。
第四圈层——开源社区与全球学术网络。 以 WeNet 开源社区(GitHub wenet-e2e)为核心枢纽,WeNet 语音识别工具包和 WenetSpeech 数据系列已被学术界和工业界广泛采用,成为中文语音识别领域最重要的开源基础设施之一。WeNet 社区连接了地平线机器人(张斌斌、杨超等)等工业界力量与 ASLP 学术团队。在国际学术层面,谢磊担任 ISCA SIG-CSLP 副主席、IEEE/ACM TASLP 与 IEEE SPL 高级领域编委、IEEE SLTC 委员等职务,联合组织 MLC-SLM、SmartGlasses 等国际挑战赛,与 NTU、NUS、JHU、UW 等海外高校保持长期合作。
圈层特征: 谢磊的学术网络具有"西工大本土博士血脉 + VUB 国际合作起点 + 强产学研融合生态 + 开源基础设施影响力"四重优势。其研究轨迹从博士阶段的语音识别,经 VUB 的听视觉处理和香港的媒体技术研究,发展为当前聚焦的语音识别/合成/增强与音频语言大模型,并通过 WeNet/WenetSpeech 等开源项目将学术影响力辐射至整个中文语音处理社区。谢磊是国内语音处理领域少数同时具备深厚学术积累、广泛产业合作网络和重大开源基础设施贡献的学者,其 Connection 圈层的独特价值在于将学术界、工业界和开源社区三方力量有效整合。