USTC-Speech 杜俊 教授
报告生成时间:2026年8月21日
个人主页:杜俊(原 jeffreyustc.github.io 已失效,改用中科大教师官方主页)
所属团队:中国科学技术大学电子工程与信息科学系 / 语音及语言信息处理国家工程研究中心(NERC-SLIP)
一、学者基本信息
| 项目 | 内容 |
|---|---|
| 姓名 | 杜俊(Jun Du) |
| 出生年份 | 1982年6月 |
| 现职称 | 教授、博士生导师(中科大电子工程与信息科学系;2025年前后由副教授晋升为教授,官方工程研究中心团队页现列为"教授") |
| 所属机构 | 中国科学技术大学电子工程与信息科学系;语音及语言信息处理国家工程研究中心(NERC-SLIP)骨干 |
| 研究方向 | 单通道语音增强与分离、鲁棒语音识别、说话人日志、语音情感识别、声学场景分类与声音事件定位检测;兼及手写/OCR文档识别与多模态信息处理 |
| 学术影响 | 谷歌学术引用13000余次;入选2024年、2025年斯坦福全球前2%顶尖科学家"终身科学影响力排行榜"与"年度科学影响力排行榜"双榜 |
| 学会身份 | CCF杰出会员;IEEE / INNS / CSIG高级会员 |
| 代表性荣誉 | 2025年IEEE信号处理快报(SPL)最佳论文奖、2018年IEEE信号处理学会最佳论文奖、2023年度国家科学技术进步奖一等奖("多语种智能语音关键技术及产业化",排名第9)、2022年吴文俊人工智能科技进步一等奖、2018年安徽省科技进步一等奖、2022年ISCSLP国际会议最佳论文奖 |
二、教育背景与职业履历
教育背景(据中科大教师主页与百度百科):
- 2000.09–2004.07:中国科学技术大学电子信息工程专业,获学士学位;
- 2004.09–2009.07:中国科学技术大学信号与信息处理专业,获工学博士学位。博士期间曾两度赴微软亚洲研究院(MSRA)语音组做访问学生(2006.01–2006.08、2007.11–2008.01),并于2007年赴香港大学计算机系人机交互实验室任研究助理。
关于其博士导师:中科大官方主页未直接标注导师姓名。但杜俊博士期间及其后的论文几乎均与戴礼荣教授联合署名(如2014–2016年多篇DNN语音增强/分离论文的作者均为"Yong Xu, Jun Du, Li-Rong Dai, Chin-Hui Lee"组合),两人长期同属中科大语音团队,学界普遍据此推断其为戴礼荣教授的博士生(此点建议以校方档案进一步确认)。据此,其师承谱系可追溯至中科大语音学科的奠基者王仁华教授一脉(王仁华→戴礼荣→杜俊/凌震华等)。
职业履历:
- 2009.06–2010.05:科大讯飞研究院研究主管。期间(2009–2013年整体时段内)主导开发了语音识别、手写识别和OCR多个产品;
- 2010.08–2013.08:微软亚洲研究院语音组副研究员(此时间段以教师主页口径为准);
- 2013年入职中国科学技术大学,历任特任研究员、副教授,2013.08–2014.02曾以"铸星计划"访问学者身份再赴微软亚洲研究院;
- 现为中国科学技术大学电子工程与信息科学系教授、博导,语音及语言信息处理国家工程研究中心骨干。
其履历呈现"本校本硕博—产业研究院—国际企业研究院—回归母校"的典型产研融合路径,这一经历也构成其后与科大讯飞、微软系研究者长期合作的基础。
三、学生培养情况
据中科大教师主页"学生信息"栏,杜俊名下历年指导学生达56人,早期学生包括徐勇、王燕南、高天、屠彦辉、汪子锐、张建树、孙磊、柴丽、翟建芳、鲍晓、范娜娜、文仕学、田丽、周楠、张圆圆等。以下选取代表性学生(多为博士):
1. 徐勇(博士毕业,杜俊早期博士生)
USTC团队DNN语音增强方向的开创性人物,为2018年IEEE信号处理学会最佳论文奖获奖论文"A Regression Approach to Speech Enhancement Based on Deep Neural Networks"(IEEE/ACM TASLP 2015)的第一作者,该文是深度学习语音增强的奠基性工作之一(ESI高被引论文);另发表"An Experimental Study on Speech Enhancement Based on Deep Neural Networks"(IEEE SPL 2014)等。毕业后的具体去向未见可靠公开信息。
2. 屠彦辉(博士毕业,杜俊早期博士生)
专注单通道语音分离与多通道语音识别,代表性工作包括高分辨率DNN单通道语音分离(IEEE/ACM TASLP 2016,杜俊为第一作者、其为核心合作者)与深度学习多通道语音识别的迭代掩码估计方法(Speech Communication 2019),并参与CHiME-5挑战赛系统研发。毕业去向未见可靠公开信息。
3. 高天(博士毕业,杜俊早期博士生)
研究方向为SNR渐进学习的DNN语音增强(Interspeech 2016)与联合去混响的远场语音识别训练(EURASIP JASP 2016);作为发明人之一与戴礼荣、胡国平、胡郁、刘庆峰等共同持有科大讯飞—中科大联合专利"连续语音识别方法及系统",体现了与科大讯飞的密切联合培养关系。毕业去向未见可靠公开信息。
4. 柴丽(博士毕业,杜俊指导博士生)
语音增强方向骨干,代表工作包括基于广义高斯分布的深度语音增强回归误差建模(IEEE/ACM TASLP 2019)、低资源说话人自适应语音增强的KL散度正则化DNN自适应(Interspeech 2019)等,为CHiME-5/6挑战赛冠军系统核心成员。毕业去向未见可靠公开信息。
5. 孙磊(博士毕业,杜俊指导博士生)
专注远场多说话人语音分离与说话人日志,代表工作包括CHiME-5话者相关的麦克风阵列语音分离前端(IEEE JSTSP 2019)及DIHARD话者日志挑战赛系统(Interspeech 2021),是杜俊团队四夺CHiME冠军的关键成员。
6. 张建树(博士毕业,杜俊指导博士生)
杜俊"手写/文档识别"方向的代表学生,提出在线手写数学公式识别的端到端TAP框架"Track, Attend, and Parse"(IEEE TMM 2018)及笔画约束注意力网络(Pattern Recognition 2021),带领团队获ICDAR CROHME 2019手写公式识别竞赛最佳系统;后拓展至TextVQA等多模态方向(Pattern Recognition 2022)。毕业去向未见可靠公开信息。
7. 汪子锐(博士毕业,杜俊指导博士生)
专注唇读与手写识别,代表工作包括基于书写人码的DNN离线手写中文文本识别自适应(ICFHR 2016)与HMM唇读方法(APSIPA 2021),并与张圆圆等合作音视频情感识别的注意力双线性池化融合(IJCNN 2019)。
8. 陈航(在读/近期学生,杜俊指导)
音视频语音增强与自动唇读方向,代表工作包括嵌入感知的音视频语音增强(Neural Networks 2021,与胡瑜、戴礼荣、北京工业大学尹宝才、Chin-Hui Lee合作)与层级金字塔卷积自注意力唇读(Interspeech 2021)。
整体来看,其学生培养呈现"以国际评测竞赛(CHiME、DIHARD、DCASE、CROHME、ICPR等)带动博士训练"的鲜明特色,毕业生多具备完整的前端信号处理到后端识别的系统研发能力。
四、学术合作网络
4.1 校内核心合作(USTC-NERCSLIP体系内)
- 戴礼荣教授(中科大电子工程与信息科学系):杜俊疑似博士导师与最稳定的校内资深合作者。两人自杜俊博士阶段起持续联合署名(语音增强、语音分离、手写识别等),并共同持有与科大讯飞的联合专利。戴礼荣曾任语音及语言信息处理国家工程实验室副主任(2011–2022),是团队与科大讯飞产学研纽带的关键人物。
- 凌震华教授(中科大,NERC-SLIP副主任):同属中科大语音团队(硕博师承王仁华,与戴礼荣长期合作),与杜俊在语音分离引导的说话人日志(APSIPA 2021)等方向有联合署名;两人作为"凌震华、杜俊研究团队"共同完成2023年度国家科技进步一等奖项目(凌震华排名第4,杜俊排名第9)。
- 张结副教授(中科大电子工程与信息科学系):语音增强与波束形成方向,与杜俊、戴礼荣合作发表相对声学传递函数导向的线性约束波束形成器传感器选择研究(IEEE/ACM TASLP 2021)等。
- 王青副研究员(中科大NERC-SLIP):与杜俊共同带领USTC-NERCSLIP联合团队征战DCASE(2020、2022–2025年多届冠军)与CHiME等国际评测,是声音事件检测方向的紧密搭档。
- 叶中付教授(中科大):曾合作CHiME-5系统集成(Interspeech 2019);计算机学院陈恩红教授曾合作混合带宽跨信道语音识别(TASLP 2018)与面向服务机器人的情感认知项目。
- 吴及教授(清华大学电子工程系,清华-讯飞联合研究中心主任):国家科技进步一等奖项目共同完成人(排名第5),代表中科大—清华—讯飞的多方协作。
4.2 国际合作
- Chin-Hui Lee教授(美国佐治亚理工学院,IEEE Fellow、ISCA Fellow):杜俊最高频的国际合作者,自2014年前后起几乎贯穿其全部代表性论文(语音增强、语音分离、说话人日志、唇读、情感识别等),共同产出2018年IEEE SPS最佳论文奖与2025年IEEE SPL最佳论文奖两项获奖成果。这一"中科大—佐治亚理工"轴心是杜俊国际学术网络的核心。
- Jun Qi(北京大学,已故)、Xiaoli Ma(佐治亚理工)、Sabato Marco Siniscalchi(意大利恩纳大学/挪威NTNU):与杜俊、Chin-Hui Lee共同完成2025年IEEE SPL最佳论文奖论文"On Mean Absolute Error for Deep Neural Network Based Vector-to-Vector Regression"(IEEE SPL 2020)。
- Shinji Watanabe(CMU/JHU,多通道语音识别与语音增强)、Desh Raj、Zili Huang等:目标说话人语音活动检测(TS-VAD)、DIHARD话者日志方向的联合工作(Interspeech 2021)。
- Zhuo Chen(陈卓):杜俊在微软亚洲研究院时期的同事,后加入京东(曾属京东探索研究院体系),长期与杜俊在话者日志、TS-VAD、CHiME挑战赛方向联合署名,是"MSRA人脉"延续至产业界的典型纽带。(注:陈卓为长期合作者而非杜俊学生。)
- 陈景东(Jing-Dong Chen)教授(西北工业大学,IEEE Fellow):CHiME-5远场多说话人语音识别合作者(Speech Communication 2019)。
- 谢磊教授(西北工业大学):声音事件检测/鲁棒语音识别方向联合署名(如Interspeech/期刊合作论文),是中科大—西工大语音合作的重要桥梁。
- Ian McLoughlin(新加坡)、Felix Weninger(德国/美国)等:早期即有联合署名,体现其MSRA时期建立的国际网络。
4.3 跨机构与产业合作
- 科大讯飞:最核心的产业合作方(详见第五章)。
- 腾讯:教师主页科研项目显示其在研"中科大—腾讯智能回声消除及语音增强研究合作协议书""中科大腾讯智能语音增强研究"等横向课题。
- 华为终端、中移(杭州):作为完成单位参与国家科技进步一等奖项目。
- 中科院深圳先进技术研究院(乔宇团队):音视频情感识别合作(ICMI 2019)。
- 中国矿业大学智能信息处理团队:DCASE 2025机器声纹无监督异常检测任务联合冠军。
- 新加坡南洋理工大学等:通过NERC-SLIP团队的语音合成方向存在间接合作(如噪声鲁棒TTS对比研究,ICASSP 2024,属张结—凌震华一系合作网络)。
五、业界合作关系深度分析
5.1 科大讯飞:二十年一贯的深度产学研绑定
- 制度基础:语音及语言信息处理国家工程实验室(2011年批准成立,2021年底转建为国家工程研究中心)由中科大与科大讯飞联合共建,是我国语音产业界唯一的国家级研发平台。杜俊曾在讯飞研究院任研究主管,回归中科大后即为该平台骨干,天然嵌入"中科大—讯飞"双体系。
- 联合评测:CHiME-4(2016)、CHiME-5(2018)、CHiME-6(2020)、CHiME-2023四届国际多通道语音分离与识别评测冠军系统均由"USTC-NERCSLIP联合团队"(中科大杜俊团队+科大讯飞研究院)打造;DCASE 2020、2022–2025年声学场景与声音事件检测冠军亦由杜俊、王青团队联合科大讯飞研究院及国家智能语音创新中心获得。
- 国家科技进步一等奖(2023年度):项目"多语种智能语音关键技术及产业化"由科大讯飞牵头,中科大为第二完成单位,完成人依次为刘庆峰、胡国平、刘聪、凌震华、吴及、魏思、高建清、潘嘉、杜俊(第9位)、王顶等15人,完成单位包括科大讯飞、中科大、清华大学、华为终端、中移(杭州)等。这是深度学习浪潮以来人工智能领域首个国家科技进步一等奖,成果支撑超10亿台设备激活、车载前装超5300万套。杜俊在其中的角色主要对应多通道语音信号时空分离建模等前端技术(科大新闻表述为"凌震华教授、杜俊副教授研究团队与科大讯飞等共同完成")。
- 横向项目:教师主页显示其在研"多语种基础资源构建(刘聪,科大讯飞CTO、NERC-SLIP副主任)"等由讯飞方牵头的课题。
5.2 微软亚洲研究院与其他业界联系
- MSRA经历:杜俊2010–2013年任MSRA语音组副研究员,主导语音识别、手写识别与OCR产品研发;2013年入职中科大后旋即入选MSRA"铸星计划"回访半年。这段经历使其与陈卓、Frank Seide时代的MSRA语音组保持着持续的合作与人脉(TS-VAD等工作的共同作者群即源于此)。
- 腾讯:在研的智能回声消除与语音增强合作协议,显示其语音前端技术向消费电子/通信场景的输出。
- 华为终端/中移/讯飞系公司:通过国家科技进步一等奖项目的产业化链条间接绑定。
- 理念:杜俊在2024年12月中科大信息学院访谈中明确主张"实用算法多集中在企业界……建议大家多和企业合作,做实用的工作",其研究选题(远场、噪声、多说话人混叠等真实场景痛点)与产业需求高度同构。
六、重要奖项与学术兼职
重要奖项:
- 2025年IEEE信号处理快报(SPL)最佳论文奖:论文"On Mean Absolute Error for Deep Neural Network Based Vector-to-Vector Regression"(IEEE SPL, vol. 27, 2020),与Jun Qi、Sabato Marco Siniscalchi、Xiaoli Ma、Chin-Hui Lee合作(IEEE SPS官方获奖名单确认);
- 2018年IEEE信号处理学会最佳论文奖:论文"A Regression Approach to Speech Enhancement Based on Deep Neural Networks"(IEEE/ACM TASLP, vol. 23, 2015),杜俊为通讯作者,徐勇为第一作者,ESI高被引论文;
- 2023年度国家科学技术进步奖一等奖(2024年6月颁发):"多语种智能语音关键技术及产业化",15位主要完成人中列第9位;
- 2022年吴文俊人工智能科技进步一等奖(中国人工智能学会);
- 2018年安徽省科技进步一等奖;
- 2022年ISCSLP国际会议最佳论文奖;
- 2022年中国产学研合作创新成果二等奖;
- 国际评测冠军(团队):CHiME-4/5/6/2023四届冠军(全部赛道第一)、DCASE 2020/2022–2025多届冠军、第三届DIHARD话者日志挑战赛最佳系统、ICDAR CROHME 2019手写公式识别最佳系统、ICPR 2018 MTWI与ODAI竞赛全部任务冠军、ICFHR 2018/2020东南亚棕榈叶手稿分析竞赛冠军、CVPR ODAI Workshop Challenge 2018冠军等;
- 2024年、2025年斯坦福全球前2%顶尖科学家"终身科学影响力"与"年度科学影响力"双榜单入选者;
- APSIPA杰出讲者(Distinguished Lecturer,2020–2021)。
学术兼职(现任/曾任):
- 现任IEEE Signal Processing Letters(SPL)编委;IEEE信号处理学会音频及声学信号处理技术委员会(AASP-TC)委员;CCF语音对话与听觉专委会常务委员;
- 曾任IEEE/ACM TASLP编委;IEEE信号处理学会语音及语言处理技术委员会(SLTC)委员;亚太信号与信息处理协会(APSIPA)语音语言音频分会技术委员会(SLA-TC)主任;CSIG文档图像分析与识别专委会常务委员;
- 曾受邀在CCF ADL讲习班(2022,"面向多人交互场景的语音预处理技术")、CSIG大模型讲习班(2023)等担任讲者。
七、Connection圈层总结
第一圈层(师承与核心盟友):疑似博士导师戴礼荣教授(中科大)与最高频国际合作者Chin-Hui Lee教授(佐治亚理工)构成杜俊学术网络的"双轴"——前者提供中科大语音体系与讯飞产学研通道的制度性资源,后者提供国际学术视野、方法学指导与IEEE SPS层面的声誉背书;两项最佳论文奖均在这两条轴线上产生。同门/同事凌震华教授(国家一等奖排名第4)是其最重要的平级盟友,两人分管语音合成与语音前端,共同构成NERC-SLIP的学术中坚。
第二圈层(学生与竞赛联合体):56名历届学生(徐勇、屠彦辉、高天、柴丽、孙磊、张建树、汪子锐等)形成"中科大语音前端处理"人才梯队;以CHiME、DCASE、DIHARD国际评测为载体,与科大讯飞研究院、国家智能语音创新中心结成常态化的"USTC-NERCSLIP联合团队",并将合作网络延伸至清华大学(吴及)、中国矿业大学等。
第三圈层(校内与国内合作网络):中科大校内(张结、王青、叶中付、陈恩红等跨方向学者)与国内语音重镇(西北工业大学陈景东、谢磊团队)构成稳定的国内合作圈;该圈层与中科大—讯飞体系高度重叠。
第四圈层(国际与产业界):MSRA出身带来的陈卓(京东)等产业人脉、腾讯等横向课题合作方、华为终端/中移等获奖项目合作单位,以及Shinji Watanabe(CMU)、Xiaoli Ma(佐治亚理工)、Siniscalchi(意大利)等国际学者,共同构成其外延网络。
总体判断:杜俊是典型的"建制内产研融合型"学者——以中科大语音国家工程平台为根基、以科大讯飞合作为产业纵深、以Chin-Hui Lee合作为国际接口、以国际评测竞赛为方法论抓手。其网络结构呈"强中心、高渗透"特征:中心度集中于少数几个高频合作者,但对产业界(讯飞、微软、腾讯、华为)与国际学界均有实质性的、可验证的连接,这与其"做有用的研究"的公开主张高度一致。