跳转至

ZJU-ZZ 赵洲 副教授

报告生成时间:2026年8月20日
个人主页:赵洲
所属团队:浙江大学计算机科学与技术学院 / 生成式人工智能与多模态学习课题组


一、学者基本信息

字段 内容
姓名 赵洲(Zhou Zhao)
出生年月 1988年1月
所属单位 浙江大学人工智能学院 / 计算机科学与技术学院
职称 教授、博士生导师(曾任浙大最年轻副教授)
行政职务 浙江大学人才办副主任
博士毕业院校 香港科技大学(HKUST),2015年获博士学位
联合培养 2013-2015年,微软雷德蒙德研究院(MSR Redmond)与微软亚洲研究院(MSRA)联合培养
研究方向 自然语言处理、计算机视觉、生成式人工智能(语音合成/歌声合成/视觉合成/音频合成/3D人脸合成/多模态学习)
Google Scholar引用 1万余次(截至2024年)
代表性成果 FastSpeech系列、NATSpeech、DiffSinger、PNDM、Make-An-Audio、GeneFace等
邮箱 zhaozhou@zju.edu.cn
DBLP 作者页面

二、教育背景与职业履历

赵洲1988年1月出生于中国浙江。他在香港科技大学(HKUST)完成了本科及博士学位学习,在校期间初次接触人工智能领域,曾自主设计并制作了一台能完成开啤酒瓶、倒啤酒等系列操作的自主遥控机器人,由此萌生对智能交互的研究兴趣。

博士阶段(约2013-2015年),赵洲赴微软雷德蒙德研究院(Microsoft Research Redmond)和微软亚洲研究院(Microsoft Research Asia)进行联合培养与访问学习。在微软期间,他接触到了智能聊天机器人"微软小冰",这一经历深刻影响了他对自然语言处理(NLP)和人机交互的研究志向,为其后续在语音合成和生成式AI领域的工作奠定了基础。

2015年博士毕业后,赵洲加入浙江大学计算机科学与技术学院,从讲师起步,随后快速晋升为副教授和博士生导师,成为当时浙江大学最年轻的副教授。此后,他逐步晋升为教授,并兼任浙江大学人才办副主任。其所在单位也从计算机科学与技术学院扩展至新成立的人工智能学院。

在学术发展的同时,赵洲于2017年8月在杭州萧山信息港小镇创立了杭州一知智能科技有限公司(Yiwise),担任创始人兼首席科学家,致力于将NLP和语音交互技术产业化。一知智能的核心团队吸纳了来自香港科技大学、浙江大学、帝国理工大学、南洋理工大学、同济大学等国内外顶尖院校人才,推出了基于NLP语义理解技术的AI客服机器人"Tanyi 探意",在金融、教育、医疗、公共服务等领域实现应用落地。

赵洲的职业时间线可概括如下:

  • 2006-2015年:香港科技大学,获学士及博士学位(计算机科学相关专业)
  • 2013-2015年:微软雷德蒙德研究院与微软亚洲研究院,联合培养/访问学者
  • 2015年:加入浙江大学计算机科学与技术学院,任讲师
  • 2016年左右:晋升副教授、博士生导师(浙大最年轻副教授)
  • 2017年8月:创立杭州一知智能科技有限公司,任创始人兼首席科学家
  • 2022年:获国家优秀青年科学基金;入选百度全球首份AI华人青年学者榜单;获浙江大学竺可桢学院十佳专业导师
  • 2023年:入围爱思唯尔"中国高被引学者"榜单(计算机科学与技术学科)
  • 2024年:晋升教授;与吴飞等合著大小模型端云协同进化综述论文
  • 2025年:获中国图象图形学学会(CSIG)自然科学奖一等奖(跨模态内容高效生成理论与方法,团队负责人)
  • 现任:浙江大学教授、博士生导师、人才办副主任

三、学生培养情况

赵洲课题组以浙江大学竺可桢学院本科生为核心培养对象,在语音合成、歌声合成、视觉合成、3D人脸合成、多模态学习等方向产出了一批具有国际影响力的工作。课题组多位学生获"华为天才少年"等顶级荣誉,代表性学生如下:

1. 任意(Ren Yi,HeyGen基础视频模型研究团队负责人,硕士毕业生)

任意是赵洲课题组最具代表性的学生之一。他本科毕业于浙江大学竺可桢学院混合班,2019年至2022年在浙江大学计算机科学与技术学院赵洲实验室攻读硕士学位。任意是FastSpeech系列语音合成模型的第一作者——FastSpeech(NeurIPS 2019)提出非自回归并行语音合成机制,将合成速度提升数百倍,重新定义了语音合成的效率边界,至今仍是该领域最主流的算法之一,被斯坦福大学CS224S课程列为TTS领域核心阅读文献。FastSpeech 2(ICLR 2021)进一步去除对教师模型的依赖,直接从真实语音中学习方差信息,提升了生成质量和稳定性。

任意硕士期间共发表国际顶级会议论文30余篇,其中第一作者10篇(含ICML、NeurIPS、ICLR等),论文总引用量数千次。他先后荣获“华为天才少年”“阿里星”“百度奖学金”(每年全球10人)以及“字节奖学金计划”(每年全球10人)等重量级荣誉和OFFER。其硕士学位论文《非自回归语音合成》入选2024年度中国电子学会硕士学位论文激励计划,导师为赵洲教授。据2026年字节跳动奖学金官方报道,任意毕业后先后任职于字节跳动和HeyGen,现任HeyGen新加坡办公室基础视频模型研究团队负责人。FastSpeech系列模型已被微软、英伟达、阿里巴巴、腾讯等国内外公司广泛应用于各类语音产品中。

2. 刘静林(Jinglin Liu,华为天才少年/阿里星,博士生)

刘静林本科毕业于浙江大学竺可桢学院混合班,为赵洲实验室核心成员之一。她曾获得2021年、2022年国家奖学金,以及"华为天才少年"和"阿里星"荣誉称号。刘静林在国际人工智能顶会发表论文十余篇,引用量上百,论文开源代码GitHub Star数三千余次,模型下载量上万次。

刘静林的研究领域涵盖音频合成、虚拟人和自然语言处理。她是DiffSinger(AAAI 2022)的作者之一,该工作提出了基于浅层扩散机制的歌声合成方法,是歌声合成领域的代表性成果。她也是GeneFace(ICLR 2023)的共一作者之一,该工作实现了广义高保真音频驱动的3D说话人脸合成。此外,她还参与了PortaSpeech(NeurIPS 2021)、GenerSpeech(NeurIPS 2022)等重要工作。个人主页:https://silentlin15.github.io/

3. 黄融杰(Rongjie Huang,字节奖学金获得者,硕士生)

黄融杰本科专业为海洋工程与技术,后转向人工智能研究,于2021年进入浙江大学软件学院攻读硕士学位,师从赵洲教授。他是2022-2023年度浙江大学竺可桢奖学金获得者,同时也是全球仅十人获奖的"字节奖学金"(ByteDance Scholarship)2023年度获得者之一。

黄融杰在CCF-A类国际会议以第一作者发表论文十余篇,长期担任顶会审稿人,研究生期间四次获得国家奖学金。他的研究聚焦于人工智能和跨模态计算,参与了GenerSpeech(NeurIPS 2022)、Make-An-Audio等代表性工作,在语音合成风格迁移、音色合成等方面作出了重要贡献。黄融杰的本科跨专业背景(从海洋工程到AI)展示了赵洲课题组对学生多元背景的包容与培养能力。

4. 叶振辉(Zhenhui Ye,博士生,虚拟人合成方向)

叶振辉是浙江大学计算机学院博士生,导师为赵洲教授,主要研究方向为语音合成和虚拟人视频合成。他是GeneFace(ICLR 2023)的第一作者之一,该工作实现了广义高保真音频驱动3D说话人脸合成,是3D虚拟人领域的里程碑式工作,GitHub获得200+ Star,被PaperWeekly等学术平台报道。

叶振辉进一步主导了Real3D-Portrait(ICLR 2024 Spotlight)工作,提出单图逼真3D说话人合成算法,从单张图片中重建目标人物的三维化身并支持大姿态驱动。他还主导了MimicTalk(NeurIPS 2024),与字节跳动合作提出了个性化3D数字人快速生成方法,将单个数字人模型训练时间压缩至15分钟以内,比此前最快方法快47倍。叶振辉在NeurIPS、ICLR、ACL、IJCAI等顶会发表多篇论文,个人主页:https://yerfor.github.io/

5. 夏炎(多模态学习方向,竺可桢学院本科生)

夏炎本科毕业于浙江大学竺可桢学院交叉创新平台(计算机+自动化),为赵洲实验室成员。他的研究方向涵盖多模态一致性学习、多模态泛化学习和开放域泛化学习。夏炎在CVPR、ACM Multimedia等国际顶级会议发表论文,并有文章投递至ICML。他的工作聚焦于多模态表征学习中的泛化与一致性问题,是课题组在多模态理解方向的重要力量。

6. 程诗卓(Xize Cheng,手语生成/唇语识别方向,竺可桢学院本科生)

程诗卓本科毕业于浙江大学竺可桢学院求是科学班(计算机科学与技术专业),为赵洲实验室成员。他跟随赵洲老师参与了三项专利的撰写,帮助科研成果落地转化,包括:《手语生成方法和系统》《使用注意力引导自适应记忆的实时唇语识别方法和系统》和《一种端到端的手语翻译方法和系统》。程诗卓的工作体现了赵洲课题组在无障碍通信(手语翻译)和视觉理解(唇语识别)方向的研究拓展。在发表的国际论文中,程诗卓也是多模态对比表征学习系列工作(Connecting Multi-Modal Contrastive Representations, NeurIPS 2023;OmniBind, ICLR 2025)的重要参与者。

7. 刘鲁平(Luping Liu,扩散模型/视觉合成方向)

刘鲁平是PNDM(Pseudo Numerical Methods for Diffusion Models on Manifolds, ICLR 2022)的第一作者之一,该工作是赵洲课题组在视觉合成方向的代表性成果。PNDM提出了流形上扩散模型的伪数值方法,为扩散模型在图像生成中的高效推理提供了新思路,被Stability-AI等公司在产品中应用。刘鲁平还参与了PortaSpeech(NeurIPS 2021)等语音合成工作,是课题组在扩散模型和生成式AI方向的关键成员。

四、学术合作网络

4.1 实验室内部合作

赵洲课题组形成了以语音合成、视觉合成、多模态理解三大方向为核心的研究矩阵。课题组内部合作高度紧密,多位学生交叉参与不同方向的项目:

  • 语音合成线:以任意为核心,串联刘静林、黄融杰等学生,产出FastSpeech系列、PortaSpeech、DiffSinger、GenerSpeech、NATSpeech等工作。
  • 视觉合成线:以刘鲁平、叶振辉为核心,产出PNDM、GeneFace、Real3D-Portrait、MimicTalk等工作,并与语音合成线深度交叉(如GeneFace和Real3D-Portrait中均涉及音频驱动人脸合成)。
  • 多模态理解线:以王泽寒(Zehan Wang)、张子昂(Ziang Zhang)、程诗卓等为核心,产出Connecting Multi-Modal Contrastive Representations(NeurIPS 2023)、FreeBind(ICML 2024)、Extending Multi-modal Contrastive Representations(NeurIPS 2024)、OmniBind(ICLR 2025)等系列工作,与赵恒爽(Hengshuang Zhao,香港大学)、高鹏(Peng Gao)等有合作关系。

课题组近年发表成果覆盖NeurIPS、ICML、ICLR、AAAI、CVPR、ACM MM等全部AI顶会,论文署名中赵洲均为通讯作者(标注*)。

4.2 浙大校内跨机构合作

赵洲与浙江大学多位教授保持密切的校内合作关系:

  • 吴飞教授:浙江大学求是特聘教授、人工智能研究所所长、本科生院院长、国家杰青、CAAI Fellow。赵洲与吴飞在2024年合著了大小模型端云协同进化技术综述论文《Advances in edge-cloud collaboration and evolution for large-small models》(发表于《中国图象图形学报》2024年第29卷第6期,作者:王永威、沈弢、张圣宇、吴帆、赵洲、蔡海滨、吕承飞、马利庄、杨承磊、吴飞*)。此外,赵洲曾在CNCC 2023"大小模型端云协同智能计算"技术论坛中担任Panel主持人,与吴飞等学者共同探讨端云协同计算新范式。

  • 何晓飞教授:浙江大学计算机科学与技术学院教授、国家杰青、人工智能领域国际杰出学者。何晓飞与赵洲共同参与了2025年度CSIG自然科学奖一等奖项目"跨模态内容高效生成理论与方法",为该项目核心完成人之一。

  • 张圣宇研究员:浙江大学研究员,与赵洲在端云协同和跨模态生成领域有密切合作,同为CSIG自然科学奖一等奖项目完成人,亦共同参与吴飞牵头的端云协同综述论文。

  • 马利庄教授:上海交通大学/浙江大学教授,与赵洲在端云协同综述论文中为共同作者,体现了在多模态和多媒体计算领域的校际合作。

4.3 跨机构与国际合作

  • 微软亚洲研究院(MSRA):赵洲与微软研究院的合作关系深长远。FastSpeech系列论文的合作者包括微软亚洲研究院的谭旭(Xu Tan)、秦涛(Tao Qin)、赵胜(Sheng Zhao)和刘铁岩(Tie-Yan Liu)等资深研究员。FastSpeech(NeurIPS 2019)、FastSpeech 2(ICLR 2021)和Almost Unsupervised TTS/ASR(ICML 2019)均为浙大-微软联合研究成果。这一合作关系可追溯至赵洲在MSRA的联合培养经历。

  • 字节跳动(ByteDance):赵洲课题组与字节跳动有深度研究合作。Real3D-Portrait(ICLR 2024)和MimicTalk(NeurIPS 2024)的作者中包含字节跳动的研究人员(如殷翔/Xiang Yin、马泽君/Zejun Ma)。任意的字节奖学金以及毕业后加入字节跳动,进一步强化了这一产学研通道。赵洲课题组的多项虚拟人合成技术成果直接应用于字节跳动的产品中。

  • 阿里巴巴:赵洲与阿里巴巴的研究团队有学术合作。论文《Learning to Rehearse in Long Sequence Memorization》(ICML 2021)的合作者包括阿里巴巴的周昌(Chang Zhou)、马建新(Jianxin Ma)、周靖人(Jingren Zhou)和杨红霞(Hongxia Yang)等。

  • 华中科技大学:万瑶副教授(华中科技大学)为CSIG自然科学奖一等奖项目"跨模态内容高效生成理论与方法"的共同完成人,体现了赵洲在跨模态生成领域与华中科技大学的合作关系。

  • 中国科学院深圳先进技术研究院:杨敏研究员为CSIG自然科学奖一等奖项目的共同完成人。

  • Stability-AI:赵洲课题组的PNDM等视觉合成工作被Stability-AI(Stable-Diffusion母公司)在产品中应用。

  • 林志杰(Zhijie Lin):多次出现在赵洲课题组的论文合作者名单中(PNDM, NeurIPS 2022论文等),为课题组的紧密合作伙伴。

五、业界合作关系深度分析

5.1 产业合作与技术落地

赵洲课题组的生成式AI研究成果在全球范围内实现了广泛的产业落地,形成了独特的"学术研究-产业应用"闭环:

微软(Microsoft):FastSpeech系列模型是赵洲与微软亚洲研究院联合开发的标志性成果。FastSpeech提出的非自回归并行生成机制将语音合成速度提升数百倍,解决了传统自回归模型(如Tacotron)逐帧生成的效率瓶颈。该技术被微软在其Azure认知服务和产品中应用。赵洲本人在微软研究院的联合培养经历为这一持续合作关系奠定了基础——从博士阶段的联合培养到入职浙大后的深度科研合作,形成了跨越十余年的产学研纽带。合作者谭旭(Xu Tan)是微软亚洲研究院语音团队负责人,刘铁岩(Tie-Yan Liu)是微软亚洲研究院副院长。

华为:赵洲课题组多位学生获"华为天才少年"荣誉,包括任意和刘静林等。华为"天才少年"计划以百万年薪选拔全球顶级人才,赵洲课题组能持续输送多位入选者,说明其培养的研究成果与华为的技术需求高度契合。课题组的语音合成、音频合成和虚拟人技术成果被应用于华为相关产品中。

字节跳动(ByteDance):字节跳动是赵洲课题组最紧密的产业合作伙伴之一。主要体现在几个层面:(1)任意毕业后加入字节跳动,从事语音合成和生成式模型的研发;(2)Real3D-Portrait和MimicTalk等虚拟人合成工作为浙大-字节联合研发,字节研究员直接参与论文撰写;(3)黄融杰获字节奖学金(全球仅10人),体现了字节对赵洲课题组学生培养质量的认可;(4)课题组的语音合成和虚拟人合成技术成果被应用于字节跳动的产品中。

英伟达(NVIDIA)和阿里巴巴、腾讯:FastSpeech系列模型被这些公司在各自的语音产品中广泛应用,成为业界TTS技术的事实标准之一。

Stability-AI:课题组的PNDM(视觉合成)等扩散模型相关工作被Stability-AI在Stable-Diffusion等产品中应用。

5.2 产学研转化与创业

赵洲在产学研转化方面具有独特经历。2017年8月,他在杭州萧山信息港小镇创立了杭州一知智能科技有限公司(Yiwise),担任创始人兼首席科学家。一知智能聚焦于NLP语义理解和语音交互技术的产业化,主攻中文场景下的语义理解、多轮对话、精准问答和语音交互四个领域。

2018年8月,一知智能发布了基于NLP语义理解技术的AI客服机器人"Tanyi 探意",在金融、教育、医疗、公共服务等领域投入使用。该产品采用自研的slot-filling和paraphrase identification语义理解算法,结合改进版kaldi语音识别和语义纠错技术,实现了高精度的呼叫场景AI语音交互。

2021年,一知智能进一步训练了消费对话领域十亿级参数的预训练语言模型Yiwise-DNLP,全面升级了意图识别、实体抽取和对话生成算法,并开发了基于强化学习的自学习对话管理系统。一知智能的技术还被应用于AI反电信网络诈骗,通过96110热线开展反诈宣传,累计外呼反诈宣教数十万人次。

一知智能的核心团队吸纳了来自香港科技大学、浙江大学、帝国理工大学、南洋理工大学、同济大学等国内外顶尖院校人才,与萧山区政府、中国电信、杭州银行等建立了战略合作关系。赵洲作为首席科学家,将其在NLP和语音交互领域的科研成果直接转化为产品应用。

赵洲课题组的代表性成果及其产业落地情况可归纳如下:

成果名称 方向 发表会议/年份 产业应用
FastSpeech / FastSpeech 2 语音合成 NeurIPS 2019 / ICLR 2021 微软、英伟达、阿里巴巴、腾讯等
NATSpeech / PortaSpeech 语音合成 NeurIPS 2021 语音合成产品
DiffSinger 歌声合成 AAAI 2022 音乐合成产品
Make-An-Audio 音色/音频合成 音频生成产品
PNDM 视觉合成 ICLR 2022 Stability-AI (Stable-Diffusion)
GeneFace 3D人脸合成 ICLR 2023 虚拟人产品
Real3D-Portrait 3D虚拟人 ICLR 2024 Spotlight 字节跳动
MimicTalk 个性化数字人 NeurIPS 2024 字节跳动
GenerSpeech 语音风格迁移 NeurIPS 2022 语音合成产品

六、重要奖项与学术兼职

年份 奖项/荣誉 类别
2018 福布斯科技领域中国"30位30岁以下精英" 行业荣誉
2018 浙江大学信息学部青年创新奖 校级奖项
2019 浙江省杰出青年科学基金项目负责人 省级人才项目
2020 杭州市十大青年科技英才 市级荣誉
2022 国家优秀青年科学基金获得者 国家级人才项目
2022 百度全球首份AI华人青年学者榜单 行业荣誉
2022 浙江大学竺可桢学院十佳专业导师 教学荣誉
2023 爱思唯尔"中国高被引学者"(计算机科学与技术) 学术影响力
教育部科技进步一等奖 国家部委级科研奖
中国电子学会科技进步一等奖 全国性学会科研奖
2025 CSIG自然科学奖一等奖(跨模态内容高效生成理论与方法,团队负责人) 全国性学会科研奖

学术兼职方面,赵洲担任浙江大学人才办副主任,并作为浙江大学上海高等研究院PI参与学术活动。他曾在CNCC 2023等顶级学术会议中担任技术论坛Panel主持人,并多次受邀在全国各高校作学术报告(如郑州大学等)。赵洲也长期担任NeurIPS、ICML、ICLR、AAAI等国际顶级会议的程序委员会委员和审稿人,以及CCF-A类会议的领域主席等职务。此外,他还受邀为多所高校的国家自然科学基金申报提供指导(如嘉兴南湖学院等项目申报指导会)。

七、Connection圈层总结

赵洲的学术关系网络可分为以下几个圈层:

第一圈层(核心课题组):以竺可桢学院本科生/研究生为主体的研究团队,包括任意(FastSpeech系列,现 HeyGen 新加坡基础视频模型团队负责人,曾任职字节跳动)、刘静林(DiffSinger/GeneFace,华为天才少年)、黄融杰(GenerSpeech/Make-An-Audio,字节奖学金)、叶振辉(GeneFace/Real3D-Portrait/MimicTalk)、刘鲁平(PNDM)、夏炎(多模态泛化)、程诗卓(手语生成/多模态表征)等。这一圈层是赵洲学术产出的核心引擎,以语音合成-视觉合成-多模态理解三大方向为轴心,形成了从基础研究到顶会发表的完整闭环。

第二圈层(浙大校内合作):与吴飞教授(人工智能研究所所长,端云协同综述共著)、何晓飞教授(CSIG一等奖共著)、张圣宇研究员(端云协同/CSIG一等奖共著)等浙大校内学者形成的合作关系。这一圈层体现了赵洲在浙大AI生态中的整合角色,连接了语音/视觉合成与端云协同计算、跨模态生成等研究方向。

第三圈层(产业合作):以微软亚洲研究院(谭旭、秦涛、刘铁岩等,FastSpeech系列联合开发)、字节跳动(虚拟人合成联合研发,任意/黄融杰等学生流入)为核心,延伸至华为(天才少年计划接收方)、阿里巴巴(长序列记忆论文合作)、Stability-AI(PNDM等产品应用)、英伟达和腾讯(FastSpeech技术应用)。这一圈层是赵洲课题组成果实现产业落地的关键通道,也是学生就业和职业发展的重要出口。

第四圈层(创业生态):以杭州一知智能科技有限公司(Yiwise)为核心的创业网络,连接了萧山区政府、中国电信、杭州银行等产业合作伙伴,将NLP和语音交互技术转化为AI客服、反诈宣传等实际应用。

第五圈层(学术共同体):包括华中科技大学万瑶副教授、中科院深圳先进院杨敏研究员(CSIG一等奖共著)、上海交通大学马利庄教授(端云协同综述共著)等跨机构合作者,以及CNCC等学术会议中形成的交流网络。

总体而言,赵洲的学术关系网络以"竺可桢学院本科生培养"为人才源头,以"生成式AI(语音/视觉/多模态)"为研究内核,以"微软-字节-华为"为产业落地主通道,形成了从象牙塔到产业界的完整价值链。其课题组在语音合成领域的全球影响力(FastSpeech系列引用数千次、成为业界标准)、在虚拟人合成领域的前沿突破(GeneFace/Real3D-Portrait/MimicTalk),以及多位学生获"华为天才少年"等顶级荣誉,使其成为中国AIGC领域产学研结合的标杆型学者。