跳转至

清华NICS-EFC 于超 助理教授

报告生成时间:2026年8月20日
个人主页:于超
所属团队:清华大学深圳国际研究生院 / NICS-EFC实验室(多智能体强化学习方向)


一、学者基本信息

字段 内容
姓名 于超(Chao Yu)
性别
现任职务 清华大学深圳国际研究生院 助理教授(特聘研究员)、博士生导师
所属机构 清华大学深圳国际研究生院
所属实验室 NICS-EFC实验室(纳米集成电路与系统实验室 / 高效计算研究组)
博士导师 汪玉 教授
联合导师 吴翼(Yi Wu)
邮箱 yuchao@sz.tsinghua.edu.cn
办公地址 深圳市南山区西丽大学城清华园区 信息楼1108
研究方向 基于强化学习的决策智能、多智能体强化学习、具身智能、大规模强化学习系统
代表成果 MAPPO算法(Google Scholar引用2800+)、RLinf框架(GitHub Star 2600+)
论文发表 ICML、NeurIPS、ICLR、CVPR、ECCV、CoRL、IROS、ICRA、TMLR、RAL等50余篇
Google Scholar引用 5500+
人才计划 中国电子学会青年人才托举工程、清华大学"水木学者"计划

二、教育背景与职业履历

教育经历

于超的学术之路横跨自动化、机械工程与电子工程三个学科,体现了极强的跨学科学习能力与逐层聚焦的研究轨迹。

时间 学校 院系/专业 学位
2012年8月 - 2016年7月 北京理工大学 自动化学院 学士
2016年8月 - 2019年7月 清华大学 机械工程系 硕士
2019年8月 - 2023年7月 清华大学 电子工程系 博士

本科毕业于北京理工大学自动化学院,打下了扎实的控制理论与系统工程基础。硕士阶段进入清华大学机械工程系,师从刘辛军教授等,从事视觉SLAM研究,其代表性工作DS-SLAM(发表于IROS 2018)成为语义SLAM领域的早期标杆成果。博士阶段转入清华大学电子工程系NICS-EFC实验室,师从汪玉教授,并得到吴翼(Yi Wu)的联合指导,研究重心从机器人感知转向多智能体强化学习,博士论文《高效多智能体强化学习算法及其泛化性研究》系统性地提出了MAPPO算法、异步MAPPO、智能体数量不变性策略表征及奖励随机化人机协同等四大创新贡献,获评清华大学优秀博士论文。

职业经历

时间 机构 职位
2023年7月 - 2025年12月 清华大学 博士后(入选"水木学者"计划)
2026年1月 - 至今 清华大学深圳国际研究生院 助理教授(特聘研究员)

博士后期间继续在NICS-EFC实验室深耕,研究方向从数字空间的多智能体强化学习向物理世界的具身智能延伸,主导开发了面向具身智能的大规模强化学习训练框架RLinf。2026年初正式入职深圳国际研究生院,成为独立 PI,同时保持与北京NICS-EFC实验室的紧密合作关系。

重要学术节点

  • 2018年:硕士期间发表DS-SLAM(IROS 2018),语义SLAM领域高引论文
  • 2021年:MAPPO预印本上线arXiv,引发多智能体强化学习社区广泛关注
  • 2022年:MAPPO正式发表于NeurIPS 2022,成为多智能体强化学习领域的里程碑算法
  • 2023年:获清华大学优秀博士毕业生、优秀博士论文奖;博士毕业并留校开展博士后研究
  • 2024年:ICML 2024论文(Is DPO Superior to PPO for LLM Alignment?)获Oral Presentation(前1.5%)
  • 2025年:RLinf框架被英伟达Isaac Lab采纳,成为唯一由中国团队开发且面向具身大模型的强化学习引擎;NICS-EFC实验室8篇论文被NeurIPS 2025录用
  • 2026年初:入职深圳国际研究生院;联合发起具身智能企业正行创新(Striding AI),完成近亿美元天使轮融资

三、学生培养情况

于超于2026年1月正式成为助理教授并具备博士生导师资格,虽独立指导学生时间尚短,但在博士后期间已深度参与NICS-EFC实验室多名学生的指导工作,并以通讯作者身份指导学生发表了多篇高水平论文。

已指导/共同指导的学生(基于论文通讯作者关系)

学生姓名 论文 会议/期刊 年份 于超角色
刘继佳(Jijia Liu) What Can RL Bring to VLA Generalization? NeurIPS 2025 通讯作者
刘继佳(Jijia Liu) Learning from Suboptimal Data via Auto-Regressive Soft Q-Network ICML 2025 通讯作者
张同和(Tonghe Zhang) ReinFlow: Fine-tuning Flow Matching Policy with Online RL NeurIPS 2025 通讯作者
张益衔(Yixian Zhang)等 SAC Flow: Sample-Efficient RL of Flow-Based Policies ICLR 2026 通讯作者
蒋振南(Zhennan Jiang)等 World4RL: Diffusion World Models for Policy Refinement IEEE RA-L 2026 共同通讯作者
张瑞泽 Self-Play强化学习综述 综述论文 2024 通讯作者(与汪玉共同)

从论文发表趋势看,于超的研究团队正处于快速成长期,研究主题涵盖VLA泛化性、流匹配策略、机器人世界模型、大语言模型智能体等前沿方向。其指导的学生论文已稳定发表于NeurIPS、ICML、ICLR等顶级会议,显示出成熟的指导能力。

NICS-EFC实验室团队规模

NICS-EFC实验室由汪玉教授领衔,目前拥有1名教授、2名副研究员/助理研究员、5名博士后、18名博士研究生、20名硕士研究生及3名工程师。于超作为多智能体强化学习方向的代表性校友,虽已转至深圳国际研究生院,但仍与实验室保持密切的学术合作和联合指导关系。

四、学术合作网络

4.1 内部合作网络(NICS-EFC实验室及清华内部)

于超的学术根基深植于NICS-EFC实验室,其内部合作关系构成了她最核心的学术圈层。

核心合作者:汪玉教授

汪玉教授是NICS-EFC实验室的创办者和负责人,清华大学电子工程系长聘教授,也是于超的博士导师。汪玉教授团队长期致力于高能效电路与系统设计,近年来拓展至多智能体强化学习、高效深度学习等领域。于超在博士期间的所有主要工作均有汪玉的共同指导,MAPPO论文中汪玉为共同通讯作者。至今两人仍保持紧密合作,2024-2025年多篇论文(RL4VLA、ReinFlow等)中汪玉与于超共同担任通讯作者。汪玉-于超的师生搭档是NICS-EFC多智能体强化学习方向得以建立和传承的关键。

核心合作者:吴翼(Yi Wu)

吴翼是于超的联合导师,曾在清华大学电子工程系从事研究,后赴美国加州大学伯克利分校和斯坦福大学等机构工作,是多智能体强化学习领域的知名学者。MAPPO论文中吴翼为共同通讯作者,其与UC Berkeley的Alexandre Bayen教授的合作是MAPPO得以诞生的关键桥梁。吴翼在强化学习算法、人机协同、博弈论等方面的深厚积累为于超的研究提供了重要的理论指导。

实验室内部合作者:余金城(副研究员)

余金城是NICS-EFC实验室的副研究员,研究方向为多机协同与高效机器学习系统。两人同属汪玉团队的多智能体方向,在国家自然科学基金-中德合作交流基金"多机协同高效机器学习系统研究"项目中存在合作关系。

实验室内部合作者:宁雪妃(助理研究员)

宁雪妃是NICS-EFC实验室的助理研究员,研究方向为高效深度学习(模型压缩与设计)。虽研究方向与于超有所不同,但同属NICS-EFC实验室,在实验室整体框架下存在协同关系。

清华内部跨院系合作

于超的合作网络还延伸至清华大学其他院系。其硕士阶段的导师刘辛军教授(机械工程系)和刘鑫军等,以及与交叉信息研究院博士生高枫的合作(NeurIPS 2025 VLA相关工作),均体现了清华内部跨院系的学术协同。

4.2 跨机构合作网络(国内)

第四范式与黄世宇

于超与第四范式(4Paradigm)存在学术合作。在Self-Play强化学习综述论文中,第四范式研究员黄世宇博士与汪玉教授、于超共同担任通讯作者,第一作者为清华大学硕士生张瑞泽。这体现了NICS-EFC团队与产业界AI公司的紧密合作。

腾讯

在Self-Play综述论文中,作者列表包括来自腾讯的研究者,表明于超的研究团队与腾讯AI研究部门存在合作关系。

北京大学

部分论文合作者来自北京大学人工智能研究院,体现了清华-北大在多智能体强化学习领域的学术互动。

北京中关村学院/中关村人工智能研究院

2026年,于超与北京中关村学院团队合作研发了RLinf-USER系统,该系统在2026中关村论坛上作为五大原创科研成果之一公开亮相。这一合作将RLinf框架从学术开源扩展至面向真实世界在线策略学习的完整系统。

姚颂与正行创新(Striding AI)

姚颂是汪玉课题组的本科生,曾任深鉴科技CEO,后联合创办东方空间(商业航天);他并非汪玉的博士生。2026年初,于超与姚颂、正大集团联合发起具身智能企业正行创新,于超作为联合发起人掌舵技术航向。正行创新于2026年6月完成近亿美元天使轮融资,投资方包括正大集团、华勤技术、九安医疗等多家上市企业。正行创新团队核心成员来自清华、上海交大、中科大、华中科大、哈工大等高校,并拥有蔚来、智元、海康、大疆等头部企业经验。

4.3 国际合作网络

UC Berkeley:Alexandre Bayen教授

MAPPO是清华大学与加州大学伯克利分校联合研究的成果。Alexandre Bayen教授作为UC Berkeley的交通工程与优化领域知名学者,是MAPPO论文的共同通讯作者。这一国际合作是MAPPO走向世界的关键,论文在Multi-Agent Particle Environment (MPE)、StarCraft II和Hanabi三个代表性多智能体任务中验证了算法的有效性,打破了领域内"on-policy算法数据效率低"的传统认知。

UC Berkeley:Eugene Vinitsky与Akash Velu

Eugene Vinitsky和Akash Velu是MAPPO论文的共同第一作者(与于超并列),来自UC Berkeley。Vinitsky后来在NVIDIA从事自动驾驶与强化学习研究。这一合作网络奠定了MAPPO在国际多智能体强化学习社区的影响力。

卡耐基梅隆大学(CMU):张同和

CMU机器人所研究生张同和是ReinFlow(NeurIPS 2025)的第一作者,于超为通讯作者。这一合作体现了于超团队与CMU机器人研究所在VLA与流匹配策略方向的学术合作。

Stanford University:Fei Fang

Fei Fang是卡耐基梅隆大学(后转至Stanford)的博弈论与多智能体系统领域知名学者,参与了于超多篇论文的合作(如ICLR 2021的Reward Randomization论文、ICML 2024的Werewolf Game论文)。这一长期合作关系覆盖了多智能体策略多样性、博弈论应用等多个方向。

国际开源社区影响

MAPPO开源代码(github.com/marlbenchmark/on-policy)已成为多智能体强化学习领域的标准baseline,被全球数百个研究团队引用和复用。RLinf框架被英伟达Isaac Lab采纳,是唯一由中国团队开发且面向具身大模型的强化学习引擎,被海内外多家顶尖高校及头部机器人企业采用。

五、业界合作关系深度分析

于超的业界合作关系呈现出从学术合作到自主创业的清晰演进路径,体现了"产学研"深度融合的特征。

5.1 与英伟达(NVIDIA)的技术生态合作

RLinf框架被英伟达Isaac Lab采纳,成为该平台中唯一由中国团队开发、且唯一面向具身大模型的强化学习引擎。这不仅是学术成果的产业转化,更意味着于超团队的技术已深度嵌入全球具身智能的核心基础设施生态。英伟达Isaac Lab是全球最主流的机器人仿真与训练平台之一,RLinf的集成使其技术具有了全球范围的产业影响力。

5.2 与第四范式、腾讯的科研合作

通过与第四范式黄世宇博士、腾讯研究者的联合论文合作,于超的研究团队与国内头部AI企业建立了稳定的产学研通道。Self-Play强化学习综述(2024)即为一例,该综述由清华、北大、第四范式、腾讯联合完成,体现了跨机构协同研究的模式。

5.3 与深圳国际研究生院的产业生态

清华大学深圳国际研究生院电子信息(人工智能)硕士项目与平安、美团、华为、腾讯、商汤、优必选、字节跳动、超参数等众多AI领军企业开展深度产学研合作。于超入职深圳国际研究生院后,兼具学术研究与企业合作的区位优势,有利于将强化学习与具身智能技术进一步对接产业化需求。

5.4 正行创新(Striding AI):从学术到创业

2026年初,于超联合姚颂(深鉴科技、东方空间创始人)与正大集团发起具身智能企业正行创新,标志着于超从纯粹的学术研究者向"学术+产业"双轨发展的重要转变。正行创新的技术路线——"数据-模型-基础设施"协同进化——直接对应于超在RLinf(基础设施)、MAPPO/PPO(模型算法)和RL4VLA(数据与泛化)三个方向的研究积累。公司布局消费零售与工业制造两大赛道,同步研发轮臂机器人与人形机器人,首期产品计划于2026年下半年亮相。

正行创新的天使轮融资近亿美元,投资方包括正大集团、华勤技术、九安医疗等多家上市企业及一线投资机构,反映出资本市场对于超技术判断与商业路径的高度认可。

5.5 国家级科研项目

于超主持多项国家级与企业合作项目,包括:

  • 国家自然科学基金青年项目(C类):"基于深度强化学习的多无人机追逃博弈决策和控制关键技术研究"(2025-2027)
  • 国家自然科学基金-中德合作交流基金:"多机协同高效机器学习系统研究"(2021-2025)
  • 中国博士后基金特别资助:"具有强推理能力的大语言模型智能体关键技术研究"(2023-2025)

中德合作基金的存在表明于超的研究网络还延伸至德国学术界,涉及多机协同系统领域的国际合作。

六、重要奖项与学术兼职

荣誉奖项

奖项名称 级别/比例 年份
清华大学优秀博士毕业生 校5%(校100人,系4人) 2023
清华大学优秀博士论文奖 校10%(校200人,系9人) 2023
清华大学优秀硕士论文奖 校10%(校200人,系8人) 2019
中国智能体与多智能体系统优秀博士论文提名奖 全国5人 2024
国家奖学金 读博期间
清华大学"水木学者"计划 2023
电子系"传信未来学者"计划 博后期间
张克潜冠名博士后 博后期间
中国电子学会青年人才托举工程 2024

学术兼职与会议活动

于超作为多智能体强化学习领域的代表性青年学者,积极参与学术社区建设。根据公开信息:

  • 2026年智源大会强化学习论坛受邀演讲嘉宾,与南京大学俞扬教授等同行共同探讨强化学习赋能下一代智能系统的技术路径
  • 多次在将门-TechBeat等学术社区进行公开学术分享(如2025年"RL可以为VLA带来什么?"主题直播)
  • 担任NeurIPS、ICML、ICLR等顶级会议的审稿人/领域主席(基于其在该领域的学术地位和发表记录推断)
  • ICML 2024论文获Oral Presentation(前1.5%),体现了其研究工作在国际顶级会议中的认可度

七、Connection圈层总结

于超的学术关系网络可以从以下几个圈层进行总结:

第一圈层:NICS-EFC实验室核心圈

这是于超学术身份的根基。汪玉教授作为博士导师和实验室负责人,是于超学术网络中最关键的节点。吴翼作为联合导师,为于超连接了UC Berkeley的国际合作通道。余金城、宁雪妃等同门研究者构成了日常学术交流的基础圈层。NICS-EFC实验室的多智能体强化学习方向由于超在读博期间开创,并在她毕业后由实验室持续传承——这使她既是该方向的"创建者"也是"校友传承者"。

第二圈层:清华-伯克利国际合作圈

MAPPO的诞生依托于清华-伯克利联合研究,Alexandre Bayen、Eugene Vinitsky、Akash Velu等伯克利研究者是于超国际合作的核心伙伴。这一合作网络使MAPPO成为全球多智能体强化学习社区的标杆算法,也为于超后续与CMU(张同和)、Stanford/CMU(Fei Fang)等国际机构的合作奠定了基础。

第三圈层:产学研融合圈

姚颂(汪玉课题组本科生、深鉴科技前CEO、东方空间及正行创新联合创始人)是连接学术与产业的关键节点。正行创新的创立使于超的产业网络进一步扩展至正大集团、华勤技术、九安医疗等上市公司。英伟达Isaac Lab对RLinf的采纳使于超的技术深度融入全球具身智能基础设施生态。第四范式、腾讯等企业的科研合作则提供了算法层面的产学研通道。

第四圈层:学术社区影响力圈

MAPPO(Google Scholar 2800+引用)、RLinf(GitHub 2600+ Star)等代表性成果使于超在国际强化学习社区具有广泛的学术影响力。50余篇顶会论文、5500+的Google Scholar总引用、智源大会受邀演讲、ICML Oral Presentation等学术声誉,使她成为多智能体强化学习与具身智能交叉领域最具影响力的中国青年学者之一。

总结

于超是NICS-EFC实验室多智能体强化学习方向的核心创建者和传承者。她的学术轨迹呈现出鲜明的"三阶段代表作"特征:硕士阶段的DS-SLAM奠定了机器人感知基础,博士阶段的MAPPO开创了多智能体强化学习on-policy流派,博后阶段的RLinf框架搭建了具身智能训练基础设施。2026年入职深圳国际研究生院并联合创办正行创新,标志着她正式进入"学术研究+产业落地"双轨驱动的新阶段。以其与汪玉教授的师生传承为根基,以清华-伯克利国际合作为纽带,以MAPPO和RLinf的全球影响力为辐射,于超的学术关系网络已成为中国强化学习领域最具活力和产业转化能力的学术生态之一。