跳转至

交叉信息院 高阳 助理教授

报告生成时间:2026年8月20日
个人主页:高阳
所属团队:清华大学交叉信息研究院


一、学者基本信息

项目 信息
姓名 高阳(Yang Gao)
现任职务 清华大学交叉信息研究院助理教授、博士生导师
研究方向 计算机视觉、强化学习、机器人学习与具身智能;重点为视觉先验驱动的高效机器人操作
研究问题 如何将视觉经验/基础模型中的先验迁移至机器人操作,并重构适应视觉状态的学习算法,以提升真实世界任务的效率与泛化能力
本科教育 清华大学计算机科学与技术系,工学学士(B.E.)
博士教育 加州大学伯克利分校(UC Berkeley),博士(Ph.D.)
博士导师 Trevor Darrell 教授(以清华交叉信息院官方主页为准)
代表性成果 EfficientZero 系列高样本效率强化学习、EfficientImitate、ATM 任意点轨迹建模、CoPa 通用操作框架、Data Scaling Laws、OneTwoVLA 等
创业身份 千寻智能联合创始人、首席科学家(公司公开报道中的职务表述)
学术影响力 清华官方 2026 年新闻称其 Google Scholar 引用超过 5,000 次;相关成果发表于 NeurIPS、ICML、ICLR、CoRL、RSS、ICRA、IROS 等会议

高阳的研究主线并非将计算机视觉、强化学习和机器人学并列推进,而是围绕“以较少真实交互数据获得可迁移的机器人能力”这一共同瓶颈进行连接:早期以视觉强化学习的样本效率为核心,继而扩展到视频示范、模仿学习、视觉—语言—动作(VLA)模型和人形机器人。其官方主页明确将兴趣定位在计算机视觉与机器人学的交叉,并强调把视觉先验用于更高效、更有效的机器人操作。个人主页


二、教育背景与职业履历

教育背景

  • 清华大学计算机科学与技术系本科:高阳在清华完成计算机专业本科教育,形成了其后续机器学习、视觉与机器人交叉研究的基础。清华官方主页将其本科学位明确列为清华大学计算机系 B.E.。
  • 加州大学伯克利分校博士:高阳后赴 UC Berkeley 攻读博士,官方资料明确记载其博士导师为 Trevor Darrell 教授。Darrell 长期从事计算机视觉、视觉识别与机器人感知研究,这一师承解释了高阳研究中持续存在的“视觉表征—决策—操作”结合取向。清华官方介绍
  • 伯克利机器人学习共同体的交叉影响:博士及后续合作阶段,高阳与伯克利机器人学习网络保持深度学术连接。其 2018 年论文 Reinforcement Learning from Imperfect Demonstrations 与 Huazhe Xu、Ji Lin、Fisher Yu、Sergey Levine、Trevor Darrell 等人合作;EfficientZero 与 Pieter Abbeel、Thanard Kurutach 等合作;ATM 又与 Pieter Abbeel、Xingyu Lin 等人共同完成。应区分“正式博士导师”为 Trevor Darrell 与“长期科研合作者/共同指导者”Pieter Abbeel,二者不能混同。不完美示范强化学习

职业履历与研究演进

  • 回国任教:博士毕业后,高阳加入清华大学交叉信息研究院,任助理教授,组建并发展面向机器人学习的研究团队。官方教师页同时列示其研究标签为“计算机视觉,强化学习”。
  • 从视觉 RL 到具身操作:其 2021 年 NeurIPS 工作 Mastering Atari Games with Limited Data 提出 EfficientZero,在 Atari 100k 设置下,以两小时游戏经验达到平均 194.3% 的人类表现;清华新闻解释,该方法达到与 DQN 大量训练数据相近的效果而消耗数据量约少 500 倍,并在 DMControl 任务中展示竞争力。论文清华新闻
  • 建立面向真实机器人的方法链条:2022—2024 年,团队进一步发展 EfficientImitate、EfficientZero V2、基础模型先验强化学习、视频/轨迹学习和空间约束操作等研究:从“如何少量采样学会决策”,转向“如何利用视频、视觉基础模型和人类示范减少真机标注”。
  • 学术创业并行:高阳于 2024 年与前珞石机器人联合创始人韩峰涛等创办千寻智能,形成“高校课题组—具身模型公司—真实场景数据与机器人验证”的双向通道。根据清华交叉信息院 2026 年新闻,他现为千寻智能联合创始人,研究覆盖具身智能、机器人交互和强化学习。TR35 新闻

这一履历的核心特征是:以清华计算机本科和伯克利视觉研究为学术底座,借助伯克利强化学习与机器人学习网络完成方法扩展,回国后在清华形成独立团队,并通过千寻智能把通用操作、VLA 和数据效率问题推进至真实机器人产业环境。


三、学生培养情况

高阳团队既培养博士生,也吸纳预研生和本科生参与具身智能项目;公开可核实的培养关系主要来自清华新闻和论文署名。以下“直接指导/共同指导”均以项目新闻中对高阳的通讯作者、指导教师或其团队成员身份为依据;对于未公开学籍、毕业去向或行政导师信息的成员,不作超出公开材料的推定。

1. 汶川(Chuan Wen)(2020级博士生,直接指导)

汶川是目前公开材料中最明确的高阳团队博士生之一。清华交叉信息院在 ATM 项目新闻中明确标注其为“2020级博士生汶川”、论文共同第一作者,并列高阳与 Pieter Abbeel 为指导教师/通讯作者体系成员。ATM 通过预测视频内任意点的未来轨迹,将无动作标签的人类视频转化为控制指导;工作在超过 130 项自然语言条件机器人操作任务上评估,并展示从人类视频到机械臂的跨具身迁移。ATM 项目新闻

汶川在合作网络中也处于枢纽位置:其与伯克利博士后 Xingyu Lin、斯坦福硕士生 John So,以及香港中文大学 Qi Dou、伯克利 Pieter Abbeel 共同署名,使其博士训练同时连接清华、伯克利、斯坦福与香港的机器人学习群体。后续论文列表显示其仍参与 General Flow、FP3、MotionTrans 等视觉/3D 机器人操作研究。论文列表

2. 胡英东(Yingdong Hu)(2021级博士生,直接指导)

清华在 CoPa 项目新闻中明确标注胡英东为“2021级博士生”。他参与 CoPa 的核心研究,工作以视觉语言基础模型识别任务相关物体部件、生成部件间空间几何约束,并将其转为抓取与运动规划所需的位姿序列;该项目中高阳为通讯作者。CoPa 项目新闻

胡英东此后持续参与团队的代表性工作,包括 Data Scaling Laws in Imitation Learning for Robotic Manipulation、OneTwoVLA、通用视觉运动操作等。他与林凡淇等人共同推动团队从基础模型辅助规划,进入数据规模定律、显式推理与动作统一建模阶段,是高阳团队“数据采集—模仿学习—VLA”方向的关键学生节点。

3. 王圣杰(Shengjie Wang)(2023级博士生,直接指导)

王圣杰在 CoPa 清华新闻中被明确列为“2023级博士生”。他参与 CoPa 的开放世界通用操纵研究,后续论文覆盖 EfficientZero V2、SpeedyZero、DexCatch、SKIL、OneTwoVLA、在线模仿学习等,研究横跨高效强化学习、灵巧手操作与 VLA 策略。论文列表

其培养价值在于连接两条方法线:一端是 EfficientZero 系列代表的样本效率和模型规划,另一端是面向真实世界操作的视觉运动策略。这也体现出高阳团队并非把“强化学习”和“机器人操作”分割培养,而是鼓励学生在算法与系统之间建立连续能力。

4. 林凡淇(Fanqi Lin)(预研生/团队核心成员,共同研究与培养)

清华对 CoPa 的报道明确称林凡淇为交叉信息研究院预研生、论文共同第一作者。其后作为 Data Scaling Laws in Imitation Learning for Robotic Manipulation、OneTwoVLA 的共同第一作者,已成为团队数据高效机器人学习方向最活跃的作者之一。

Data Scaling Laws 项目收集超过 40,000 次人类示范、完成超过 15,000 次真机评测,结论强调机器人泛化更依赖环境和对象多样性,而非单纯堆叠同质演示数量;该工作获得 CoRL 2024 X-Embodiment Workshop 最佳论文奖。对于学生培养而言,这代表团队将大规模、可复现实证研究与真实世界部署融入训练过程,而非仅依赖仿真基准。成果报道

5. 黄浩栩(Haoxu Huang)(预研生,直接项目指导)

黄浩栩同为 CoPa 的预研生与共同第一作者。其工作聚焦使用 GPT-4V、分割/定位和空间约束来解决任务导向抓取与后续路径规划问题。CoPa 在现实世界日常操作实验中报告最高 63% 成功率,并可与 ViLa 等高层规划组合执行手冲咖啡、餐桌布置等长程任务。CoPa 项目新闻

黄浩栩的参与显示,高阳团队采用“预研生早期介入顶会项目”的培养机制:学生可在进入正式研究生阶段前参与从视觉语言模型理解、几何约束到真机执行的完整链路。

6. 团队协作式培养网络

除上述人员外,公开论文作者还包括 Weirui Ye、Ruiqian Nai、Jiacheng You、Tong Zhang、Chengbo Yuan、Kaifeng Zhang、Jialei Huang 等活跃成员;但公开页面未对每个人的学籍与独立导师关系提供一致、完整说明,因此本报告将其界定为“高阳团队的共同研究者/合作者”,而不一概称为直接博士生。团队培养网络同时与 Li Yi、Hang Zhao、Huazhe Xu、Chongjie Zhang 等清华及外部合作者交织,学生通过共同论文自然进入视觉、强化学习、机器人和具身大模型的交叉社区。


四、学术合作网络

4.1 师承与伯克利核心圈

高阳的首要师承关系是 Trevor Darrell → 高阳。Darrell 的视觉研究背景奠定了其“从视觉经验学习控制”的技术方向。与此同时,高阳在伯克利机器人学习共同体中与 Pieter AbbeelSergey LevineHuazhe Xu(许华哲)Ji LinFisher YuThanard Kurutach 等形成论文合作网络。

  • Sergey Levine、Trevor Darrell、Huazhe Xu、Ji Lin、Fisher Yu 合作的 2018 年不完美示范强化学习,将噪声或非专家示范纳入 RL,属于其从视觉/示范到控制的早期连接。
  • Pieter Abbeel、Thanard Kurutach、Weirui Ye、Shaohuai Liu 合作的 EfficientZero,构成高阳在样本效率 RL 上最具影响力的国际合作节点。该论文被 NeurIPS 2021 接收,后续有 EfficientZero V2、SpeedyZero 延展。
  • Pieter Abbeel 共同指导/合作的 ATM、基础先验强化学习等工作,反映二人关系已从传统作者合作延展至跨校学生项目和机器人学习议题。

值得注意的是:伯克利网络中 Trevor Darrell 是正式博士导师,Pieter Abbeel 是强合作与共同指导节点;这种“视觉师承 + 机器人学习协作”的双重结构,是理解高阳研究路线的关键。

4.2 清华交叉信息院与国内合作圈

清华交叉信息院为高阳提供了视觉、强化学习、机器人和理论计算机交叉的平台。在校内及论文合作层面,重要节点包括:

  • 姚期智:作为交叉信息研究院院长和平台建设者,构成高阳回国任教和团队发展的制度性连接;
  • 许华哲(Huazhe Xu):伯克利合作关系延续至国内,双方在视觉强化学习、离线/在线 RL、机器人策略等多个方向共同署名;
  • 赵行(Hang Zhao):通过语义—几何表征、RoboEngine 等论文连接机器人视觉与数据增强;
  • 李毅(Li Yi):在触觉、3D 感知及机器人操作工作中形成协作;
  • 张崇洁(Chongjie Zhang):在模仿学习、偏好强化学习、规划与决策研究中合作;
  • 吴翼、陈建宇、许华哲:均为伯克利培养、活跃于国内具身智能的学者/创业者。公开论坛报道将高阳、吴翼、许华哲、陈建宇并称为“伯克利四子”,反映他们在国内具身智能交流和产业生态中的紧密同代联系。相关报道

4.3 跨机构机器人与基础模型合作圈

高阳的合作网络不局限于单一实验室,而是以具体课题组织跨机构团队:

  • ATM(RSS 2024):清华—伯克利—斯坦福—香港中文大学协作。共同作者包括 Xingyu Lin、John So、Qi Dou、Kai Chen 和 Pieter Abbeel;高阳与 Abbeel 分别作为清华和伯克利端的指导节点。
  • CoPa(IROS 2024):从 GPT-4V 等基础模型抽取物体部件的常识和空间约束,将大模型语义能力与抓取模型、轨迹规划结合,是“基础模型—机器人控制”协作网络的代表。
  • OneTwoVLA(ICLR 2026):论文列表显示核心作者为林凡淇、Ruiqian Nai、胡英东、游嘉诚、赵俊明和高阳;公开报道还显示该项目由清华、复旦、上海期智研究院、上海人工智能实验室与千寻智能联合推出。该合作把学校、研究院、产业公司汇入一个统一 VLA 模型项目。项目报道
  • Data Scaling Laws(ICLR 2025):以真实人类示范和真机评测为中心,连接清华、上海期智研究院和上海人工智能实验室的研究人员,为后续产业数据采集路线提供实证基础。

4.4 代表性研究成果如何映射合作网络

  1. EfficientZero:高样本效率模型式视觉强化学习,连接伯克利 RL 社群与清华团队;其技术目标是将 RL 从海量模拟交互推进至可承受的真实数据规模。
  2. ATM:通过点轨迹而非像素级视频生成提取控制信息,连接视频理解、视觉表征与跨具身迁移。
  3. CoPa:连接视觉语言基础模型、分割、抓取和几何运动规划,代表高阳团队从端到端学习走向“模型常识 + 显式几何”的混合路线。
  4. Data Scaling Laws / OneTwoVLA:连接数据工程、模仿学习、VLA 推理和产业数据闭环,标志研究从单任务算法扩展至通用机器人基座能力。

五、业界合作关系深度分析

5.1 千寻智能:高阳最直接的产业化枢纽

高阳是 千寻智能联合创始人,公开报道多以“联合创始人兼首席科学家”称之。公司于 2024 年初由高阳与韩峰涛等人创立,面向通用人形机器人、具身大模型和学习算法。高阳承担算法与具身智能技术路线侧职责;韩峰涛拥有珞石机器人联合创始人经历和工业机器人量产经验;郑灵茵等成员覆盖商业化,这一组合对应“AI 算法—机器人本体/制造—市场交付”三类关键能力。公司与团队报道

从技术上看,千寻智能与高阳的学术主线高度同构:

  • 数据金字塔:清华官方给出的 TR35 入选理由明确指出,高阳提出“数据金字塔”训练框架,用高效 RL 突破数据效率瓶颈,使通用机器人从“能看”向“能动手”获得可扩展路径。该框架可理解为将互联网视频、真实交互和强化学习数据分层组合,而非单纯依赖昂贵的逐帧真机示教。
  • VLA 与人形机器人模型:Spirit 系列面向视觉、语言和动作的统一建模,延续高阳团队在视频先验、模仿学习、推理与动作统一上的研究;OneTwoVLA 则代表其学术与产业合作在统一推理—行动模型方面的共同推进。
  • 数据—模型—部署闭环:企业场景提供真实任务数据,数据改进模型,模型再进入更多场景。这与高阳的 Data Scaling Laws 研究高度契合:其核心不是机械增加演示次数,而是提高对象和环境组合的多样性。

因此,千寻智能不是高阳的外围商业背书,而是其研究路线在数据采集、真机评估、模型部署和迭代速度上的核心产业节点。

5.2 技术公司、产业客户与资本网络:从“合作”到“数据闭环”

公开报道显示,千寻智能已与多个科技和产业主体形成不同深度的连接;需要区分这些关系的性质,避免将投资、场景试点、共同研发混为一谈。

关联方 公开关系类型 与高阳技术路线的意义
上海人工智能实验室、上海期智研究院、复旦大学 OneTwoVLA 等联合研究 为 VLA 训练、具身推理数据与基础模型研究提供科研协作网络
华为哈勃、顺为资本等 投资方(媒体公开报道) 提供资本支持;不直接等同于技术合作或产品采购
京东 投资/零售场景关联(媒体公开报道) Moz 机器人进入线下门店探索零售应用,提供开放环境的任务与数据反馈
宁德时代 产业场景合作(媒体公开报道) 人形机器人进入动力电池 PACK 产线,验证复杂工业操作及高可靠性要求
博世 产业合作(媒体公开报道) 有助于接触工业制造和机器人零部件/场景生态,但具体研发分工未由权威公开材料完全披露

媒体报道还称千寻智能使用可穿戴设备建设人类操作数据采集网络,并在多地开展采集;若该能力持续规模化,将直接服务高阳“视频先验 + 真机交互 + 强化学习”的数据金字塔构想。与此同时,应把各项商业性能、融资估值和评测排名视作企业或媒体披露,不应替代独立第三方技术测评。产业合作与数据路线报道

5.3 CV/RL 技术生态中的公司级连接与战略判断

高阳的业界网络横跨三类技术生态:

  1. 全球强化学习生态:EfficientZero 站在 MuZero、MCTS、Atari 与 DMControl 等国际基准体系上,论文作者含 Pieter Abbeel 等伯克利学者。OpenAI 联合创始人对该工作给予肯定的说法见清华 TR35 新闻;其真正的战略价值在于“以有限数据学习”的能力可迁移到昂贵、危险、难以大量试错的机器人场景。清华官方新闻
  2. 视觉/基础模型生态:CoPa 用 GPT-4V 完成任务相关部件定位和空间约束生成;ATM 利用大规模人类视频提取动作相关轨迹;OneTwoVLA 进一步统一推理与动作。这条线使其与大模型平台、视觉模型研究机构、机器人数据公司之间具有天然合作接口,但公开资料并不能证明高阳与某一家通用大模型公司存在排他性技术合作。
  3. 中国具身智能创业生态:与陈建宇(星动纪元)、许华哲(星海图)、吴翼(前边塞科技创始人,后加入蚂蚁集团强化学习实验室,现就职于Meta MSL)等伯克利同代学者/创业者共同构成一个高密度人才和技术网络。它们在技术路径上既有共同议题——数据、VLA、真机泛化、强化学习——也存在市场竞争;因此更准确的表述是“学术与产业生态关联”,而非把同行一概认定为商业合作伙伴。

总体来看,高阳业界连接的深度主要体现在“算法创新可在产业场景中被验证,产业数据又反哺算法研究”的闭环,而非仅以企业数量或融资规模衡量。其竞争优势来自视觉、RL 与机器人操作三种技术语言之间的翻译能力;其挑战则是将顶会算法在成本、稳定性、安全性、硬件差异和长期运维条件下持续转化为可复用产品能力。


六、重要奖项与学术兼职

重要奖项与认可

  1. 《麻省理工科技评论》TR35 中国区入选者(2025 年度榜单,2026 年 7 月公布):清华交叉信息院于 2026 年 7 月 27 日发布消息,确认高阳入选《麻省理工科技评论》2025 年度“35 岁以下科技创新 35 人”(TR35)中国区榜单。其入选理由为:提出具身智能“数据金字塔”训练框架,以高效强化学习突破数据效率瓶颈,为通用机器人由“能看”至“能动手”提供可扩展路径。这是本报告所述的 TR35 China 2026 公布荣誉;榜单年度为 2025,院系公告发布时间为 2026,二者应明确区分。官方公告
  2. CoRL 2024 X-Embodiment Workshop 最佳论文奖Data Scaling Laws in Imitation Learning for Robotic Manipulation 获奖。该成果用大量示范和真机评测检验机器人操作的规模规律,具有方法论与工程数据价值。
  3. 顶会 Spotlight/高评价成果:CoPa 获 ICRA Workshop Spotlight Talk 邀请;ATM 被 RSS 2024 接收并获清华新闻所称“全数审稿人满分评价”。这些属于论文/项目层面的学术认可,而不等同于个人综合奖项。
  4. EfficientZero 的国际影响:论文获 NeurIPS 2021 接收,成为其代表性成果;清华官方报道强调其以显著少于传统方法的数据量达到 Atari 人类水平以上表现。该项应视为高影响研究成果,而非正式个人奖项。

学术兼职与公共学术角色

  • 清华大学交叉信息研究院助理教授、博士生导师;
  • 千寻智能联合创始人,并以首席科学家身份参与具身智能研发与产业转化;
  • 高阳的公开发表论文、会议项目与联合研究显示其持续参与 NeurIPS、ICML、ICLR、CoRL、RSS、ICRA、IROS 等国际学术共同体;
  • 上海期智研究院 PI 的公开论坛报道中,高阳与吴翼、许华哲、陈建宇同列为 PI。由于当前公开教师主页未完整列示其程序委员会、期刊编委或会议职务,本报告不将常规审稿活动扩写为未经证实的正式学术兼职。

成果谱系概览

高阳的论文谱系可归纳为四组:

  • 高效强化学习:EfficientZero、EfficientZero V2、SpeedyZero、Foundation Priors RL;
  • 示范与模仿学习:从不完美示范 RL、EfficientImitate、观察模仿学习到 Data Scaling Laws;
  • 视觉表征到控制:预训练视觉模型用于控制、ATM、General Flow、3D/触觉/空间感知;
  • 基础模型与具身大模型:CoPa、OneTwoVLA、机器人思维链、FP3 等。

这四组成果在论文列表中持续交叉,而非彼此独立,体现其以“数据效率、视觉先验与操作泛化”为长期主轴的研究风格。完整论文列表


七、Connection圈层总结

高阳的 Connection 圈层可概括为一个以“视觉先验驱动的高效具身学习”为中心、向学术和产业两侧扩张的多层网络。

第一圈层:师承与核心方法共同体

  • Trevor Darrell → 高阳 是正式博士师承主线,提供计算机视觉与感知研究根基;
  • Pieter Abbeel、Sergey Levine、Huazhe Xu、Ji Lin、Fisher Yu、Thanard Kurutach 构成伯克利强化学习与机器人学习合作群;
  • EfficientZero、ATM、基础先验 RL 等项目使高阳同时嵌入视觉和机器人学习两类国际网络。

该圈层的稀缺性在于:其学术身份并非单一“RL 算法研究者”或“机器人系统研究者”,而是在视觉表征、模型式 RL、模仿学习和真机操作之间持续搭桥。

第二圈层:清华—上海的具身智能研究网络

  • 清华交叉信息研究院是其独立团队、学生培养与多学科协作的主平台;
  • 许华哲、赵行、李毅、张崇洁等人构成校内/近邻研究协作网络;
  • 上海期智研究院、上海人工智能实验室及复旦等机构通过 OneTwoVLA、数据规模与 VLA 项目形成跨机构研究连接;
  • 汶川、胡英东、王圣杰、林凡淇、黄浩栩等学生和青年研究者是该圈层向外扩展的关键人才节点。

第三圈层:产业转化与真实数据网络

  • 千寻智能是最核心产业节点,使高阳直接连接人形机器人、真实场景部署、数据采集、产业客户与资本网络;
  • 京东、宁德时代、博世等关联方分别连接零售、动力电池制造和工业生态,但应按投资、场景应用、联合研发等具体性质审慎区分;
  • “数据金字塔”将互联网视频、人类示范、机器人交互和强化学习组织为可循环迭代的资产,构成其从学术方法走向产业模型的独特中介。

第四圈层:国内外同代创业与竞争合作生态

高阳与吴翼、陈建宇、许华哲等伯克利背景研究者共同构成中国具身智能的同代人才网络。他们共享早期深度 RL 和机器人学习的知识背景,在论文、论坛、研究院平台上存在交流,也分别通过千寻智能、星动纪元、星海图、边塞科技(吴翼,现Meta)等组织走向不同技术和商业路径。这一圈层应理解为高密度“竞合”生态:合作推动学术思想、人才和评测标准流动,竞争则推动数据、模型、硬件与场景落地速度。

总结

高阳的网络结构可浓缩为:Trevor Darrell 的视觉师承为根,伯克利 RL/机器人学习共同体为方法核心,清华交叉信息院与上海研究机构为人才和协作平台,千寻智能为真实数据与产业验证引擎。 其最显著的连接力不在于拥有大量松散公司关系,而在于将视觉先验、样本高效强化学习、示范数据、基础模型推理和真机操作连续地组织起来。TR35 中国区入选进一步确认了这一技术—产业路线在具身智能领域的公共影响力。