南大LAMDA 许天 助理研究员
报告生成时间: 2026年7月
个人主页: https://www.lamda.nju.edu.cn/xut/ DBLP: https://dblp.org/pid/07/2985-3.html(消歧名 Tian Xu 0003,DBLP标注"Nanjing University, National Key Laboratory for Novel Software Technology, China") Google Scholar: https://scholar.google.com/citations?user=e5mnk1wAAAAJ ORCID: 0000-0001-9409-448X
一、学者基本信息
许天,男,南京大学人工智能学院助理研究员(雨秀青年学者),LAMDA研究所及LAMDA-RL Lab成员。模仿学习(Imitation Learning)理论方向的新锐学者,师从俞扬教授,博士毕业后留校任教,是LAMDA强化学习方向的青年骨干。
教育经历: - 2015-2019,西北工业大学数学与应用数学专业,学士 - 2019-2025,南京大学人工智能学院,计算机科学博士(导师:俞扬教授)
访问经历: - 2021年6-9月,香港中文大学(深圳),访问学者(合作导师:罗智泉教授)
工作经历: - 2025年起,南京大学人工智能学院助理研究员(雨秀青年学者) - LAMDA研究所成员,LAMDA-RL Lab骨干
研究方向: 强化学习的理论基础与算法设计,尤其聚焦于模仿学习(Imitation Learning)。当前主要工作方向包括:(1)对抗式模仿学习(Adversarial Imitation Learning)的理论分析,建立了模仿学习的一般性分析框架;(2)强化学习在大语言模型对齐中的应用(RLHF/ReMax/ReVal);(3)奖励模型的泛化性与鲁棒性研究。
博士学位论文: "Adversarial Imitation Learning: Theory and Methods"(对抗式模仿学习:理论与方法)。在读期间发表CCF/CAAI-A类论文11篇(其中一作3篇),CCF-B类论文2篇。
学术荣誉: - 2020年,研究生国家奖学金 - 2020年,KDD CUP 2020强化学习赛道亚军 - 2016年、2017年,本科生国家奖学金
教学工作: 2026年起与袁雷共同开设研究生课程"高级强化学习"(南京大学人工智能学院),教材为Sutton & Barto《Reinforcement Learning》(第二版)等。
实验室事务: 许天是LAMDA实验室招生联系邮箱(xut@lamda.nju.edu.cn)的负责人之一,承担实验室日常招生咨询工作。
学术服务: 担任NeurIPS(2022-)、ICML(2022-)、ICLR(2024-)、AISTATS(2024-)、UAI(2021-)、RLC(2024-)、EWRL(2022-)等国际会议审稿人。
代表性成果: - 建立了模仿学习算法的一般性分析框架,首次证明GAIL类方法在策略模仿和环境模仿中均可克服行为克隆的复合误差问题(NeurIPS 2020, TPAMI 2021) - 首次证明了离线对抗式模仿学习可归约为行为克隆(ICLR 2022 Blog Track) - 给出了对抗式模仿学习在小样本场景下的首个与视野长度无关(horizon-free)的模仿间隙界,回答了CoRL 2019最佳论文提出的开放问题(TPAMI 2026) - 提出首个在未知转移设定下达到最优专家样本复杂度的在线对抗式模仿学习方法MB-TAIL(UAI 2023 Oral) - 提出首个基于一般函数逼近的可证明高效对抗式模仿学习框架OPT-AIL(NeurIPS 2024) - 与李子牛等合作提出ReMax,一种简单高效的大语言模型对齐强化学习方法(ICML 2024) - 与李子牛等合作撰写《模仿学习简洁教程》(中文,2021年),被广泛引用和传播
二、DBLP数据统计
2.1 发表记录总览
DBLP pid: 07/2985-3(Tian Xu 0003),共34条发表记录(截至2026年7月),发表类型分布:期刊论文5篇、会议论文11篇、预印本/非正式发表18篇。
2.2 年度产出分布
| 年份 | 论文数 | 说明 |
|---|---|---|
| 2019 | 1 | 博士入学年,首篇arXiv预印本 |
| 2020 | 2 | NeurIPS 2020首篇顶会论文 |
| 2021 | 2 | TPAMI首篇期刊论文、NeurIPS Workshop |
| 2022 | 5 | ICLR Blog Track、多篇arXiv预印本 |
| 2023 | 7 | NeurIPS spotlight、UAI oral、综述 |
| 2024 | 8 | ICLR spotlight、ICML x2、NeurIPS |
| 2025 | 3 | ICLR、ICML、TNNLS |
| 2026 | 6(截至7月) | TPAMI x2、ICML x2、中国科学 |
趋势分析: 许天的论文产出自2022年起进入快速增长期,2023-2024年达到年均7-8篇的高产水平。2026年截至7月已有6篇正式发表,其中TPAMI 2篇、ICML 2篇,显示出留校任教后学术产出的持续上升势头。值得注意的是,许天的论文中顶会/顶刊占比极高——NeurIPS、ICML、ICLR、TPAMI等CCF-A类论文占绝大多数,且多篇获得spotlight或oral等杰出论文认定。
2.3 合作者网络总览
唯一合作者总数:44人。
2.4 核心合作者(按DBLP合作频次降序)
| 排名 | 合作者(DBLP名) | 合作次数 | 合作年份 | 身份/机构 |
|---|---|---|---|---|
| 1 | Yang Yu 0001(俞扬) | 31 | 2019-2026 | 博士导师,南大教授,LAMDA强化学习方向带头人 |
| 2 | Ziniu Li(李子牛) | 23 | 2019-2026 | 香港中文大学(深圳)博士生,罗智泉组,最紧密的合作伙伴 |
| 3 | Zhi-Quan Luo(罗智泉) | 10 | 2022-2026 | 港中大(深圳)副校长,IEEE Fellow,优化理论 |
| 4 | Zhilong Zhang(张智龙) | 6 | 2024-2026 | 俞扬硕转博学生,模仿学习/具身AI方向 |
| 5 | Fan-Ming Luo(罗凡明) | 5 | 2022-2024 | 俞扬博士(2025届→华为天才少年),离线RL方向 |
| 6 | Xingchen Cao(曹星辰) | 5 | 2023-2026 | LAMDA团队成员 |
| 7 | Yi-Chen Li 0001(李逸辰) | 4 | 2026 | LAMDA团队博士生/博士后 |
| 8 | Xiong-Hui Chen(陈雄辉) | 3 | 2024-2026 | 俞扬博士(2025届→阿里Qwen团队) |
| 9 | Zongzhang Zhang(章宗长) | 3 | 2024-2026 | LAMDA教授,强化学习方向 |
| 10 | Ruoyu Sun 0001(孙若愚) | 3 | 2024-2025 | 港中大(深圳)助理教授,优化理论 |
| 11 | Jing-Cheng Pang(庞竟成) | 3 | 2021-2025 | 俞扬博士(2025届→华为天才少年) |
| 12 | Chao Qian 0001(钱超) | 2 | 2026 | LAMDA教授,演化学习 |
| 13 | Zhi-Hua Zhou(周志华) | 2 | 2024-2026 | LAMDA所长,中国科学院院士 |
| 14 | Lei Yuan 0005(袁雷) | 2 | 2026 | LAMDA助理研究员,多智能体RL |
| 15 | Yihao Sun(孙逸豪) | 3 | 2025-2026 | LAMDA团队成员 |
| 16 | Chenyang Wang(王晨阳) | 2 | 2026 | LAMDA团队成员 |
| 17 | Congliang Chen(陈聪亮) | 2 | 2024-2025 | 港中大(深圳)相关合作者 |
| 18 | Zeyu Qin(秦泽宇) | 2 | 2023-2025 | 港中大(深圳)相关合作者 |
三、博士教育背景与导师追溯
3.1 本科阶段(西北工业大学,2015-2019年)
许天2015年考入西北工业大学数学与应用数学专业,2019年获理学学士学位。本科期间两次获得国家奖学金(2016年、2017年),展现了扎实的数学功底。数学专业的训练为其后续从事强化学习与模仿学习的理论研究奠定了重要基础。
3.2 博士阶段(南京大学,2019-2025年)
许天2019年以直博生身份进入南京大学人工智能学院,加入LAMDA研究所,师从俞扬教授。博士研究方向为对抗式模仿学习(Adversarial Imitation Learning)的理论与方法。
博士导师:俞扬(Yang Yu)
俞扬是南京大学人工智能学院副院长、教授、博士生导师,国家万人计划青年拔尖人才,IEEE AI's 10 to Watch(2018年),LAMDA强化学习方向的核心带头人。俞扬在DBLP上与许天合作31次(2019-2026年),是许天全部34篇DBLP论文中的核心通讯作者,合作覆盖许天学术生涯的全部阶段。俞扬本人师从周志华教授(2004-2011年博士),许天的学术谱系为:周志华→俞扬→许天,这条师承线是LAMDA在强化学习与模仿学习理论方向的核心传承脉络。
许天在俞扬指导下建立了模仿学习的理论分析框架,系统性地回答了"为什么对抗式模仿学习优于行为克隆""在什么条件下对抗式模仿学习等价于行为克隆""如何在有限样本下实现可证明高效的模仿学习"等核心理论问题。博士论文题目为"Adversarial Imitation Learning: Theory and Methods",以11篇CCF/CAAI-A类论文的成绩毕业,在LAMDA-RL Lab 2019级4位博士(许天、罗凡明、庞竟成、陈雄辉)中,许天是唯一留校任教者。
3.3 访问经历与罗智泉合作
2021年6-9月,许天访问香港中文大学(深圳),合作导师为罗智泉(Zhi-Quan Luo)教授。罗智泉是港中大(深圳)副校长、深圳市大数据研究院院长、IEEE Fellow,国际优化理论领域的权威学者。这段访问经历直接促成了许天与李子牛(Ziniu Li,罗智泉组2020级博士生)的深度学术合作,两人自2019年起共同发表23篇论文,成为许天最紧密的合作者。
四、LAMDA团队合作网络
4.1 LAMDA-RL Lab概况
LAMDA-RL Lab是LAMDA研究所下专注强化学习的研究团队,由俞扬教授和章宗长教授共同主导,研究方向涵盖模型强化学习与世界模型学习、多智能体协作RL、基于大模型的规划与学习等。团队的核心产品REVIVE是南栖仙策(Polixir Technologies)的下一代智能决策系统,将强化学习控制算法应用于真实工业场景。许天作为留校任教的博士毕业生,与袁雷共同构成了LAMDA-RL Lab的教学科研新生力量。
4.2 LAMDA教师同事合作关系
| 教师 | DBLP合作次数 | 合作年份 | 职位/方向 | 合作关系说明 |
|---|---|---|---|---|
| 俞扬(Yang Yu) | 31 | 2019-2026 | 教授/副院长,强化学习 | 博士导师,全部合作的核心 |
| 章宗长(Zongzhang Zhang) | 3 | 2024-2026 | 教授,强化学习 | 通过俞扬团队共同指导学生 |
| 钱超(Chao Qian) | 2 | 2026 | 教授,演化学习 | 跨方向合作(EDA/芯片布局) |
| 周志华(Zhi-Hua Zhou) | 2 | 2024-2026 | 教授/所长/院士 | LAMDA掌门人,通讯作者 |
| 袁雷(Lei Yuan) | 2 | 2026 | 助理研究员,多智能体RL | 同期留校,共同开课 |
重点说明: 许天的LAMDA教师合作关系高度集中于俞扬(31次),与其他LAMDA教师的合作刚刚起步(2024年以后),体现了其作为刚毕业博士留校任教的阶段特征——尚处于从"学生身份"向"独立研究者身份"过渡的早期。袁雷(2023届博士→助理研究员)与许天同为俞扬指导并留校的学生,两人共同开设"高级强化学习"课程,构成了LAMDA-RL Lab的青年教学搭档。
4.3 博士同门与同期团队成员
许天2019年入学,其博士在读期间的LAMDA-RL Lab同门包括:
| 姓名 | 入学/毕业 | DBLP合作次数 | 身份/去向 |
|---|---|---|---|
| 袁雷(Lei Yuan) | 2019-2023 | 2 | 2023届博士→南大助理研究员 |
| 罗凡明(Fan-Ming Luo) | 2019-2025 | 5 | 2025届博士→华为天才少年 |
| 庞竟成(Jing-Cheng Pang) | 2019-2025 | 3 | 2025届博士→华为天才少年 |
| 陈雄辉(Xiong-Hui Chen) | 2018-2025 | 3 | 2025届博士→阿里Qwen团队 |
| 管聪(Cong Guan) | 2020-2024 | 0 | 2024届博士→沈阳飞机设计研究所 |
| 朱正茂(Zheng-Mao Zhu) | 2018-2024 | 0 | 2024届博士→Minimax |
| 秦熔均(Rong-Jun Qin) | 2016-2023 | 0 | 2023届博士→南栖仙策CTO |
说明: 许天的同届同门(2019级)中,袁雷是博士(非直博),提前两年毕业留校;罗凡明和庞竟成与许天同年毕业,均入选"华为天才少年"计划。许天是2019级中唯一选择留校任教的博士毕业生,其11篇CCF/CAAI-A类论文的成绩在同届中位居前列。
4.4 当前合作的团队学生
| 姓名 | DBLP合作次数 | 合作年份 | 身份 |
|---|---|---|---|
| 张智龙(Zhilong Zhang) | 6 | 2024-2026 | 俞扬硕转博学生(2022级),研究方向为世界模型学习/模仿学习/具身AI |
| 曹星辰(Xingchen Cao) | 5 | 2023-2026 | 团队成员 |
| 陈泽轩(Zexuan Chen) | 2 | 2026 | 团队成员 |
| 陈瑞朔(Ruishuo Chen) | 2 | 2026 | 团队成员 |
| 孙逸豪(Yihao Sun) | 3 | 2025-2026 | 团队成员 |
| 王晨阳(Chenyang Wang) | 2 | 2026 | 团队成员 |
| 翟晓辰(Xiaochen Zhai) | 1 | 2026 | 团队成员 |
张智龙是许天留校后合作最密切的学生(6次),两人在对抗式模仿学习方向有多篇共同论文(含TPAMI 2026、NeurIPS 2024、ICML 2025),张智龙正在发展成为模仿学习方向的新一代学术力量。
五、业界合作关系深度分析
5.1 南栖仙策(Polixir Technologies)——LAMDA-RL Lab的产业化载体
许天作为LAMDA-RL Lab的成员,与南栖仙策有间接的技术关联。南栖仙策由俞扬教授创立并任CEO,核心技术源自LAMDA的强化学习研究成果。LAMDA-RL Lab的官方网站首页即展示REVIVE作为"Supported Product",说明实验室的研究成果直接支撑着南栖仙策的产品研发。许天的同门秦熔均(2023届博士)为南栖仙策CTO和联合创始人。
许天的研究方向——模仿学习——与南栖仙策的核心业务(离线强化学习、环境模型学习)构成互补关系:模仿学习解决"如何从专家示范中高效学习策略"的问题,离线强化学习解决"如何从历史数据中学习最优决策"的问题,两者共同构成了不依赖在线试错的智能决策技术路线。
5.2 香港中文大学(深圳)——罗智泉团队的国际合作网络
许天与港中大(深圳)的合作是其最重要的校外学术连接。这一合作以两条路径展开:
路径一:访问合作导师罗智泉
罗智泉(Zhi-Quan Luo)教授是港中大(深圳)副校长、深圳市大数据研究院院长,北京大学本科(1984年),MIT博士(1989年),IEEE Fellow,国际优化理论的权威学者。许天2021年夏季在罗智泉组访问3个月,此后与罗智泉共同发表10篇论文(2022-2026年),合作涵盖对抗式模仿学习的理论分析、大语言模型对齐中的强化学习等方向。罗智泉为许天的模仿学习理论提供了优化理论的视角和分析工具。
路径二:核心合作者李子牛
李子牛(Ziniu Li)是港中大(深圳)数据科学学院2020级博士生(导师罗智泉),本科毕业于西安交通大学电气工程及自动化专业,研究方向为强化学习、优化和学习理论。李子牛是许天在DBLP上合作次数第二高的学者(23次,2019-2026年),仅次于导师俞扬(31次)。两人的合作始于2019年(许天博士入学年),横跨许天整个博士阶段和留校任教后的全部年份,合作内容构成了许天学术成果的核心:
- 共同建立模仿学习分析框架(NeurIPS 2020, TPAMI 2021)
- 共同提出离线AIL到BC的归约(ICLR 2022)
- 共同完成小样本AIL的horizon-free界(TPAMI 2026)
- 共同提出MB-TAIL方法(UAI 2023)
- 共同提出不完美示范的模仿学习ISW-BC(NeurIPS 2023 spotlight)
- 共同提出ReMax大模型对齐方法(ICML 2024)
- 合作撰写《模仿学习简洁教程》(中文,2021年)
许天与李子牛的合作关系是一种典型的跨校"学术搭档"模式:两人分属不同学校、不同导师,但在模仿学习这一交叉方向上形成了极为紧密的共同研究。这种合作模式在近年来中国机器学习研究中并不常见,其持续时间之长(7年以上)和合作深度之大(23篇论文)值得关注。
5.3 孙若愚(Ruoyu Sun)——港中大(深圳)优化理论合作者
孙若愚是港中大(深圳)数据科学学院助理教授,研究方向为优化理论与深度学习。许天通过李子牛和罗智泉的合作网络与孙若愚建立了联系,共同发表3篇论文(2024-2025年),主要涉及大语言模型微调中的多样性保持(ICLR 2025)和ReMax方法(ICML 2024)。
5.4 LLM对齐方向的产业影响
许天近年的研究正在从纯理论的模仿学习分析转向大语言模型(LLM)对齐中的强化学习应用。这一转向使其研究与业界的实际需求产生了直接对接:
- ReMax(ICML 2024):与李子牛等合作提出的简单高效的LLM对齐RL方法,相比PPO大幅简化实现复杂度,实验表明其效果可比肩PPO。这一工作被多家大模型团队引用。
- ReVal(arXiv 2026):与王鹏远、李子牛等合作提出基于值函数的离策略LLM强化学习框架,在数学推理基准上超越GRPO,为大模型训练提供了新的技术路线。
- RLHF中的分布外偏好数据影响分析(ICLR 2024 Tiny Paper):分析了DPO与RL方法在不同数据分布下的表现差异。
- 奖励模型泛化性(ICML 2025):与张智龙等合作提出基于对抗过程增强偏好的奖励模型泛化改进方法。
这些工作虽然目前未在DBLP层面体现出与特定企业的直接合作署名,但其技术方向(LLM对齐、奖励模型、值基RL)与当前各大AI公司的核心研发需求高度契合。许天博士同门的去向——陈雄辉(阿里Qwen团队)、朱正茂(Minimax)——也从侧面反映了LAMDA-RL Lab与大模型产业界的人才输送关系。
5.5 华为——同门人才输送通道
许天本人与华为没有直接的合作论文记录,但其同届博士同门中有两人入选"华为天才少年"计划:罗凡明(2025届,离线RL方向)和庞竟成(2025届,交互式智能体方向)。此外,LAMDA-RL Lab的早期毕业生胡毅奇(2021届)也是"华为天才少年"。华为是LAMDA-RL Lab博士毕业生的主要去向之一。
5.6 Weinan Zhang(张伟男/张惟楠,上海交通大学)——综述合作
许天与上海交通大学的Weinan Zhang(张惟楠)在基于模型的强化学习综述论文中有合作(Science China Information Sciences, 2024),该综述由罗凡明主导,许天和陈雄辉等参与。
六、Connection圈层总结
第一圈层——博士导师俞扬: 俞扬(31次合作)是许天学术生涯中最核心的关系。作为博士导师,俞扬不仅指导了许天的全部研究工作,也为其留校任教提供了平台。许天在DBLP的34篇论文中,31篇有俞扬署名(占91%),反映了其作为刚独立的青年学者尚处于与导师深度绑定的阶段。许天的学术谱系——周志华→俞扬→许天——是LAMDA在强化学习/模仿学习理论方向的核心传承线。
第二圈层——李子牛与港中大(深圳)优化团队: 李子牛(23次合作)是许天最紧密的学术搭档,两人自2019年起在模仿学习理论方向保持了7年以上的持续合作。通过李子牛,许天与罗智泉(10次)、孙若愚(3次)等港中大(深圳)优化理论学者形成了稳定的合作网络。这一跨校合作网络是许天除LAMDA之外最重要的学术支撑。
第三圈层——LAMDA-RL Lab同门与学生: 张智龙(6次)、曹星辰(5次)、罗凡明(5次)等团队成员构成了许天的日常合作网络。许天留校后正在逐步建立自己的学生指导关系,张智龙是目前合作最密切的学生。袁雷(2次)作为同期留校的助理研究员,与许天共同承担教学任务。
第四圈层——LAMDA高层与跨方向合作: 周志华(2次)、钱超(2次)等LAMDA资深教授的出现在许天的合作列表中,主要以通讯作者身份参与跨方向合作项目(如芯片布局中的强化学习)。这类合作反映了许天作为LAMDA新生代教师开始参与实验室层面的大型项目。
第五圈层——间接产业连接: 许天目前没有DBLP层面的企业合作论文,但其所在的LAMDA-RL Lab通过南栖仙策(Polixir)、同门毕业生(华为天才少年、阿里Qwen、Minimax)等渠道与产业界保持着密切联系。许天在LLM对齐方向的研究(ReMax、ReVal、奖励模型泛化)具有强烈的产业应用潜力,预计随着其学术影响力的增长,直接的产学研合作将逐步建立。
产出规模与趋势: 34篇DBLP发表记录中,2023年以后占比约68%(23篇),2026年截至7月已有6篇。合作者总数44人,核心发表阵地为TPAMI(3篇)、NeurIPS(2篇)、ICML(4篇)、ICLR(3篇)、UAI(1篇)等机器学习/人工智能顶级会议和期刊。许天是一位典型的"理论驱动型"青年学者,其论文虽然数量不大,但顶会/顶刊命中率极高,多篇论文获得spotlight或oral认定,反映出其在模仿学习理论方向的深度与前沿性。
七、数据来源与局限性说明
本报告主数据来自DBLP官方作者消歧记录(pid: 07/2985-3,Tian Xu 0003,34条发表记录,44位合作者),并结合以下信息源:
- 许天个人主页(https://www.lamda.nju.edu.cn/xut/)
- 许天个人主页出版物列表(https://www.lamda.nju.edu.cn/xut/publication.html)
- 许天个人主页研究介绍(https://www.lamda.nju.edu.cn/xut/research.html)
- LAMDA-RL Lab官网(https://lamda-rl.nju.edu.cn/)
- LAMDA-RL Lab Alumni页面(https://lamda-rl.nju.edu.cn/alumni.html)
- 俞扬学生列表页面(https://www.lamda.nju.edu.cn/yuy/students.ashx)
- 高级强化学习2026课程主页(https://www.lamda.nju.edu.cn/advancerl26/)
- 港中大(深圳)数据科学学院学生页面
- 俞扬报告(本系列 nju_lamda_yuyang_network.md)
局限性说明:
-
DBLP身份消歧: "Tian Xu"在DBLP上共有5个同名作者(pid 07/2985及07/2985-1至07/2985-4)。许天对应的身份为"Tian Xu 0003"(pid 07/2985-3),标注机构为"Nanjing University, National Key Laboratory for Novel Software Technology, China",ORCID为0000-0001-9409-448X,与其个人主页信息一致。
-
职称说明: 许天个人主页标注为"Assistant Researcher (Yuxiu Young Scholar)",LAMDA-RL Lab Alumni页面记录其毕业去向为"南京大学博后"。综合信息判断,其当前职位为助理研究员/博士后(雨秀青年学者),而非此前俞扬报告中标注的"讲师"。本报告标题和正文中按其个人主页信息以"助理研究员"为准。
-
合作数据与俞扬报告的差异: 俞扬报告中记载与许天合作31次(2019-2026年),许天DBLP总共34条记录,说明许天的绝大多数论文(91%)都有俞扬参与。两个数据来源的记录数基本吻合。
-
产业化信息: 许天目前无DBLP层面的企业合作论文记录。其与产业界的联系主要通过LAMDA-RL Lab的整体产学研网络间接实现。随着其在LLM对齐方向的工作积累,直接的企业合作可能在未来几年出现。
-
Google Scholar数据缺失: 因网络限制未能获取Google Scholar的详细引用数据(H-index、总引用数等)。