清华大学 丁宁 助理教授
报告生成时间:2026年8月20日
个人主页:丁宁
所属团队:清华大学自然语言处理与社会人文计算实验室(THUNLP)
一、学者基本信息
| 字段 | 内容 |
|---|---|
| 姓名 | 丁宁(Ning Ding) |
| 出生年份 | 未公开(待核实) |
| 职称 | 清华大学电子工程系助理教授、博士生导师(长聘教轨,2025年5月正式入职) |
| 所属单位 | 清华大学电子工程系(信息认知与智能系统研究所) |
| 实验室职务 | THU-C3I(协同交互智能课题组)成员;PRIME-RL 研究组负责人;同时为 THUNLP 核心成员/校友 |
| 学术头衔 | 清华大学水木学者(博士后阶段,2023–2025);中国科协青年人才托举工程入选者 |
| 国家级人才 | 中国科协"青年人才托举工程"(具体年度待核实) |
| 其他任职 | OpenBMB 开源社区主要发起者之一/核心贡献者;北京自然意志科技有限公司创始人、实际控制人 |
| 邮箱 | dingning@mail.tsinghua.edu.cn |
| 研究方向 | 大语言模型基础设施、知识计算与高效学习、推理智能(强化学习驱动)、对齐、具身/通用物理智能 |
关于职称的重要说明:任务提供的背景将其当前职称描述为"清华大学水木学者/研究员(博士后)"。经多方核实,"水木学者"系其 2023–2025 年博士后阶段身份;自 2025 年 5 月起,丁宁已正式转为清华大学电子工程系助理教授(长聘教轨)、博士生导师(清华电子系官方页面登记入职时间为 2025-04-29,个人主页 2025 年 1 月即公布 Career Update)。故其当前职称应为"助理教授",而非"研究员"。此外,其博士导师实为郑海涛教授(主要导师)、刘知远教授(共同指导),并非"师从刘知远/孙茂松"——孙茂松教授为 THUNLP 实验室学术带头人及多篇论文通讯作者,并非其直接指导导师。
二、教育背景与职业履历
丁宁的学术轨迹横跨华中科技大学、清华大学计算机系与电子工程系,是典型的"清华自培养"青年学者路径,并在博士后期完成从 NLP 基础设施研究到推理智能与具身智能研究的方向拓展。
教育阶段:本科毕业于华中科技大学计算机科学与技术学院,2018 年获学士学位(据清华电子系官方页面)。2018 年进入清华大学计算机科学与技术系攻读博士学位,2023 年获博士学位,博士论文方向为"大语言模型的对齐与适配"(据其共同导师刘知远课题组页面)。其博士培养采用双导师制:主要导师为清华大学深圳国际研究生院郑海涛副教授,共同指导教师为清华大学计算机系刘知远教授。2021 年百度奖学金官方介绍亦明确其"师从郑海涛教授,也得到了刘知远教授的共同指导,主要研究自然语言处理和机器学习,尤其是知识表示、提取与应用"。需要指出,用户背景中"师从刘知远/孙茂松"的表述不完全准确——孙茂松教授为 THUNLP 实验室学术带头人,在丁宁多项重要成果(如 Delta Tuning、PRIME)中担任通讯作者,但非其直接指导教师。
博士后阶段:2023 年博士毕业后,丁宁留在清华大学,转入电子工程系从事博士后研究,合作导师为周伯文教授(清华大学电子工程系长聘教授、惠妍讲席教授,IEEE Fellow,前京东 AI 负责人、IBM Watson 首席科学家)。在站期间入选清华大学"水木学者"计划与中国科协"青年人才托举工程",研究重心从大模型训练/微调基础设施逐步转向以强化学习驱动的大模型推理能力(reasoning)。
助理教授阶段:2025 年 1 月,丁宁在个人主页宣布 Career Update;同年 4 月 29 日清华大学电子工程系官方页面登记其入职,5 月起正式以"助理教授、博士生导师"身份开展工作,依托 THU-C3I(协同交互智能)课题组与自建 PRIME-RL 研究组,招收博士生、博士后与访问学生。其当前研究面向基础模型的强推理能力构建(理论、方法与系统),并向科学创新与通用物理智能等高价值场景延伸。
关键时间线小结:
| 时间 | 阶段 | 单位/身份 | 导师/合作导师 |
|---|---|---|---|
| 2018 | 本科 | 华中科技大学计算机科学与技术学院 | — |
| 2018–2023 | 博士 | 清华大学计算机科学与技术系 | 郑海涛(主要)、刘知远(共同) |
| 2023–2025 | 博士后(水木学者) | 清华大学电子工程系 | 周伯文 |
| 2025.1 宣布 / 2025.4.29 登记入职 / 2025.5 报道 | 助理教授、博士生导师 | 清华大学电子工程系 | — |
三、学生培养情况
丁宁于 2025 年方正式获聘助理教授并取得博导资格,其独立指导的博士生队伍尚处于组建起步阶段。因此本节以两类来源整理其"团队培养"关系:一是其作为 PRIME-RL 研究组负责人/通讯作者(论文署名标注 *)所主导的研究中担任第一作者或核心成员的青年研究者(多为其博士后阶段牵头项目中的团队成员/合作研究生/工程师);二是其博士与博士后期间共同参与 OpenBMB、MiniCPM、PRIME 等项目中由其作为主要作者之一带动协作的青年成员。下列人员中,确切"师生指导关系"与现职单位以公开论文署名为主要依据,未获官方确认者标注"(待核实)"。
1. 崔淦渠(Ganqu Cui,PRIME-RL 研究组核心成员/第一作者,团队 lead 指导)
PRIME(Process Reinforcement through Implicit Rewards)与 Entropy Mechanism 等丁宁作为通讯作者主导的工作的第一作者,亦为 MiniCPM 作者之一,是丁宁当前研究组最核心的青年合作者。其确切身份(博士生/研究助理/博士后)与单位(疑为清华大学电子工程系或相关联培)待核实。
2. 左宇忻(Yuxin Zuo,PRIME-RL 研究组成员,团队 lead 指导)
TTRL(Test-time Reinforcement Learning,NeurIPS 2025)第一作者,并参与 SimpleVLA-RL、RL for LRM 综述等多项丁宁主导工作,为研究组活跃成员。身份与单位待核实。
3. 李昊展(Haozhan Li,PRIME-RL 研究组成员,团队 lead 指导)
SimpleVLA-RL(视觉-语言-动作模型强化学习)第一作者,参与 Entropy Mechanism 等工作,方向偏具身/机器人。身份与单位待核实。
4. 张开颜(Kaiyan Zhang,合作研究者/共同作者,团队 lead 协作)
RL for Large Reasoning Models 综述的牵头作者之一,参与 TTRL 等工作,在强化学习领域具有较高可见度。其是否为丁宁直接指导学生待核实(疑似具有其他主导师或为跨机构合作者)。
5. 张宇辰(Yuchen Zhang,PRIME-RL 研究组成员,团队 lead 指导)
Entropy Mechanism 等工作的共同第一作者,参与多篇研究组论文。身份与单位待核实。
6. 瞿尚(Shang Qu,合作研究者/共同作者,团队 lead 协作)
TTRL 共同作者,亦见于 THUNLP 体系相关研究,疑为 THUNLP 成员/联培学生。身份与单位待核实。
7. 陈佳成(Jiacheng Chen,PRIME-RL 研究组成员,团队 lead 指导)
Entropy Mechanism 等工作的共同第一作者。身份与单位待核实。
补充说明:丁宁在 OpenBMB 与 MiniCPM 时期亦与一批青年作者形成"带动式"协作关系,如胡声鼎(MiniCPM 第一作者)、涂宇鸽、韩旭、彭昊、姚远、陈伟泽、秦禹嘉(Delta Tuning 共同第一作者)等,但这些成员多由刘知远、孙茂松等 THUNLP 资深教师指导,丁宁彼时为学生身份,更接近"核心贡献者/同侪协作"而非"导师"。待其助理教授阶段招生稳定后,可进一步补充其独立指导的博士生名录。
四、学术合作网络
4.1 实验室内部合作(THUNLP 与 THU-C3I)
丁宁的合作网络具有显著的"双轨"特征:博士阶段依托 THUNLP(清华计算机系自然语言处理与社会人文计算实验室),博士后及助理教授阶段则深度融入清华电子工程系 THU-C3I(协同交互智能课题组)。两套网络通过其本人形成桥接。
THUNLP 体系(计算机系侧):
- 刘知远(Zhiyuan Liu):博士共同指导教师,THUNLP 学术带头人,清华大学计算机系教授、面壁智能联合创始人兼首席科学家。是丁宁合作最频繁、关系最紧密的资深学者,二人合著涵盖 Delta Tuning(Nature Machine Intelligence 封面)、PRIME、MiniCPM、OpenPrompt/OpenDelta 等几乎所有代表性工作。
- 孙茂松(Maosong Sun):THUNLP 实验室主任/学术带头人,清华大学计算机系教授。在 Delta Tuning、PRIME 等论文中担任通讯作者,为丁宁所在实验室的资深领军人物(非直接导师)。
- 郑海涛(Hai-Tao Zheng):博士主要导师,清华大学深圳国际研究生院(SIGS)副教授、知识工程研究中心副主任。与丁宁在 OpenPrompt、Delta Tuning 等大模型高效学习方向有密切合作。
- 韩旭(Xu Han)、彭昊(Hao Peng)、姚远(Yuan Yao)、陈伟泽(Weize Chen)、秦禹嘉(Yujia Qin):THUNLP 核心成员/校友,在 PRIME、Delta Tuning、MiniCPM 等工作中与丁宁长期共事,构成其同辈合作圈。
THU-C3I 体系(电子系侧):
- 周伯文(Bowen Zhou):博士后合作导师,清华大学电子工程系长聘教授、惠妍讲席教授,IEEE Fellow、CAAI 会士,2020 年吴文俊人工智能杰出贡献奖得主,曾任京东集团高级副总裁/人工智能研究院创始院长、IBM Watson 首席科学家。在 PRIME、TTRL、Entropy Mechanism、SimpleVLA-RL 等丁宁近年主导工作中为资深合作者/共同通讯,是丁宁从 NLP 转向推理智能与具身智能方向的关键引路人。
4.2 跨机构合作
- 程宇(Yu Cheng):微软亚洲研究院研究员,PRIME、Entropy Mechanism 等工作的共同作者,是丁宁在推理/对齐方向的重要企业界合作者。
- 白磊(Lei Bai):上海人工智能实验室研究员,Entropy Mechanism 等工作共同作者,具身智能与世界模型方向合作。
- 欧阳万里(Wanli Ouyang):上海人工智能实验室/相关机构研究员,Entropy Mechanism 共同作者,视觉与具身智能领域资深学者。
- 齐必清(Biqing Qi)、孙有邦(Youbang Sun)、何冰翔(Bingxiang He)等:在 TTRL、RL for LRM 综述等工作中高频出现,疑为跨机构合作研究生/青年研究者(具体单位待核实)。
- 曾国洋(Guoyang Zeng):面壁智能联合创始人兼 CTO,刘知远本科学生,CPM-1/MiniCPM 核心工程负责人。与丁宁同为 MiniCPM 作者,代表 THUNLP—面壁智能的"师门—产业"协作通道。
4.3 国际合作
丁宁的论文合作网络中亦见国际学者身影,但其国际合作相对集中于联合培养/访问与综述性工作:
- Lifan Yuan:PRIME 等工作共同第一作者,疑为海外高校博士生/研究者(单位待核实),与丁宁在过程奖励模型方向密切合作。
- 在 RL for Large Reasoning Models 综述中,作者团队规模达 40 余人,涵盖国内外多个强化学习/推理方向青年学者,体现出丁宁在"RL for LLM reasoning"新兴方向上的社区组织力。
需说明,相较于 THUNLP—C3I 国内网络,丁宁的国际合作尚处发展期,公开可考的长期国际合作者较少。
五、业界合作关系深度分析
5.1 产业合作:OpenBMB 开源生态与 MiniCPM/CPM 系列
丁宁在产业界的可见度,首先来自其在 OpenBMB 开源社区的奠基性角色。OpenBMB 由清华大学 THUNLP 与面壁智能(ModelBest)联合发起,是大模型训练、微调、推理工具链的重要开源生态。丁宁被公开报道称为"OpenBMB 开源社区主要发起者之一/核心贡献者",并是其中多个核心工具的主要作者:
- OpenPrompt:提示学习通用编程框架,获 ACL 2022 最佳系统演示论文奖(Best Demo Paper),丁宁为主要作者。
- OpenDelta:大模型参数高效微调框架,配套 Delta Tuning 论文(Nature Machine Intelligence 2023 封面文章),丁宁为共同第一作者。
- BMTrain / BMInf:大模型高效训练与推理工具包,丁宁为主要贡献者之一。
在模型层面,丁宁是 MiniCPM(端侧大模型系列,主体语言模型 MiniCPM-2B)的署名作者之一,该工作由清华自然语言处理实验室与面壁智能联合发布,作者名单含胡声鼎、涂宇鸽、韩旭、崔淦渠、丁宁、曾国洋、李大海、刘知远、孙茂松等。MiniCPM 在 2024 年因"斯坦福 Llama3-V 抄袭事件"获得国际关注。此外,丁宁亦参与 CPM 系列相关工作(具体角色待核实)。
关于"面壁智能联合创始人"身份的说明:任务背景将丁宁标注为"面壁智能(ModelBest)联合创始人"。经核实,多家面壁智能 IPO 报道与公司披露显示,面壁智能的联合创始人体系为刘知远(首席科学家)、曾国洋(CTO)、李大海(董事长兼 CEO),未见丁宁被列为联合创始人的公开证据。丁宁与面壁智能的关系更准确的表述为:OpenBMB 核心贡献者、MiniCPM/CPM 系列合作作者、以及通过 THUNLP—刘知远形成的密切产业—学术协作。其是否曾以非公开方式参与面壁智能早期创立,公开信息无法证实,故"面壁智能联合创始人"一项标注为(待核实)。丁宁本人另创立了独立公司"自然意志"(见 5.2)。
5.2 创业孵化:自然意志(通用物理智能)
丁宁于 2026 年 1 月 8 日创立北京自然意志科技有限公司,担任创始人、实际控制人,聚焦"通用物理智能/具身大脑"方向,研发通用物理智能操作系统与具身大脑算法体系,采用"世界模型 + 即时强化学习"双技术路线,为机器人及智能终端提供感知—决策—规划—控制的全栈算法方案(不直接生产机器人硬件)。公司法定代表人为王旭佩,与丁宁形成"技术研发 + 商业化运营"搭档。
公司成立半年内完成多轮融资,估值据报高达 40 亿元人民币,投资方涵盖 IDG 资本、真格基金、峰瑞资本、顺为资本、华方资本、绿洲资本、蚂蚁集团、宁德时代、红杉中国、凯辉基金、五源资本、华控电科等知名机构。这一创业方向与其助理教授阶段的研究重心(推理智能、强化学习、具身/VLA)高度同构,可视为其学术研究在产业端的延伸孵化。投资人对其评价集中于"infra 做得好""情商高、收放自如"等兼具工程落地与商业敏锐度的特质。
自然意志的成立,使丁宁成为继刘知远—曾国洋—李大海(面壁智能)之后,THUNLP 体系内又一位独立创业的青年学者,但其创业赛道(通用物理智能/具身)与面壁智能(端侧语言大模型)形成差异化。
六、重要奖项与学术兼职
| 年份(约) | 奖项/荣誉 | 备注 |
|---|---|---|
| 2021 | 百度奖学金(Baidu Scholarship) | 当年全球 10 位获奖者之一 |
| 2022 | ACL 最佳系统演示论文奖(Best Demo Paper) | OpenPrompt 工作 |
| 2023 | Nature Machine Intelligence 封面文章 | Delta Tuning,该刊 2023 年度最高引论文(引用超 1000 次) |
| — | 世界人工智能大会(WAIC)青年优秀论文奖 | — |
| — | WAIC·云帆奖 | 青年 AI 学者奖项 |
| — | 中国算力大会最佳学术论文奖 | — |
| — | 清华大学优秀博士论文 | 博士阶段 |
| — | 国家奖学金 | 博士阶段 |
| — | 中国科协"青年人才托举工程" | 国家级青年人才 |
| — | 清华大学水木学者计划 | 博士后阶段 |
| — | Stanford 全球前 2% 顶尖科学家 | — |
| — | 微软学者(Microsoft Scholar) | 用户背景提及;公开来源未见明确记载,(待核实) |
学术兼职方面,丁宁作为 OpenBMB 主要负责人长期参与开源社区建设与论文速读等学术传播活动;其个人主页显示当前研究组(PRIME-RL、THU-C3I)面向全球招收博士生、博士后与访问学生。其他正式学术兼职(如会议领域主席、期刊编委等)公开信息有限,待核实。
七、Connection圈层总结
丁宁的学术关系网络呈现"年轻学者、双实验室桥接、开源生态奠基、独立创业延伸"的鲜明结构,可分五个圈层概括:
第一圈层——导师与核心引路人:郑海涛(博士主要导师,清华 SIGS)、刘知远(博士共同导师,THUNLP 学术带头人,面壁智能首席科学家)、周伯文(博士后合作导师,清华电子系长聘教授,前京东/IBM AI 高管)。三位资深学者分别奠定了其"知识表示—大模型高效学习—推理智能与产业落地"的研究脉络,刘知远与周伯文亦是其学术—产业双轨的关键纽带。
第二圈层——THUNLP 同辈与校友:韩旭、彭昊、姚远、陈伟泽、秦禹嘉、曾国洋等。这一圈层是其博士与 OpenBMB 时期最密集的合作者群,构成 CPM/MiniCPM/Delta Tuning/OpenPrompt 的共同建设者,并通过曾国洋—面壁智能形成师门—产业通道。
第三圈层——现单位同事与 PRIME-RL 团队:周伯文课题组(THU-C3I)同事,以及其作为研究组负责人带动的青年成员崔淦渠、左宇忻、李昊展、张宇辰、陈佳成等。该圈层是其助理教授阶段独立学术品格与学生培养体系的起点,但因此刻起步未久,规模与去向尚待后续观察。
第四圈层——跨机构与产业合作者:程宇(微软亚研院)、白磊、欧阳万里(上海 AI 实验室)等,以及面壁智能(通过 MiniCPM/OpenBMB 形成的协作)。此圈层将其推理/对齐/具身研究接入企业界算力与场景。
第五圈层——资本与创业网络:以自然意志公司为核心,连接 IDG 资本、真格基金、峰瑞资本、顺为资本、红杉中国、蚂蚁集团、宁德时代、凯辉、五源等顶级投资机构与产业方,构成其"通用物理智能"创业赛道的资本与产业生态。
总体而言,丁宁是 THUNLP 体系中近年成长最快、跨界最明显的青年学者之一:以 OpenBMB 基础设施奠基立身,以 Delta Tuning/PRIME/TTRL 等工作在"高效学习—推理强化学习"方向建立学术声誉,并在 2025 年完成从博士后到助理教授的身份转换、在 2026 年完成从学者到创业者的延伸。其网络结构兼具"清华自培养"的师门传承(郑海涛—刘知远—周伯文)与"开源—产业—资本"的外延扩张,是观察中国大模型青年学者"学术—创业"双轨路径的一个典型样本。需特别指出的是,其与面壁智能的关系应理解为 OpenBMB/MiniCPM 核心贡献者与合作作者,而非联合创始人,后者属用户背景中需更正之处。