北京大学 常宝宝 副教授
报告生成时间:2026年8月20日
个人主页:常宝宝
所属团队:北京大学计算语言学研究所 / 计算语言学教育部重点实验室
一、学者基本信息
| 字段 | 内容 |
|---|---|
| 姓名 | 常宝宝(Baobao Chang) |
| 出生年份 | 1971年 |
| 职称 | 副教授(博士生导师) |
| 所属单位 | 北京大学计算机学院 |
| 实验室职务 | 计算语言学教育部重点实验室副主任(Vice Director) |
| 学术头衔 | 《中文信息学报》编委;中国中文信息学会(CIPSC)会员;中国人工智能学会(CAAI)会员 |
| 国家级人才 | (待核实具体人才称号) |
| 其他任职 | 中文信息学会计算语言学专业委员会委员;人工智能学会自然语言理解专委会委员;计算机学会名词术语工作委员会委员 |
| 邮箱 | chbb@pku.edu.cn |
| 研究方向 | 自然语言处理、句法语义分析、依存句法分析、语义角色标注、中文语言资源工程、大语言模型推理与验证 |
二、教育背景与职业履历
常宝宝于1971年出生,1988年至1992年在山西大学计算机软件专业攻读学士学位,毕业后继续在山西大学攻读计算机应用方向硕士学位(1992—1995年)。1995年,常宝宝考入北京大学计算机科学技术系,攻读计算机软件与理论方向博士学位,1999年获理学博士学位。其博士导师极可能为俞士汶教授(1938—2021)——俞士汶自1990年起担任北京大学计算语言学研究所负责人/副所长,长期主持"现代汉语词语语法信息库"等国家科技攻关项目,常宝宝此后作为俞士汶的核心学术传承者,在综合型语言知识库(CLKB)项目中担任第三完成人,并与俞士汶、詹卫东合著《计算语言学概论》(2003年商务印书馆出版),师承关系从时间线、合作模式与学术传承上看均高度吻合(待核实确切师承关系)。
博士毕业后,常宝宝留校任教。1999年至2004年担任北京大学信息科学技术学院讲师,2004年晋升为副教授,并持续在北京大学计算语言学研究所从事教学与科研工作至今。他担任计算语言学教育部重点实验室副主任,是该实验室的核心管理成员之一。常宝宝曾代表北京大学计算语言学研究所参加首届Sighan汉语词语切分国际评测,取得一项开放测试第一名、一项封闭测试第二名的成绩,这一成果奠定了其在中文分词领域的学术声誉。
在科研项目层面,常宝宝作为负责人先后主持了多项国家自然科学基金项目和国家社会科学基金项目,并参与了多个国家863课题及973课题。他亦是CLKB项目的核心贡献者之一,该项目是中国最具影响力的中文语言知识库,已被国内外数百家学术机构和IT公司授权使用。
近年来,常宝宝的研究重心从传统句法语义分析向大语言模型方向延伸。根据DBLP数据库记录(截至2026年),常宝宝已发表244篇学术论文,近期工作涵盖LLM数学推理验证、幻觉检测(FaithLens)、长上下文推理增强(LongR、LongAct)、智能体任务规划等前沿方向,合作者包括清华大学孙茂松教授团队等。在ACL 2025和2026上,他以通讯作者身份发表多篇关于LLM推理与对齐的论文,表明其学术活跃度持续保持在一线水平。
三、学生培养情况
常宝宝长期与穗志方教授共同指导课题组,培养了大量硕士和博士研究生。其学生中多人进入DeepSeek、Apple等头部科技企业,成为核心技术骨干。以下列出已公开确认的学生及相关人员信息。
1. 沙磊(北京航空航天大学教授/DeepSeek前序职业经历,博士毕业生)
沙磊于2018年在北京大学获得博士学位,在读期间同时受穗志方、常宝宝和李素建三位老师指导。其博士研究方向为信息抽取与文本生成,在ACL、EMNLP、NAACL、AAAI等顶级会议上发表了多篇第一作者论文。博士毕业后,沙磊先在微软亚洲研究院(MSRA)担任研究助理,随后在Apple担任NLP研究科学家,负责Siri的领域分类和闲聊对话模块。此后,他赴英国牛津大学智能系统实验室从事博士后研究,合作导师为Thomas Lukasiewicz教授。目前,沙磊已回国任北京航空航天大学人工智能研究院教授。沙磊是常宝宝课题组培养的代表性学术人才之一,其从工业界到学术界的完整职业轨迹体现了PKU-ICL培养体系的多元出口。其个人主页(shi.buaa.edu.cn/shalei)明确记载了"worked with Prof. Zhifang Sui, Prof. Baobao Chang, and Prof. Sujian Li"的指导关系。
2. 许润昕(DeepSeek核心研究员,2020级硕士)
许润昕为北京大学计算语言学研究所2020级硕士生,师从穗志方与常宝宝,在课题组中研究少样本事件分类。2023年8月,许润昕加入DeepSeek,是最早从PKU-ICL加入DeepSeek的学生之一。此后,他的名字几乎贯穿了DeepSeek早期最重要的一批技术工作:从DeepSeek-MoE、DeepSeekMath、DeepSeek-Coder,到V2、V3、R1,均有参与。2021年,许润昕与王培懿、代达劢共同发表论文"Behind the Scenes",三人名字首次并排出现——彼时DeepSeek尚未创立,他们在穗志方与常宝宝的课题组中处于BERT范式时代。许润昕还参与了Math-Shepherd论文,该工作研究如何在缺少人工逐步标注的情况下为数学推理提供step-by-step verification,后被DeepSeek-R1论文讨论Process Reward Model时引用为前序工作之一。在DBLP记录中,许润昕(Runxin Xu)与常宝宝在ACL 2025论文"LLM Critics Help Catch Bugs in Mathematics"中为共同作者,表明师生合作关系在学生进入产业后仍在延续。
3. 王培懿(DeepSeek核心研究员,直博生)
王培懿本科就读于天津大学智能与计算学部(2016级),随后进入北京大学计算语言学研究所攻读直博,师从穗志方,在穗志方与常宝宝共同指导的课题组中开展研究。2023年9月DeepSeek初创时,在师兄许润昕的推荐下申请加入,后因认同DeepSeek对AGI的长期目标而留下。王培懿此前研究文本分类、LLM evaluation和alignment,在DeepSeek之前已与许润昕、代达劢等人多次合作。他参与了Math-Shepherd论文,后成为DeepSeek核心成员,参与了从DeepSeek-MoE到R1的全过程工作。在DBLP记录中,王培懿(Peiyi Wang)与常宝宝在ACL 2025论文"Towards A Better Initial Policy Model For Scalable Long-CoT Reinforcement Learning"中为共同作者,进一步证实了师生学术联系。天津大学校友会官方报道明确提及王培懿"师从穗志方教授"并"直博至北京大学计算语言学研究所"。
4. 代达劢(DeepSeek研究员,博士毕业生)
代达劢从北京大学计算语言学研究网络中走出,师从穗志方,在穗志方与常宝宝共同指导的课题组中开展研究。他与王培懿、许润昕于2021年共同发表论文"Behind the Scenes",三人名字首次并排出现,彼时研究的是少样本事件分类。代达劢后加入DeepSeek,成为DeepSeekMoE架构设计的关键贡献者之一,在稀疏化方向持续推进模型效率优化。DeepSeek技术谱系报道明确指出"代达劢和陈德里都从北大的计算语言学研究网络里走来,却分属不同导师:前者师从穗志方,后者师从孙栩",确认了代达劢与常宝宝课题组的关联。代达劢曾获EMNLP 2023最佳长论文奖("Label Words are Anchors"),并获中国中文信息学会优秀博士毕业论文、北京大学校长奖学金等多项荣誉。
5. 高博非(在读博士/合作研究者,大模型推理方向)
高博非(Bofei Gao)是常宝宝近年密切合作的研究者,在DBLP数据库中与常宝宝多次共同署名。二人在ACL 2025上合作发表了两篇论文:"LLM Critics Help Catch Bugs in Mathematics: Towards a Better Mathematical Verifier with Natural Language Feedback"(ACL Findings 2025)和"Towards A Better Initial Policy Model For Scalable Long-CoT Reinforcement Learning"(ACL Findings 2025)。前一篇论文研究如何利用自然语言反馈帮助LLM发现数学推理中的错误,后一篇研究可扩展长链推理强化学习的初始策略模型。值得注意的是,高博非与许润昕(Runxin Xu)在上述论文中同为共同作者,这表明常宝宝课题组内部的学术网络在学生进入产业后仍通过论文合作保持紧密联系。高博非的具体入学年份与当前状态(在读或已毕业)待核实。
6. 司书正(在读研究生/合作研究者,LLM对齐与智能体方向)
司书正(Shuzheng Si)是常宝宝近年密切合作的研究者,在DBLP数据库中与常宝宝频繁共同署名。二人在ACL 2025和2026上合作发表了多篇论文:包括"Aligning Large Language Models to Follow Instructions and Hallucinate Less via Effective Data Filtering"(ACL 2025主会)、"Rethinking Semantic Parsing for Large Language Models: Enhancing LLM Performance with Semantic Hints"(ACL 2025)、"Teaching Large Language Models to Maintain Contextual Faithfulness via Synthetic Tasks and Reinforcement Learning"(AAAI 2026)、"FaithLens: Detecting and Explaining Faithfulness Hallucination"(ACL Findings 2026)、"A Goal Without a Plan Is Just a Wish: Efficient and Effective Global Planner Training for Long-Horizon Agent Task"(ACL 2026主会)。这些工作涵盖了LLM对齐、幻觉检测、语义解析和智能体规划等前沿方向。司书正还与清华大学孙茂松教授团队(包括Fanqi Qi、Minjia Zhang等)合作,体现了常宝宝课题组与清华NLP团队的跨校协作。司书正的具体身份(硕士或博士、在读或已毕业)待核实。
7. 陈德里(DeepSeek研究员,实验室网络关联成员)
陈德里从北京大学计算语言学研究网络中走出,但师从孙栩教授(同属计算语言学研究所),与常宝宝课题组属同所不同导师的关系。他曾在腾讯任职,后加入DeepSeek。陈德里的代表作"Label Words are Anchors"获得EMNLP 2023最佳长论文奖(中国大陆首篇该奖项),该论文研究利用标签词作为锚点提升文本分类性能。此后,他的名字出现在DeepSeekMoE等DeepSeek核心技术工作中。虽然陈德里并非常宝宝的直接学生,但他在PKU-ICL同所环境中与常宝宝课题组的许润昕、王培懿、代达劢等人形成了紧密的合作网络——2021年的"Behind the Scenes"论文及Math-Shepherd论文中,这些名字已多次并排出现。
8. 刘天宇(合作研究者,数学验证与推理方向)
刘天宇(Tianyu Liu)在DBLP数据库中与常宝宝多次共同署名,合作论文包括"LLM Critics Help Catch Bugs in Mathematics"(ACL Findings 2025)和"Towards A Better Initial Policy Model For Scalable Long-CoT Reinforcement Learning"(ACL Findings 2025)等。刘天宇亦与许润昕(Runxin Xu)在上述论文中同为共同作者,表明他是常宝宝课题组在LLM推理方向的重要合作者。其具体身份(学生或博士后、入学年份等)待核实。
四、学术合作网络
4.1 实验室内部合作
北京大学计算语言学研究所(ICL)成立于1986年,2008年在此基础上成立计算语言学教育部重点实验室,是中国计算语言学研究的发源地之一。常宝宝在该实验室内部拥有深厚的合作者网络:
-
俞士汶(1938—2021):北京大学教授,计算语言学研究所原副所长(1990—2004年任职),中国中文信息处理领域主要开创者之一。俞士汶主导研制《现代汉语语法信息词典》,在此基础上构建的"综合型语言知识库"(CLKB)获2011年国家科技进步二等奖,常宝宝为该项目第三完成人。二人合著《计算语言学概论》(2003年商务印书馆出版,俞士汶主编,常宝宝、詹卫东合编),并合作发表"机器翻译与语言研究"(载《语言科学》2002年第1期)、"全信息标注语料库的开发与应用"(2001年中国中文信息学会二十周年学术会议)等多篇论文。俞士汶于2021年11月逝世,常宝宝在此后承担了CLKB学术传承的核心角色。
-
穗志方:北京大学计算机学院教授,计算语言学教育部重点实验室主任。穗志方是常宝宝在课题组运营中最紧密的合作者——两人共同指导了许润昕、王培懿、代达劢等多名学生,共同研究方向包括少样本事件分类、句法语义分析等。DeepSeek技术谱系报道明确提及"穗志方与常宝宝的课题组"。穗志方亦是CLKB项目的第二完成人。
-
王厚峰:北京大学教授,计算语言学研究所所长。王厚峰的研究方向为问答系统、对话系统、阅读理解等,与常宝宝的句法语义分析方向形成互补。二人共同支撑起ICL的学术领导架构,曾在软件与微电子学院共同开设NLP方向研究生课程。
-
詹卫东:北京大学中文系教授(2014年起),计算语言学研究所副所长(2004年起)。詹卫东与常宝宝同为俞士汶的学术传承者,三人合著《计算语言学概论》教材,并合作发表多篇论文。詹卫东在北大中文系开设计算语言学课程,与常宝宝在计算机学院的教学形成跨院系协同。
-
李素建(Sujian Li):北京大学计算语言学研究所教师,与常宝宝、穗志方共同指导了沙磊等学生。李素建的研究方向包括信息抽取、文本生成等,与常宝宝在学生联合指导中形成稳定的三人导师组模式。
-
孙栩:北京大学计算机学院教授,计算语言学研究所成员,研究方向为自然语言处理、机器学习、深度学习。陈德里师从孙栩,但与常宝宝课题组属同一研究所的紧密网络。
-
万小军:北京大学王选计算机研究所教授,研究方向为自然语言处理与文本挖掘。万小军虽属王选所而非ICL,但在北大NLP生态中与常宝宝形成跨所合作关系。
4.2 跨机构合作
-
刘群:中国科学院计算技术研究所研究员(现任腾讯AI Lab Director),是国内机器翻译和NLP领域的资深学者。刘群在《计算所与北大往事回顾》一文中回顾了自己与北大计算语言所的长期合作,文中明确提到"初稿写成后,我请了很多人帮我看,包括北大计算语言所的俞老师、詹卫东、常宝宝等人",表明常宝宝是刘群在北大方面的重要合作联系人之一。
-
孙茂松(Maosong Sun):清华大学教授,中国中文信息学会副理事长。近年来,常宝宝与孙茂松团队在LLM方向形成密切合作——在DBLP记录中,二人作为共同作者出现在多篇ACL 2025—2026论文中,合作内容包括LLM对齐、幻觉检测、智能体规划等。这一合作体现了PKU-ICL与清华NLP实验室在LLM时代的跨校协作。
-
亢世勇:鲁东大学中文信息处理研究所教授,与常宝宝、俞士汶合作发表"全信息标注语料库的开发与应用"(2001年),体现了常宝宝合作网络向地方院校的延伸。
-
李茹(Ru Li):山西大学教授,与常宝宝在框架语义解析方面有合作(DBLP记录:A Span-based Target-aware Relation Model for Frame-semantic Parsing, ACM TALIP 2023)。李茹所在山西大学恰好是常宝宝的本科与硕士母校,这一合作具有校友网络的背景。
4.3 国际合作
-
Chu-Ren Huang(黄居仁):香港理工大学教授,曾任北京大学计算语言学研究所境外兼职教授(Overseas Adjunct Research Professor)。黄居仁为美国康奈尔大学语言学博士(1987年),是国际计算语言学领域的重要学者,担任多个国际期刊编委。他与PKU-ICL的长期兼职关系为常宝宝及实验室其他成员提供了重要的国际合作通道。
-
Thomas Lukasiewicz:牛津大学智能系统实验室教授,是常宝宝学生沙磊在牛津博士后期间的指导导师。虽然Lukasiewicz与常宝宝的直接合作记录有限,但通过学生流动,PKU-ICL与牛津智能系统实验室建立了间接的学术联系。
五、业界合作关系深度分析
5.1 CLKB成果的产业化
常宝宝作为综合型语言知识库(CLKB)项目的第三完成人,该项目是中国最具影响力的中文语言知识库系统。据北京大学计算机学院官方页面介绍,CLKB"has been the most influential database of language knowledge for Chinese and has been widely used by hundreds of academic institutions and IT companies inside and outside China"。俞士汶百度百科词条亦记载CLKB"研发成果持续对外授权应用"。常宝宝的ScholarMate(学者网)主页亦提及"所取得的科研成果也多次实现使用权的对外转让"。这表明CLKB的产业化模式以技术使用权转让/授权(licensing)为主,面向IT企业和学术机构收取授权费用,是北京大学计算语言学研究所产学研结合的标志性案例。具体的授权企业名单与商业化规模待核实。
CLKB的产业化路径具有早期中国学术成果转化的典型特征:由国家级科研攻关项目(973、863计划等)支持研发,以语言知识资源为核心产品,通过授权使用的方式实现持续的技术转移。这一模式在2000—2010年代的中国NLP产业化中具有重要代表性。
5.2 学生网络向DeepSeek等头部AI企业的延伸
常宝宝与穗志方共同指导的课题组,近年来成为DeepSeek核心人才的重要输送通道。以下三条路径尤为突出:
路径一:许润昕—王培懿—代达劢的DeepSeek技术谱系。 三人同为PKU-ICL同门,在穗志方与常宝宝的课题组中研究少样本事件分类(BERT时代),2023年8—9月相继加入DeepSeek。此后,他们的名字贯穿了DeepSeek从MoE到R1的核心技术链路:许润昕参与DeepSeek-MoE、DeepSeekMath、DeepSeek-Coder、V2、V3、R1;王培懿参与Math-Shepherd、DeepSeekMath;代达劢参与DeepSeekMoE架构设计。这一群体构成了DeepSeek早期Reasoning团队的重要骨架。
路径二:沙磊的Apple—Oxford—北航轨迹。 沙磊在博士期间曾在微软亚洲研究院(MSRA)担任研究助理,毕业后在Apple负责Siri的NLP模块(领域分类与闲聊对话),再赴牛津从事博士后研究,最终回国任北航人工智能研究院教授。这一轨迹体现了PKU-ICL学生在国际顶级科技公司和研究机构中的竞争力,也为常宝宝课题组建立了与Apple Siri团队和牛津大学的间接联系。
路径三:课题组与清华NLP的跨校协作。 近年来,常宝宝与清华大学孙茂松团队在LLM方向形成密切合作(多篇ACL 2025—2026共同署名论文),合作者包括Fanqi Qi、Minjia Zhang等清华团队成员。这一跨校合作不仅扩展了常宝宝的学术网络,也为学生(如司书正)提供了多元的学术培养环境。DeepSeek技术谱系报道中亦指出,DeepSeek的人才网络"连接着MSRA NLC、北大计算语言学研究所、清华自然语言处理实验室",常宝宝课题组正是这一网络中的关键节点之一。
此外,从DBLP记录来看,常宝宝近期论文中出现了多位来自产业界的共同作者,包括Jason Zeng、Michael Heinrich、Elvis Zhang等(可能为企业研究人员或合作方),但具体合作关系与项目背景待核实。
六、重要奖项与学术兼职
| 奖项/兼职 | 等级/角色 | 年份 | 备注 |
|---|---|---|---|
| 国家科技进步二等奖 | 第二等级(排名第3) | 2011 | 综合型语言知识库(CLKB)项目 |
| 教育部科技进步一等奖 | 第一等级 | 2007 | CLKB项目省部级奖励 |
| 中国电子学会科技进步一等奖 | 第一等级 | (待核实具体年份) | CLKB项目省部级奖励 |
| Sighan汉语词语切分国际评测 | 开放测试第一名 | 2003(首届) | 代表北大ICL参赛 |
| Sighan汉语词语切分国际评测 | 封闭测试第二名 | 2003(首届) | 代表北大ICL参赛 |
| 《中文信息学报》编委 | 编辑委员会成员 | — | 持续任职 |
| 计算语言学教育部重点实验室 | 副主任 | — | 持续任职 |
| CIPSC计算语言学专业委员会 | 委员 | — | 持续任职 |
| CAAI自然语言理解专委会 | 委员 | — | 持续任职 |
| CCF名词术语工作委员会 | 委员 | — | 持续任职 |
| ACL/EMNLP/COLING等国际会议 | 程序委员会成员 | — | 持续参与 |
常宝宝共获得省部级以上科研奖励3项(国家科技进步二等奖1项、教育部科技进步一等奖1项、中国电子学会科技进步一等奖1项),在北大计算语言学研究所的教师群体中属于获奖层级最高的学者之一。
七、Connection圈层总结
常宝宝的学术关系网络可从以下圈层加以总结:
第一圈层:导师与师承核心。 俞士汶(1938—2021)是常宝宝的博士导师(极可能,待核实)和学术生涯的起点。俞士汶作为北大计算语言学研究所创始人之一和中国中文信息处理领域的主要开创者,为常宝宝奠定了语言资源工程和计算语言学的研究根基。CLKB项目是两人师承关系的物质载体,常宝宝作为第三完成人继承了这一学术遗产并在此后持续推动其发展和转化。
第二圈层:实验室共事核心。 穗志方、王厚峰、詹卫东、李素建、孙栩等人构成常宝宝在PKU-ICL内部的紧密合作圈。其中穗志方是最核心的合作者,两人共同运营课题组、共同指导学生,形成了"穗志方—常宝宝"双导师制的稳定模式。詹卫东则从中文系侧与常宝宝形成跨院系的计算语言学教学与教材合作。这一圈层支撑了ICL的整体学术运作。
第三圈层:学生培养网络。 常宝宝培养的学生(含共同指导)已形成一条清晰的人才输送链:从早期毕业生沙磊(北航教授,经历Apple/Oxford),到近年许润昕、王培懿、代达劢(均为DeepSeek核心技术骨干),再到当前活跃的高博非、司书正等(LLM推理与对齐方向),其学生网络覆盖了学术界(北航)、国际科技巨头(Apple、MSRA)和中国头部AI公司(DeepSeek)三大去向。特别是许润昕—王培懿—代达劢三人组在DeepSeek的技术谱系中扮演了关键角色,使常宝宝课题组成为DeepSeek人才网络的重要起源节点之一。
第四圈层:跨校与国际合作。 在国内,常宝宝与清华大学孙茂松团队近年来在LLM方向形成了密切的跨校合作关系(多篇ACL 2025—2026共同署名),刘群(中科院计算所/腾讯AI Lab)则代表了长期的跨机构NLP合作传统。在国际层面,Chu-Ren Huang(黄居仁,香港理工大学)作为PKU-ICL境外兼职教授提供了国际学术通道,Thomas Lukasiewicz(牛津大学)通过学生沙磊建立了间接联系。
第五圈层:产业与学术生态。 CLKB的授权使用模式是常宝宝产学研结合的传统路径,而学生向DeepSeek等头部AI企业的流动则是其产业联系的现代延伸。常宝宝课题组在BERT时代(少样本事件分类)到LLM时代(推理验证、对齐)的研究转型,恰与DeepSeek从早期MoE到R1的技术路线形成呼应——学生在课题组中的研究积累(如Math-Shepherd的step-by-step verification思路)直接为DeepSeek的后续技术突破提供了前序基础。这一从学术研究到产业应用的转化路径,是常宝宝学术网络中最具时代特征的维度。