人大高瓴 林衍凯 副教授
报告生成时间: 2026年7月
个人主页: https://linyankai.github.io/
学院主页: https://gsai.ruc.edu.cn/yankailin
DBLP: https://dblp.org/pid/161/0001-1.html(消歧标识 Yankai Lin 0001)
ORCID: 0000-0002-0151-6178
Google Scholar ID: j8K1FqEAAAAJ
Wikidata: Q130799507
一、学者基本信息
林衍凯,中国人民大学高瓴人工智能学院预聘副教授(Tenure-track Associate Professor),AI 华人青年学者。2010—2014年就读于清华大学计算机科学与技术系获学士学位,2014—2019年继续在清华大学计算机系攻读博士学位(依托智能技术与系统国家重点实验室 / THUNLP 实验室)。2019年7月博士毕业后加入腾讯微信模式识别中心(WeChat AI, Tencent Inc.)任高级研究员,2022年8月加入中国人民大学高瓴人工智能学院任预聘助理教授,2024年9月晋升为预聘副教授。
值得注意的是,其个人主页 CV 明确记载腾讯微信高级研究员任职时间为 "Jul, 2019 – Aug, 2024",与在人大任教的 2022年8月起时间段存在两年重叠,说明其 2022—2024 年间为"高校 + 企业双聘"状态,这是理解其产业合作网络的关键前提(详见第六章)。
研究方向: 预训练模型、自然语言处理、大模型智能体(LLM-based Agents)。研究脉络清晰地经历了三个阶段:知识表示学习与信息抽取(2013—2019,博士期间)→ 预训练模型效率与参数高效微调(2019—2022,腾讯微信期间)→ 大模型智能体与工具学习(2022—至今,人大期间)。
代表性成果: - TransR(AAAI 2015,《Learning Entity and Relation Embeddings for Knowledge Graph Completion》):知识表示学习的经典工作,Google Scholar 引用 5,322 次,在 Paper Digest "Most Influential AAAI 2015 Papers" 中排名第一。 - PCNN+ATT / 选择性注意力关系抽取(ACL 2016,《Neural Relation Extraction with Selective Attention over Instances》):引用 1,316 次,远程监督关系抽取的标准基线。 - PTransE(EMNLP 2015,《Modeling Relation Paths for Representation Learning of Knowledge Bases》):引用 864 次。 - NumNet(EMNLP 2019):数值推理阅读理解,被 OpenAI GPT-3 论文引用。 - ToolLLM(ICLR 2024 Spotlight):大规模工具学习模型,引用 1,332 次,入选 Paper Digest Most Influential ICLR 2024 Paper。 - 开源工具包 OpenKE / OpenNRE:GitHub 累计 6,400+ 星标,成为国际上知识驱动 NLP 的主流工具。 - AgentCPM 系列(AgentCPM-GUI / AgentCPM-Explore / AgentCPM-Report,2025—2026):端侧智能体模型体系。 - XAgent(自主智能体系统)、RecAgent(多智能体推荐仿真平台)、GenSim(社会仿真平台)。
荣誉: - 2009年 全国青少年信息学奥林匹克竞赛(NOI)金牌 - 2018年 百度奖学金 - 2019年 北京市普通高等学校优秀毕业生(博士) - 2020年 教育部自然科学一等奖(《结构化知识表示学习方法》,排名 3/5,学生第一完成人) - 2020—2025年 连续6年入选爱思唯尔中国高被引学者 & 斯坦福大学全球前2%顶尖科学家榜单 - 2022年 世界互联网领先科技成果(排名 3/6) - 2024年 吴文俊人工智能优秀青年奖 - 2024年 北京市科技新星计划(创新新星)——学院第3位入选者,前两位为李崇轩(2022)、黄文炳(2023) - 2025年 智源学者(BAAI Scholar)、《麻省理工科技评论》中国"AI 100 青年先锋" - 2026年 ACL 2026 杰出论文奖(Outstanding Paper Award,"CURE: Critique-Driven Unified Reinforcement Learning for Test-Time Self-Improvement")
学术兼职: CCF NOI 科学委员会委员、中国中文信息学会青年工作委员会执委、北京智源青源会会员、EMNLP / ACL ARR 领域主席(Area Chair)。
科研项目: 国家自然科学基金面上项目《基于大规模预训练模型的工具学习研究》。
教授课程: 本科生《知识表示与学习》;研究生《知识表示与推理》《预训练模型》。
招生要求(个人主页原文): "具备较强的自主驱动能力,致力于开展具有较高创新性的研究工作,而非追求快速发表论文。"
二、DBLP 数据统计
2.1 身份定位
DBLP 作者 pid 161/0001-1(Yankai Lin 0001)即本报告目标学者,DBLP 已人工消歧并绑定 RUC + THU 双机构注记与 PhD 2019 标签。
2.2 发表总量与类型分布
DBLP XML(https://dblp.org/pid/161/0001-1.xml)解析结果:
| 指标 | 数值 |
|---|---|
发表记录总数(<r> 记录) |
256 篇 |
| 会议论文(inproceedings) | 117 篇(45.7%) |
| 期刊/预印本(article) | 138 篇(53.9%,其中 CoRR/arXiv 129 篇) |
| 专著(book) | 1 篇 |
| 去除 arXiv 预印本后的正式发表 | 约 127 篇 |
| 合作者总数(distinct coauthors) | 528 人 |
| 仅合作 1 次的合作者 | 221 人(41.9%) |
| 第一作者论文 | 8 篇 |
| 末位作者(通讯位)论文 | 21 篇(集中于 2023 年后,反映独立 PI 身份的确立) |
2.3 逐年产出
| 年份 | 篇数 | 阶段 |
|---|---|---|
| 2013 | 1 | 清华博士期间(THUNLP) |
| 2015 | 3 | 同上 |
| 2016 | 5 | 同上 |
| 2017 | 3 | 同上 |
| 2018 | 6 | 同上 |
| 2019 | 14 | 博士毕业 / 入职腾讯微信 |
| 2020 | 18 | 腾讯微信 |
| 2021 | 30 | 腾讯微信(首个产出高峰) |
| 2022 | 29 | 腾讯微信 → 人大(双聘开始) |
| 2023 | 37 | 人大 + 腾讯双聘 |
| 2024 | 51(历年最高) | 人大 + 腾讯双聘(8月结束);晋升副教授 |
| 2025 | 42 | 人大专任 |
| 2026 | 17(年中截止) | 人大专任 |
趋势解读: 产出呈现明显的"三级跳"。博士期间(2013—2018)年均仅约 3.6 篇,属于"少而精"的路线(TransR、PCNN+ATT 均产自这一时期,单篇引用数千次);入职腾讯微信后(2019—2022)年均跃升至 22.8 篇,是工业界资源与 THUNLP 学生联合培养双重加持的结果;加入人大后(2023—2026)年均约 36.8 篇,2024 年单年 51 篇达到峰值。2022 年以后(2022—2026)合计 176 篇,占全部 256 篇的 68.8%。
2.4 主要发表场所
| 场所 | 篇数 |
|---|---|
| CoRR (arXiv) | 129 |
| ACL 主会(含 ACL(1)/ACL(2)/ACL/IJCNLP(1)/ACL) | 29 |
| ACL Findings(含 ACL/IJCNLP Findings) | 15 |
| EMNLP 主会(含 EMNLP/EMNLP(1)) | 18 |
| EMNLP Findings | 7 |
| ICLR | 11 |
| COLING | 5 |
| AAAI | 5 |
| NeurIPS | 3 |
| SIGIR | 3 |
| NAACL-HLT | 3 |
| IEEE/ACM TASLP | 3 |
| ICML | 2 |
| IJCAI | 2 |
| 其他(WWW、ACM CSUR、TOIS、TMLR、AI Open、FCS 等) | 各 1 |
ACL 系(ACL 主会 + Findings)合计 44 篇、EMNLP 系合计 27 篇,是其绝对主战场,符合"自然语言处理领域核心学者"的画像。近年 ICLR(11 篇)显著增长,反映其研究从纯 NLP 向通用大模型/智能体方法论的迁移。
2.5 核心合作者总榜(全周期,合作 ≥ 8 次)
| 排名 | 合作者 | DBLP pid | 合作次数 | 合作年份 | 身份/机构 |
|---|---|---|---|---|---|
| 1 | Zhiyuan Liu 0001(刘知远) | 53/3245-1 | 149 | 2013—2026 | 清华大学 THUNLP 副教授,博士导师 |
| 2 | Maosong Sun 0001(孙茂松) | 95/3291 | 137 | 2013—2026 | 清华大学教授、THUNLP 负责人,博士共同导师 |
| 3 | Jie Zhou 0016(周杰) | 00/5012-16 | 102 | 2019—2025 | 腾讯微信模式识别中心负责人(WeChat AI) |
| 4 | Peng Li 0030(李鹏) | 83/6353-30 | 75 | 2019—2024 | 原腾讯微信 → 清华大学 AIR(智能产业研究院) |
| 5 | Xu Han 0007(韩旭) | 19/3011-7 | 64 | 2018—2026 | 清华大学 THUNLP 助理研究员,博士期间师弟 |
| 6 | Yujia Qin(秦禹嘉) | 126/2333 | 42 | 2020—2025 | 清华博士(2019—2024,与刘知远共同指导)→ 字节跳动 Seed |
| 7 | Xin Cong(从鑫) | 141/4386 | 37 | 2023—2026 | 清华博士后(2023—2025,共同指导)→ 清华大学统计与数据科学系助理教授 |
| 8 | Ruobing Xie(谢若冰) | 178/8590 | 29 | 2016—2026 | 清华硕士同门(2014—2017)→ 腾讯微信 |
| 9 | Ji-Rong Wen(文继荣) | w/JRWen | 26 | 2023—2026 | 中国人民大学高瓴人工智能学院执行院长 |
| 10 | Wenkai Yang(杨文凯) | 250/3934 | 26 | 2021—2026 | 北大 → 人大博士生(现役核心弟子) |
| 11 | Zhong Zhang 0004(张仲) | 28/1568-4 | 26 | 2023—2026 | 共同指导(2024—2026)→ 电子科技大学助理教授 |
| 12 | Zhengyan Zhang(张正彦) | 23/10446 | 25 | 2020—2024 | 清华 THUNLP 博士 |
| 13 | Yaxi Lu(陆雅曦) | 344/9738 | 24 | 2023—2026 | 现役博士生(与刘知远、刘方明共同指导) |
| 14 | Xu Sun 0001(孙栩) | 37/1971-1 | 22 | 2019—2024 | 北京大学副教授(腾讯期间建立的校企合作) |
| 15 | Ning Ding 0002(丁宁) | 04/4910-2 | 21 | 2021—2025 | 清华 THUNLP |
| 16 | Yesai Wu(吴叶赛) | 366/5404 | 20 | 2024—2026 | 团队成员 |
| 17 | Chaojun Xiao(肖朝军) | 223/4856 | 20 | 2020—2026 | 清华 THUNLP |
| 18 | Xu Chen 0017(陈旭) | 83/6331-17 | 20 | 2023—2025 | 中国人民大学高瓴人工智能学院(校内) |
| 19 | Juanzi Li(李涓子) | l/JuanZiLi | 17 | 2018—2024 | 清华大学教授(KEG 实验室) |
| 20 | Weize Chen(陈玮泽) | 245/7488 | 16 | 2021—2025 | 清华 THUNLP |
| 21 | Xiaozhi Wang(王小治) | 03/2015 | 16 | 2018—2024 | 清华 THUNLP |
| 22 | Huadong Wang(王华东) | 41/164 | 15 | 2022—2026 | 清华 THUNLP |
| 23 | Lei Hou 0001(侯磊) | 32/5685-1 | 15 | 2021—2024 | 清华大学 KEG |
| 24 | Cheng Qian 0008(钱成) | 12/654-8 | 14 | 2022—2025 | 清华 → UIUC 博士 |
| 25 | Yining Ye(叶奕宁) | 274/2421 | 14 | 2023—2025 | 清华 → 字节跳动 Seed |
| 26 | Deming Ye(叶德铭) | 221/0765 | 14 | 2019—2023 | 清华 THUNLP 博士 |
| 27 | Yuan Yao 0013(姚远) | 25/4120-13 | 10 | 2019—2026 | 清华 THUNLP 博士 → 清华助理教授 |
| 28 | Zhewei Wei(魏哲巍) | 94/4260 | 10 | 2023—2025 | 中国人民大学高瓴人工智能学院副院长(校内) |
| 29 | Deli Chen(陈德立) | 50/2637 | 10 | 2019—2024 | 北大孙栩组(腾讯期间合作) |
| 30 | Wentong Chen(陈文通) | 289/6022 | 9 | 2023—2026 | 现役博士生 |
| 31 | Shihao Liang(梁世豪) | 259/4163 | 9 | 2023—2025 | ToolLLM 共同一作 |
| 32 | Jing Yi(易婧) | 06/8462 | 9 | 2021—2025 | 清华 THUNLP |
| 33 | Lei Wang 0198(王雷) | 181/2817-198 | 9 | 2023—2025 | 人大陈旭组(RecAgent 一作) |
| 34 | Hao Peng 0015(彭昊) | 69/7742-15 | 9 | 2020—2025 | 清华 KEG |
| 35 | Tianyu Gao 0001(高天宇) | 207/8893-1 | 9 | 2020—2022 | 清华 → 普林斯顿博士 |
| 36 | Dahai Li(李大海) | 62/3980 | 8 | 2023—2025 | 面壁智能(ModelBest)CEO |
| 37 | Yiju Guo(郭一举) | 371/4656 | 8 | 2024—2026 | 现役博士生 |
| 38 | Haotian Chen(陈昊天) | 235/1489 | 8 | 2025—2026 | 共同指导 → 上海交通大学助理研究员 |
| 39 | Zhenghao Liu 0001(刘正皓) | 243/2880-1 | 8 | 2019—2026 | 清华 → 东北大学 |
| 40 | Ganqu Cui(崔淦渠) | 232/3064 | 8 | 2023—2025 | 清华 THUNLP → 上海AI Lab |
| 41 | Yusheng Su(苏裕胜) | 260/5558 | 8(+6) | 2020—2025 | 清华 THUNLP(DBLP 存在 YuSheng Su 大小写变体,实际合计 14 次) |
| 42 | Runchu Tian(田润初) | 344/9908 | 8 | 2023—2025 | 清华 → UIUC |
| 43 | Lei Li 0039(李磊) | 13/7007-39 | 8 | 2020—2022 | 北大孙栩组 |
三、博士教育背景与师承分析
3.1 博士导师
林衍凯的博士导师为刘知远(主导师)与孙茂松(共同指导导师),依据清华大学刘知远个人主页学生名录(https://nlp.csai.tsinghua.edu.cn/~lzy/index.html):
Yankai Lin 2014-2019 PhD Co-supervised with Prof. Maosong Sun. Knowledge Graphs. Beijing Outstanding Graduate. → Tencent Wechat. → Faculty at RUC
据此可确认:
| 导师 | 职务 | 关系性质 | DBLP 合作次数 | 合作跨度 |
|---|---|---|---|---|
| 刘知远(Zhiyuan Liu) | 清华大学计算机系副教授,THUNLP 骨干 | 博士导师(直接指导人) | 149 次(全网络第一) | 2013—2026(14年) |
| 孙茂松(Maosong Sun) | 清华大学计算机系教授,THUNLP 实验室负责人,欧洲科学院外籍院士 | 博士共同指导导师(Co-supervisor) | 137 次(全网络第二) | 2013—2026(14年) |
博士论文方向为知识图谱(Knowledge Graphs),与推测方向(知识图谱/信息抽取)完全吻合。博士期间获评北京市优秀毕业生。
刘知远 149 次、孙茂松 137 次的合作频次,在 256 篇总记录中分别占 58.2% 和 53.5%,时间跨度从 2013 年持续到 2026 年,横跨博士、腾讯、人大三个完整职业阶段。分阶段看:
| 阶段 | 与刘知远合作 | 与孙茂松合作 |
|---|---|---|
| 博士期间(2013—2019) | 29 次 | 23 次 |
| 腾讯微信期间(2019—2022) | 55 次 | 49 次 |
| 人大期间(2022—2026) | 93 次 | 86 次 |
这是一个高度反常且极具信息量的模式: 通常学者与博士导师的合作会在毕业后逐年衰减,但林衍凯与刘知远/孙茂松的合作强度在毕业后不降反升,且在加入人大后达到历史峰值(93/86 次)。这说明林衍凯并未与 THUNLP "断奶",而是形成了一种跨机构常态化联合课题组的运作模式——他在人大有独立编制与独立学生,但研究项目(ToolLLM、AgentCPM、MiniCPM、Tool Learning 综述等)几乎全部以 THUNLP / OpenBMB 生态为共同载体推进。THUNLP 系合作者(刘知远/孙茂松署名)的论文在 2023—2024 年仍达每年 27—29 篇。
3.2 博士期间学术起点(2013—2019 完整论文谱系)
早期论文的作者构成极为集中,可清晰复原其学术成长路径:
| 年份 | 论文 | 合作者构成 |
|---|---|---|
| 2013 | THUNLP at TAC KBP 2013 in Entity Linking | Yan Wang, 林衍凯, 刘知远, 孙茂松 |
| 2015 | TransR(AAAI) | 林衍凯(1st), 刘知远, 孙茂松, Yang Liu 0107, Xuan Zhu 0006 |
| 2015 | PTransE(EMNLP) | 林衍凯(1st), 刘知远, Huan-Bo Luan, 孙茂松, Siwei Rao, Song Liu |
| 2016 | PCNN+ATT 选择性注意力关系抽取(ACL) | 林衍凯(1st), Shiqi Shen, 刘知远, Huanbo Luan, 孙茂松 |
| 2016 | Knowledge Representation Learning with Entities, Attributes and Relations(IJCAI) | 林衍凯(1st), 刘知远, 孙茂松 |
| 2016 | Neural Sentiment Classification with User and Product Attention(EMNLP) | Huimin Chen, 孙茂松, Cunchao Tu, 林衍凯, 刘知远 |
| 2017 | Neural Relation Extraction with Multi-lingual Attention(ACL) | 林衍凯(1st), 刘知远, 孙茂松 |
| 2018 | Denoising Distantly Supervised Open-Domain QA(ACL) | 林衍凯(1st), Haozhe Ji, 刘知远, 孙茂松 |
| 2018 | OpenKE(EMNLP Demo) | 韩旭, Shulin Cao, Xin Lv, 林衍凯, 刘知远, 孙茂松, 李涓子 |
| 2019 | DocRED(ACL) | 姚远, 叶德铭, 李鹏, 韩旭, 林衍凯, 刘正皓, 刘知远, Lixin Huang, 周杰, 孙茂松 |
| 2019 | NumNet(EMNLP) | Qiu Ran, 林衍凯, 李鹏, 周杰, 刘知远 |
关键观察: 2019 年是转折点。DocRED(ACL 2019)和 NumNet(EMNLP 2019)两篇论文首次同时出现了周杰(Jie Zhou 0016)与李鹏(Peng Li 0030)——这两位正是腾讯微信模式识别中心的负责人与核心研究员。也就是说,林衍凯在博士毕业之前(论文投稿于 2018 年底至 2019 年初)就已经与腾讯微信团队建立了实质性科研合作,这为其毕业后直接入职微信 AI 埋下伏笔。同一时期 Deli Chen、Qiu Ran 等北大孙栩组学生也通过微信团队的桥梁进入其合作网络。
3.3 THUNLP 同门谱系(刘知远/孙茂松门下,与林衍凯时间重叠)
| 同门 | 在 THUNLP 时期 | 与林衍凯合作次数 | 现状 |
|---|---|---|---|
| 谢若冰(Ruobing Xie) | 2014—2017 硕士(孙茂松共同指导) | 29 | 腾讯微信(后成为林衍凯的产业界长期对接人,详见第六章) |
| 韩旭(Xu Han) | 2017—2022 博士 | 64 | 清华大学助理研究员(THUNLP 骨干),清华优博、水木学者、MSRA Fellowship |
| 姚远(Yuan Yao 0013) | 2018—2023 博士 | 10 | 清华大学助理教授,吴文优博 |
| 杨成(Cheng Yang) | 2014—2019 博士 | — | 北京邮电大学教师,CIPS 优博 |
| Ayana | 2013—2019 博士 | 2 | 内蒙古财经大学教师 |
| 涂存超(Cunchao Tu) | — | 2 | 幂律智能联合创始人 |
| 丁宁(Ning Ding 0002) | — | 21 | 清华 THUNLP |
| 张正彦(Zhengyan Zhang) | — | 25 | 清华 THUNLP 博士 |
| 肖朝军(Chaojun Xiao) | — | 20 | 清华 THUNLP |
| 王小治(Xiaozhi Wang) | — | 16 | 清华 THUNLP / KEG |
| 陈玮泽(Weize Chen) | — | 16 | 清华 THUNLP |
| 叶德铭(Deming Ye) | — | 14 | 清华 THUNLP 博士 |
| 高天宇(Tianyu Gao 0001) | — | 9 | 清华 → 普林斯顿大学博士 |
| 崔淦渠(Ganqu Cui) | — | 8 | 清华 → 上海人工智能实验室 |
| 刘正皓(Zhenghao Liu 0001) | — | 8 | 东北大学 |
| 苏裕胜(Yusheng Su) | — | 14(含大小写变体) | 清华 THUNLP |
同门网络特点: 韩旭(64 次)、谢若冰(29 次)两位是与其绑定最深的同门。特别是谢若冰——两人 2014—2017 年在 THUNLP 同门,2019 年后又同在腾讯微信共事,2022 年林衍凯到人大后谢若冰仍持续合作(2023 年 12 篇、2024 年 9 篇),是一条贯穿"同门—同事—产学研伙伴"三重身份的关系纽带。
3.4 跨机构学术源流(清华系外围)
| 学者 | 机构 | 合作次数 | 合作起点 | 建立途径 |
|---|---|---|---|---|
| 李涓子(Juanzi Li) | 清华大学 KEG | 17 | 2018 | OpenKE 项目起(知识图谱方向天然交叉) |
| 侯磊(Lei Hou 0001) | 清华大学 KEG | 15 | 2021 | KEG-THUNLP 联合项目(MAVEN-ERE、CLEVE 等事件抽取工作) |
| 彭昊(Hao Peng 0015) | 清华大学 KEG | 9 | 2020 | 同上 |
| 孙栩(Xu Sun 0001) | 北京大学 | 22 | 2019 | 腾讯微信期间建立的校企合作(陈德立、李磊、任秋、Xuancheng Ren 等均为其学生) |
| 黄民烈(Minlie Huang) | 清华大学 CoAI | 5 | 2021 | ERICA、CTRLEval 等对话/可控生成方向 |
| Heng Ji | UIUC | — | 2021 | ERICA(ACL-IJCNLP 2021)等国际合作 |
| Tat-Seng Chua | 新加坡国立大学 | 2 | 2019 | 博士期间国际合作(GP-GNN 关系抽取) |
| Wai Lam | 香港中文大学 | 2 | 2019 | 博士期间国际合作(Fact Discovery,NAACL 2019) |
四、现单位团队(中国人民大学高瓴人工智能学院)
4.1 在读学生
博士生(Ph.D Students,12 人):
| 姓名 | DBLP 合作次数 | 合作年份 | 备注 |
|---|---|---|---|
| 杨文凯(Wenkai Yang) | 26 | 2021—2026 | 最资深、合作最深的弟子。合作始于 2021 年(当时林衍凯在腾讯、杨文凯在北大孙栩组),方向为 NLP 后门攻击防御 → 大模型对齐与推理。代表作《Towards Thinking-Optimal Scaling of Test-Time Compute for LLM Reasoning》(NeurIPS 2025,与微软 Shuming Ma、Furu Wei 合作)、《Super(ficial)-alignment》(ICLR 2025,与文继荣合作) |
| 陆雅曦(Yaxi Lu) | 24 | 2023—2026 | 与刘知远、刘方明(Fangming Liu)共同指导。AgentCPM-GUI 一作、Proactive Agent(ICLR 2025)、Schema Reinforcement Learning(ACL 2025) |
| 陈文通(Wentong Chen) | 9 | 2023—2026 | GUICourse(ACL 2025)一作,GUI 智能体方向 |
| 郭一举(Yiju Guo) | 8 | 2024—2026 | Controllable Preference Optimization(EMNLP 2024)一作,多目标对齐 |
| 陈志远(Zhiyuan Chen) | 6 | 2023—2025 | — |
| 范圣达(Shengda Fan) | 6 | 2024—2026 | Hierarchical MetaFlows(NeurIPS 2025)一作,智能体经验泛化 |
| 霍宇鹏(Yupeng Huo) | 6 | 2024—2026 | AgentCPM-GUI 共同作者 |
| 陈桂荣(Guirong Chen) | 5 | 2024—2026 | GUICourse 共同作者 |
| 杨神智(Shenzhi Yang) | 5 | 2024—2026 | AgentCPM-GUI 共同作者 |
| 吴松昊(Songhao Wu) | 2 | 2026 | 新入学 |
| 叶舒琪(Shuqi Ye) | — | — | 新入学,DBLP 暂无记录 |
硕士生(2 人): 张凯懿(Kaiyi Zhang)、张俊天(Juntian Zhang,DBLP 1 篇 / 2025)
本科生(3 人): 陈婧雯(Jingwen Chen)、李明烨(Mingye Li)、叶絮妍(Xuyan Ye)
团队规模: 在读 17 人左右(博 12 + 硕 2 + 本 3),相比同学院赵鑫(AI Box,近 50 人)属于精干型小规模课题组,与其个人主页明示的"不追求快速发表论文"的招生理念一致。
4.2 毕业生/出站人员(Alumni,据个人主页官方名录)
| 姓名 | 培养期 | 共同指导人 | 与林衍凯合作次数 | 去向 |
|---|---|---|---|---|
| 秦禹嘉(Yujia Qin) | 2019—2024 | 刘知远 | 42 | 字节跳动 Seed(豆包大模型团队) |
| 从鑫(Xin Cong) | 2023—2025 | 刘知远 | 37 | 清华大学统计与数据科学系助理教授(预聘) |
| 张仲(Zhong Zhang) | 2024—2026 | 刘知远 | 26 | 电子科技大学助理教授 |
| 陈昊天(Haotian Chen) | 2025—2026 | 刘知远 | 8 | 上海交通大学助理研究员 |
毕业生去向解读: 目前 4 位正式出站/毕业成员中,3 位进入高校任教(清华、电子科大、上交),1 位进入头部大模型工业界(字节 Seed),学术界流向占 75%。这与赵鑫团队"毕业生高度集中于阿里通义/字节/百度等大厂"的模式形成鲜明反差,反映林衍凯团队目前的定位更偏向学术梯队再生产而非工业界输送。需要注意的是,这 4 人全部标注 "with Zhiyuan Liu"(与刘知远共同指导),进一步印证了第 3.1 节所述的"跨机构联合课题组"运作模式——他们在名义上是清华/人大双边培养的成果。
4.3 人大校内合作者
| 校内同事 | 职务 | 合作次数 | 合作年份 | 主要合作方向 |
|---|---|---|---|---|
| 文继荣(Ji-Rong Wen) | 高瓴人工智能学院执行院长 | 26 | 2023—2026 | 学院层面的项目挂帅与共同署名(Super-alignment ICLR 2025、LLaDA 系列扩散语言模型 ACL 2026 等) |
| 陈旭(Xu Chen 0017) | 高瓴人工智能学院教授 | 20 | 2023—2025 | 智能体仿真方向的核心校内伙伴:RecAgent、《A Survey on LLM based Autonomous Agents》(FCS 2024)、User Behavior Simulation(TOIS 2025)、GenSim、TrendSim、SRAP-Agent 等 |
| 魏哲巍(Zhewei Wei) | 高瓴人工智能学院副院长 | 10 | 2023—2025 | 图学习 + LLM 交叉(LLM-Based Multi-Agent Systems are Scalable Graph Generative Models 等) |
| 王雷(Lei Wang 0198) | 陈旭组博士生 | 9 | 2023—2025 | RecAgent 一作、Autonomous Agents 综述一作 |
| 赵鑫(Wayne Xin Zhao) | 高瓴人工智能学院教授 | 7 | 2023—2026 | 大模型评测与智能体交叉 |
| 窦志成(Zhicheng Dou) | 高瓴人工智能学院副院长 | 4 | 2024—2025 | 信息检索 + Agent |
| 严睿(Rui Yan 0001) | 高瓴人工智能学院教授 | 7 | 2023—2026 | PlugLM(ACL Findings 2023)等 |
| 宋睿华(Ruihua Song) | 高瓴人工智能学院长聘副教授 | 5 | 2023—2025 | 多模态 |
| 孙泽宇(Zexu Sun) | 人大 | 5 | 2024—2026 | 对齐方向 |
| 毛佳昕(Jiaxin Mao) | 高瓴人工智能学院 | 5 | 2024—2025 | USimAgent(SIGIR 2024)等用户仿真 |
| 李崇轩(Chongxuan Li) | 高瓴人工智能学院 | 4 | 2025—2026 | LLaDA 扩散语言模型系列(LLaDA 1.5,ACL 2026) |
校内网络特征: 林衍凯在人大的校内合作呈现"双轴心"结构——陈旭(20 次)是方法论层面的实际科研伙伴(智能体仿真 / 推荐系统 Agent 化),文继荣(26 次)是学院层面的资源与项目牵头人。这一模式与赵鑫报告中"文继荣 373 次极端绑定"的形态截然不同:林衍凯与文继荣的 26 次合作仅占其总产出的 10.2%,说明其学术独立性显著更高,主体产出仍来自 THUNLP 联合体系而非人大本院体系。
五、核心合作者综合视图(分阶段)
5.1 清华博士阶段(2013—2019,共 32 篇)
| 合作者 | 次数 | 角色 |
|---|---|---|
| 刘知远 | 29 | 博士导师 |
| 孙茂松 | 23 | 博士共同导师 |
| 李鹏 | 7 | 腾讯微信(2019 起,毕业前预建立) |
| 周杰 | 7 | 腾讯微信(同上) |
| 韩旭 | 6 | 同门师弟 |
| 叶德铭 / 刘正皓 / Hao Zhu 0006 / Qiu Ran / 谢若冰 | 各 3 | 同门 |
| Tat-Seng Chua / Wai Lam / Jie Fu | 各 2 | 国际合作 |
5.2 腾讯微信阶段(2019—2022,约 91 篇)
| 合作者 | 次数 | 角色 |
|---|---|---|
| 周杰 | 70 | 微信模式识别中心负责人,此阶段第一合作者 |
| 李鹏 | 69 | 微信核心研究员 |
| 刘知远 | 55 | 前导师(持续合作) |
| 孙茂松 | 49 | 前导师(持续合作) |
| 韩旭 | 28 | THUNLP |
| 孙栩 | 16 | 北京大学(校企合作) |
| 秦禹嘉 | 13 | THUNLP 博士生(联合培养起点) |
| 李涓子 / 侯磊 | 13 / 11 | 清华 KEG |
| 叶德铭 / 张正彦 / 高天宇 / 王小治 | 11 / 10 / 9 / 9 | THUNLP |
| 李磊 / 陈德立 / Xuancheng Ren | 8 / 8 / 7 | 北大孙栩组 |
| 黄民烈 | 5 | 清华 CoAI |
这一阶段是林衍凯合作网络的"扩张期":以腾讯微信为平台,他同时对接了 THUNLP(母校)、清华 KEG(李涓子/侯磊)、北大孙栩组三条学术管线,形成典型的"企业研究员作为学术枢纽节点"的角色。
5.3 人大阶段(2022—2026,共 176 篇)
| 合作者 | 次数 | 角色 |
|---|---|---|
| 刘知远 | 93 | 前导师(合作强度达历史峰值) |
| 孙茂松 | 86 | 前导师 |
| 周杰 | 55 | 腾讯微信(双聘期间延续) |
| 韩旭 | 41 | THUNLP |
| 从鑫 / 秦禹嘉 | 37 / 37 | 联合培养弟子 |
| 文继荣 | 26 | 人大院长 |
| 谢若冰 | 26 | 腾讯微信 |
| 张仲 | 26 | 联合培养弟子 |
| 李鹏 | 26 | 清华 AIR(已离开腾讯) |
| 陆雅曦 / 杨文凯 | 24 / 23 | 现役博士生 |
| 吴叶赛 / 丁宁 / 陈旭 | 20 / 20 / 20 | 团队/THUNLP/人大 |
| 张正彦 / 肖朝军 / 王华东 / 陈玮泽 | 19 / 18 / 15 / 15 | THUNLP |
六、【重点】业界合作关系深度分析
林衍凯的产业界关系网络是其学术画像中最具特色的部分。与多数"高校教授偶发性接受企业横向课题"的模式不同,他本人有完整的三年全职工业界研究员经历,且在入职高校后仍保持了两年的企业双聘身份,其产业关系是内生性、结构性的,而非外挂式的。
6.1 腾讯微信:从雇主到学术命运共同体
6.1.1 关系形成的时间线
| 时间 | 事件 | 证据 |
|---|---|---|
| 2018年末—2019年初 | 博士毕业前即与微信团队共同投稿 DocRED(ACL 2019)、NumNet(EMNLP 2019) | DBLP 2019 年论文作者列表首次出现 Jie Zhou 0016 与 Peng Li 0030 |
| 2019年7月 | 博士毕业,直接入职腾讯微信模式识别中心(WeChat AI)任高级研究员 | 个人主页 CV、人大教师主页、百度百科三方一致 |
| 2019—2022 | 全职微信 AI,年产出从博士期间的 3.6 篇跃升至 22.8 篇 | DBLP 逐年统计 |
| 2022年8月 | 加入人大高瓴任预聘助理教授,但腾讯职务未终止 | 个人主页 CV 明载腾讯任职至 "Aug, 2024" |
| 2022年8月—2024年8月 | 人大 + 腾讯双聘期(长达 2 年) | 同上 |
| 2024年8月 | 结束腾讯微信职务 | 同上 |
| 2024年9月 | 晋升人大预聘副教授 | 同上 |
6.1.2 核心对接人及合作强度
| 微信侧关键人 | 身份 | 与林衍凯合作总数 | 合作跨度 | 逐年分布 |
|---|---|---|---|---|
| 周杰(Jie Zhou 0016) | 腾讯微信模式识别中心负责人 / WeChat AI 技术带头人 | 102 篇(全网络第 3) | 2019—2025 | 2019:7, 2020:15, 2021:25, 2022:23, 2023:18, 2024:13, 2025:1 |
| 李鹏(Peng Li 0030) | 原微信 AI 核心研究员,后转任清华大学智能产业研究院(AIR)助理教授 | 75 篇(全网络第 4) | 2019—2024 | 2019:7, 2020:16, 2021:26, 2022:20, 2023:5, 2024:1 |
| 谢若冰(Ruobing Xie) | 腾讯微信高级研究员(THUNLP 硕士同门) | 29 篇 | 2016—2026 | 2016:1, 2018:2, 2023:12, 2024:9, 2025:2, 2026:3 |
| Qiu Ran(任秋) | 微信 AI | 6 篇 | 2019—2021 | NumNet、非自回归机器翻译系列 |
| Fandong Meng(孟凡东) | 腾讯 AI Lab / 微信 AI | 2 篇 | 2023—2024 | — |
| Xiaojiang Liu(刘晓江) | 腾讯 | 2 篇 | 2024—2025 | Long-Context LLM 偏置研究(ACL Findings 2025) |
| Hao Zhou 0012 | 腾讯(后转清华 AIR) | 7 篇 | 2022—2024 | CTRLEval、ROSE 等 |
腾讯系合作论文(含周杰/李鹏/谢若冰任一署名)逐年分布: 2016:1 → 2018:2 → 2019:7 → 2020:16 → 2021:26 → 2022:26 → 2023:21 → 2024:15 → 2025:3 → 2026:3 合计约 120 篇,占其 256 篇总产出的 46.9%。
6.1.3 关键洞察:三条不同衰减曲线
腾讯三位核心对接人在林衍凯离职后呈现三种截然不同的合作轨迹,具有重要解读价值:
-
李鹏(急速衰减,2022:20 → 2023:5 → 2024:1 → 停止)——这与李鹏本人从腾讯微信转入清华大学 AIR 的职业变动同步。合作终止并非关系破裂,而是二人各自建立独立课题组后的自然分流。
-
周杰(缓慢衰减,2022:23 → 2023:18 → 2024:13 → 2025:1)——精确对应林衍凯 2024 年 8 月正式结束腾讯双聘身份的时间点。2019—2024 六年间累计 102 篇的合作量,使周杰成为林衍凯除博士导师外合作最深的单一人物;2025 年骤降至 1 篇,是双聘关系正式解除后的直接体现。
-
谢若冰(V 型反弹,2016:1 → 2018:2 → 断档四年 → 2023:12 → 2024:9 → 2025:2 → 2026:3)——最耐人寻味的一条曲线。谢若冰是林衍凯 THUNLP 时期的硕士同门(2014—2017),两人 2016—2018 年有零星合作,之后中断;2023 年(即林衍凯到人大之后)突然爆发至 12 篇,且在 2026 年仍有 3 篇在产。这说明在周杰/李鹏管线收缩的同时,谢若冰接替成为林衍凯与腾讯微信之间的新桥梁,且这条管线是唯一延续到 2026 年的腾讯通道。
6.1.4 腾讯合作的代表性成果
腾讯微信时期及后续合作产出了林衍凯在预训练模型效率与参数高效微调方向上的完整方法论体系:
| 论文 | 会议 | 主题 |
|---|---|---|
| NumNet: Machine Reading Comprehension with Numerical Reasoning | EMNLP 2019 | 数值推理(被 GPT-3 引用) |
| DocRED | ACL 2019 | 文档级关系抽取基准 |
| Guiding Non-Autoregressive NMT Decoding with Reordering Information | AAAI 2021 | 非自回归机器翻译 |
| ERICA: Improving Entity and Relation Understanding for PLMs | ACL-IJCNLP 2021 | 知识增强预训练 |
| CokeBERT | AI Open 2021 | 上下文知识选择 |
| Rethinking Stealthiness of Backdoor Attack against NLP Models | ACL-IJCNLP 2021 | 模型安全 |
| RAP: Robustness-Aware Perturbations | EMNLP 2021 | 后门防御 |
| MoEfication: Conditional Computation of Transformer Models | ACL Findings 2022 | MoE 稀疏化(现今 MoE 大模型的先驱工作之一) |
| Fully Hyperbolic Neural Networks | ACL 2022 | 双曲神经网络 |
| Knowledge Inheritance for PLMs | NAACL-HLT 2022 | 知识继承预训练 |
| ELLE: Efficient Lifelong Pre-training | ACL Findings 2022 | 终身预训练 |
| On Transferability of Prompt Tuning | NAACL-HLT 2022 | 提示微调可迁移性 |
| MAVEN-ERE | EMNLP 2022 | 事件关系抽取大规模数据集 |
| Emergent Modularity in Pre-trained Transformers | ACL Findings 2023 | 预训练模型涌现模块化 |
| Plug-and-Play Knowledge Injection for PLMs | ACL 2023 | 即插即用知识注入 |
| WebCPM: Interactive Web Search for Chinese Long-form QA | ACL 2023 | 交互式网页搜索 |
| Recyclable Tuning for Continual Pre-training | ACL Findings 2023 | 可回收微调 |
| ToolLLM | ICLR 2024 Spotlight | 工具学习(谢若冰署名) |
| UltraFeedback: Boosting LMs with Scaled AI Feedback | ICML 2024 | AI 反馈对齐(谢若冰署名) |
| Exploring the Benefit of Activation Sparsity in Pre-training | ICML 2024 | 激活稀疏性 |
| MAVEN-ARG | ACL 2024 | 事件论元标注 |
| Controllable Preference Optimization | EMNLP 2024 | 可控多目标对齐 |
| Eurus / Advancing LLM Reasoning Generalists with Preference Trees | ICLR 2025 | 推理通才模型(谢若冰署名) |
| LaSeR: RL with Last-Token Self-Rewarding | CoRR 2025 | 自奖励强化学习 |
| Union-of-Experts: Neurons in MoE are Secretly Routers | ACL 2026 | MoE 路由机理(谢若冰署名) |
| Redesign Mixture-of-Experts Routers with Manifold Power Iteration | CoRR 2026 | MoE 路由重设计 |
值得强调的是,MoEfication(2022)→ Emergent Modularity(2023)→ Activation Sparsity(2024)→ Union-of-Experts(2026)构成了一条长达五年、贯穿腾讯与人大两个阶段的 MoE/稀疏化研究主线,且这条主线上谢若冰几乎全程参与。在当前 MoE 已成为大模型主流架构(包括微信自研的 WeLM 80B-A3B MoE 模型)的背景下,这条产学研管线具有明确的技术落地指向性。
6.2 面壁智能(ModelBest)/ OpenBMB 生态:第二产业阵地
随着腾讯管线在 2024 年后收缩,面壁智能(ModelBest)成为林衍凯当前最主要的产业合作方。这一转向与其博士导师刘知远(面壁智能联合创始人/首席科学家)的产业布局高度同构。
| 面壁/OpenBMB 侧人物 | 身份 | 合作次数 | 合作年份 |
|---|---|---|---|
| 李大海(Dahai Li) | 面壁智能 CEO | 8 | 2023—2025 |
| Chongyi Wang(王崇屹) | 面壁智能 / OpenBMB | 7 | 2023—2026 |
| Weilin Zhao(赵伟林) | OpenBMB / 清华 | 6 | 2023—2025 |
| Guoyang Zeng(曾国洋) | 面壁智能联合创始人兼 CTO | 4 | 2023—2026 |
| Yikun Fu(傅一坤) | 面壁智能 | 2 | 2025 |
代表性联合成果: - MiniCPM4: Ultra-Efficient LLMs on End Devices(2025)——端侧超高效大模型,面壁智能旗舰产品线 - MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction(2026)——全双工全模态交互 - AgentCPM-GUI: Building Mobile-Use Agents with Reinforcement Fine-Tuning(EMNLP 2025 Demo)——移动端 GUI 智能体 - AgentCPM-Explore / AgentCPM-Report(2026,个人主页 News 明确署"We release")——长程深度探索与开放式深度研究智能体 - Tool Learning with Foundation Models(ACM Computing Surveys 2025)——40+ 作者的工具学习百科式综述,李大海署名
AgentCPM 系列的战略意义: 林衍凯个人主页 2026 年 1 月的 News 条目 "We release AgentCPM-Explore and AgentCPM-Report [repo]" 直接指向 github.com/OpenBMB/AgentCPM,说明他不仅是论文合作者,而是 OpenBMB 开源智能体产品线的实际主导者之一。这与其早年主导 OpenKE / OpenNRE(6,400+ 星标)的开源路径一脉相承——"研究成果即开源产品"是林衍凯贯穿十年的产业化方法论。
6.3 字节跳动:通过学生输送建立的管线
| 相关人物 | 与林衍凯关系 | 合作次数 | 现状 |
|---|---|---|---|
| 秦禹嘉(Yujia Qin) | 联合培养博士(2019—2024,与刘知远共同指导) | 42 | 字节跳动 Seed(豆包大模型团队) |
| 叶奕宁(Yining Ye) | ToolLLM 核心成员 | 14 | 字节跳动 Seed |
| Shihao Liang(梁世豪) | ToolLLM 共同一作 | 9 | 相关方向工业界 |
| Kunlun Zhu(朱昆仑) | ToolLLM 团队 | 6 | — |
特点: 与字节跳动的关系不是通过企业对企业的合作协议建立,而是通过 ToolLLM 团队核心成员集体流入字节 Seed 形成的"人才管线"。秦禹嘉是林衍凯合作次数第 6 的合作者(42 次),也是 ToolLLM(ICLR 2024 Spotlight,引用 1,332 次)与 Tool Learning 综述(ACM CSUR)的第一作者。这类"高影响力开源项目团队整建制被大厂吸纳"的模式,在 2023—2024 年国内大模型人才争夺战中极为典型。
6.4 其他企业合作
| 企业 | 对接人 | 合作次数 | 年份 | 合作内容 |
|---|---|---|---|---|
| 微软研究院(MSRA/MSR) | Shuming Ma(马树铭)、Furu Wei(韦福如) | 各 1 | 2025 | 《Towards Thinking-Optimal Scaling of Test-Time Compute for LLM Reasoning》(NeurIPS 2025,杨文凯一作)——测试时计算扩展 |
| 蚂蚁集团 / 支付宝 | Xiaolu Zhang(张晓露)、Jun Zhou 0011(周俊) | 各 3 | 2025—2026 | LLaDA 系列扩散语言模型(LLaDA 1.5,ACL 2026;与人大李崇轩、文继荣共同署名)——这是当前最活跃的企业管线之一 |
| 阿里巴巴(达摩院) | Yaliang Li(李雅亮) | 5 | 2024—2025 | 大模型训练与智能体方向 |
| 华为(诺亚方舟/云) | Zhao Cao(曹钊)、Zhonghua Li、Xiangyang Li | 4 / 2 / 2 | 2023—2025 | Plug-and-Play Document Modules(ACL 2023)等模型压缩/文档建模方向 |
| 百度 | Dawei Yin(印大威)团队:Tianshu Lyu、Xiaoyong Lyu | 各 1 | 2022 | 《On Length Divergence Bias in Textual Matching Models》(ACL Findings 2022)——唯一一次百度合作,属偶发性 |
百度关系的特殊性: 林衍凯 2018 年获得百度奖学金(Baidu Scholarship,全球每年仅 10 名博士生),但 DBLP 数据显示其与百度的实际论文合作仅 2022 年 1 篇。这说明百度奖学金对他而言是荣誉与早期资助,而未转化为持续的产学研管线——与赵鑫团队"与百度文心团队合计 70+ 次合作"的深度绑定形成对照。
6.5 产业合作格局总结与演化
阶段一(2019—2022,腾讯独大期): 周杰 + 李鹏构成的微信 AI 双核心,此期腾讯系论文占同期产出的 70% 以上。林衍凯作为企业研究员,是"企业资源 → 高校学生"的枢纽。
阶段二(2022—2024,双聘过渡期): 腾讯管线仍活跃(2022:26、2023:21、2024:15),同时面壁智能/OpenBMB 管线于 2023 年建立(李大海、曾国洋等),ToolLLM 项目成为两条管线的交汇点(既有谢若冰署名,又有李大海署名)。
阶段三(2024 年至今,多元化期): 腾讯周杰/李鹏管线基本关闭(2025 年合计仅 4 篇),面壁智能成为主阵地(MiniCPM4、AgentCPM 系列),同时新开辟蚂蚁集团(LLaDA 扩散语言模型)、微软(测试时计算)两条高质量管线,谢若冰成为唯一延续的腾讯通道。
核心判断: 林衍凯的产业合作不是"横向课题式"的资金型合作,而是技术路线共建型合作——他的每一条产业管线都对应一条具体的技术产品线(腾讯 → MoE/预训练效率;面壁 → 端侧模型与 GUI 智能体;蚂蚁 → 扩散语言模型;微软 → 推理时扩展)。这在国内 NLP 青年学者中属于产业渗透度极高的类型,直接源于其三年全职工业界 + 两年双聘的独特履历。
6.6 学生毕业去向的工业界统计
| 去向类型 | 人数 | 具体 |
|---|---|---|
| 高校教职/研究岗 | 3 | 从鑫→清华大学统计与数据科学系助理教授;张仲→电子科技大学助理教授;陈昊天→上海交通大学助理研究员 |
| 头部大模型企业 | 1 | 秦禹嘉→字节跳动 Seed |
| 学术界占比 | 75% | — |
广义 THUNLP 联合培养圈的工业界流向(非林衍凯直接指导,但为其高频合作者): 叶奕宁→字节跳动 Seed;崔淦渠→上海人工智能实验室;高天宇→普林斯顿大学博士;钱成、田润初→UIUC 博士;刘正皓→东北大学。整体呈现"学术界为主、字节 Seed 为工业界主要接收方"的格局。
七、Connection 圈层总结
第一圈层(师承核心 · 终身绑定): 刘知远(149 次)与孙茂松(137 次)。这不是普通的"博士导师"关系,而是一个持续 14 年、横跨三个职业阶段且强度逐阶段递增的学术共生体(人大阶段合作 93/86 次,为历史峰值)。林衍凯本质上是 THUNLP 学派向外派生的一个"外置节点"——他拥有人大的独立编制、独立经费与独立学生,但其研究议程(工具学习、智能体、MoE、端侧模型)与 THUNLP/OpenBMB 高度同构,四位已毕业弟子全部标注 "with Zhiyuan Liu"。
第二圈层(产业命运共同体): 周杰(102 次,腾讯微信模式识别中心负责人)与李鹏(75 次)。这一圈层的独特之处在于它由雇佣关系而非学术关系催生——林衍凯 2019—2024 年在腾讯微信的五年(其中三年全职、两年双聘)使这两人的合作强度超过了绝大多数高校同事。腾讯系论文占其全部产出的 46.9%。2024 年双聘结束后该圈层迅速收缩,但通过 THUNLP 同门谢若冰(29 次,2026 年仍在产)保留了唯一活性通道。
第三圈层(THUNLP 同门与联合培养梯队): 韩旭(64 次)、秦禹嘉(42 次)、从鑫(37 次)、张仲(26 次)、张正彦(25 次)、丁宁(21 次)、肖朝军(20 次)、王小治(16 次)、陈玮泽(16 次)、王华东(15 次)等。这是林衍凯论文产出的实际执行主力,也是 ToolLLM、WebCPM、UltraFeedback、AgentCPM 等旗舰项目的实施团队。其中秦禹嘉、从鑫、张仲、陈昊天四人已作为"林门"毕业生输出(3 人进高校,1 人进字节 Seed)。
第四圈层(人大本院网络): 陈旭(20 次,智能体仿真方向实际科研伙伴)、文继荣(26 次,学院层面牵头人)、魏哲巍(10 次)、赵鑫(7 次)、严睿(7 次)、宋睿华(5 次)、毛佳昕(5 次)、李崇轩(4 次)、窦志成(4 次)。这一圈层的相对权重(合计约 100 次,占总产出不到 40%,且多为多人共著)显著低于第一、二、三圈层,是林衍凯与本系列其他人大学者(如赵鑫与文继荣 373 次的极端绑定)最大的结构性差异。其学术根基仍在清华,人大更多提供了独立 PI 的制度平台与本地化的智能体仿真交叉方向(陈旭)。
第五圈层(跨机构学术合作): 清华 KEG 的李涓子(17 次)、侯磊(15 次)、彭昊(9 次);北京大学孙栩(22 次)及其学生陈德立(10 次)、李磊(8 次)、Xuancheng Ren(7 次)——这条北大管线完全建立于腾讯期间(2019 年起),是"企业研究员作为学术枢纽"的典型副产品;国际方面有 Tat-Seng Chua(NUS)、Wai Lam(CUHK)、Heng Ji(UIUC)等零散合作,国际化程度相对不高(其 528 位合作者中海外学者占比很低,是与赵鑫等长期国际合作型学者的另一显著差异)。
第六圈层(企业与开源生态): 面壁智能(李大海 8 次、王崇屹 7 次、曾国洋 4 次,MiniCPM4/AgentCPM 系列)、字节跳动 Seed(经秦禹嘉、叶奕宁的人才管线)、蚂蚁集团(张晓露、周俊各 3 次,LLaDA 扩散语言模型,2026 年活跃)、华为(曹钊 4 次)、阿里(李雅亮 5 次)、微软(韦福如、马树铭各 1 次,NeurIPS 2025)、百度(1 次,偶发)。
整体画像: 林衍凯是一位"清华出身、腾讯淬炼、人大独立"的产学研三栖型青年学者。256 篇发表、528 位合作者的网络中,清华 THUNLP 系约占 60%、腾讯系约占 47%(两者高度重叠)、人大本院约占 40%(多为共著)。其学术资本的三大支柱是:知识表示学习的历史遗产(TransR/OpenKE,引用数以万计)、大模型智能体与工具学习的当前主战场(ToolLLM/AgentCPM/XAgent/RecAgent)、开源生态的持续经营(OpenKE→OpenNRE→ToolBench→AgentCPM)。产出结构上,末位作者论文 21 篇集中于 2023 年后,标志其从"高产合作者"向"独立 PI"的角色转型正在进行中但尚未完成——目前仍有约六成论文的通讯位由刘知远/孙茂松/周杰等更资深学者占据。
八、数据来源与局限性说明
8.1 数据来源
| 数据类型 | 来源 | 说明 |
|---|---|---|
| 发表记录与合作网络(主数据) | DBLP 官方 XML https://dblp.org/pid/161/0001-1.xml |
256 条 <r> 记录,解析记录内 <author> 标签统计共著频次,共识别 528 位合作者 |
| 身份消歧 | DBLP Author Search API | Yankai Lin 0001 / pid 161/0001-1,带 RUC + THU 双 affiliation 注记 |
| 博士导师(一手证据) | 刘知远个人主页学生名录 https://nlp.csai.tsinghua.edu.cn/~lzy/index.html | 明载 "Yankai Lin 2014-2019 PhD Co-supervised with Prof. Maosong Sun. Knowledge Graphs." |
| 团队成员与毕业去向 | 个人主页 Group / Alumni 板块 https://linyankai.github.io/ | 官方维护的在读学生(博12/硕2/本3)与 4 位 Alumni 完整去向 |
| 职业履历(含双聘时间) | 个人主页 CV + 人大教师主页 + 人大学院新闻 + 百度百科 | 双聘信息独见于个人主页 CV |
| 荣誉与代表作引用数 | 个人主页 Awards/Publications 板块 | 引用数为其主页自报的 Google Scholar 数值 |
| 从鑫去向 | 清华大学统计与数据科学系官网 https://www.stat.tsinghua.edu.cn/en/info/1023/1432.htm | 官方教师页确认 |
| 产业背景(微信 AI / WeLM) | 公开新闻报道 | 用于说明产业技术背景,非合作关系证据 |
未使用 OpenAlex:以 DBLP 为唯一主数据源,避免同名学者聚合问题。DBLP 消歧页 161/0001(无后缀)显示存在同名的另一位学者。
8.2 已知局限性
-
arXiv 预印本重复计数。 256 条记录中 CoRR(arXiv)占 129 条(50.4%),同一工作的 arXiv 版与正式发表版会双计,真实独立工作数量约为 130—160 项。合作频次数据因此系统性放大约 1.6—2 倍,但相对排序与占比结论依然可靠。
-
合作频次不区分作者位次与实际贡献。 大模型时代盛行数十人共著的大型项目论文(如 Tool Learning 综述 40+ 作者、MiniCPM4、AgentCPM 系列),此类论文会同时抬高多人的合作计数。林衍凯的第一作者论文仅 8 篇、末位作者 21 篇,其余 227 篇均为中间作者位,需在解读时保持谨慎。
-
DBLP 大小写变体。
Yusheng Su(8 次)与YuSheng Su(6 次)为同一人(pid260/5558),实际合作 14 次。 -
企业雇佣状态为时点快照。 报告中标注的机构归属(如"李鹏→清华 AIR"、"秦禹嘉→字节 Seed")反映查询时点的公开信息,人员流动频繁的大模型行业中此类信息时效性有限。
-
未覆盖非英文发表与专利。 DBLP 不收录中文期刊论文、技术报告与专利。林衍凯的教育部自然科学一等奖成果《结构化知识表示学习方法》及世界互联网领先科技成果等,其完整成果构成无法从 DBLP 复原。
-
人大校内网络可能被低估。 其大部分工作以 THUNLP 为主体推进,人大同事仅在交叉课题中署名,"校内绑定较弱"的结论可能未反映教学、评审、行政等非共著形式的校内联系。
-
2026 年数据不完整。 截至报告生成时间(2026年7月),2026 年仅收录 17 篇,全年数据尚未完整,逐年趋势的末端应视为截断值。特别是个人主页 News 提及的 KDD 2026(2篇)、ACL 2026(6篇)、ICLR 2026(2篇)、WWW 2026(1篇)等录用论文可能尚未全部进入 DBLP。