跳转至

清华KEG 许斌 研究员

报告生成时间:2026年7月30日
个人主页:https://keg.cs.tsinghua.edu.cn/persons/xubin/
Google Scholar:https://scholar.google.com/citations?user=eV_MEVYAAAAJ&hl=en
院系主页:https://www.cs.tsinghua.edu.cn/info/1111/5271.htm


一、学者基本信息

许斌(Bin Xu,邮箱 xubin@tsinghua.edu.cn)是清华大学计算机科学与技术系研究员、博士生导师,KEG(Knowledge Engineering Group)成员。其本人主页明确列出与李涓子、唐杰、东昱晓、侯磊同属 KEG;研究兴趣为大语言模型、知识图谱与人工智能。清华计算机系主页还确认其为国家级人才计划入选者、国家一流本科课程"JAVA程序设计进阶"主讲教师,并称其已在 ACL、ICLR、NeurIPS、EMNLP、TKDE、TPAMI 等会议和期刊发表近百篇论文。

身份识别的核心依据是"机构—邮箱—学位—研究主题"的四重一致:KEG 主页、清华计算机系主页均使用 xubin@tsinghua.edu.cn,均给出清华计算机本科、硕士、博士经历,且论文主题稳定落在语义 Web/服务计算、知识图谱、教育知识工程和大模型。该判据可排除清华地学系统的生态学教授"徐冰(Bing Xu)"(与本人仅为同音/译名相近,并非同一人)、清华数学中心的 Bin Xu,以及其他 DBLP 同名作者;因此,不应将仅以 Bin Xu 名义聚合而未提供清华归属的 DBLP 记录直接计入本人的论文或合作统计

其研究演进可概括为:早期侧重语义 Web 服务组合、服务计算和传感网络;中期转向知识表示、知识获取、事件抽取、教育知识图谱与科技情报知识服务;近期进一步扩展为大模型、多模态模型、智能体和教育型 LLM 应用。这一轨迹体现了从“可组合的语义服务”到“符号知识图谱”再到“神经大模型—知识增强—行业应用”的连续路径。

二、教育背景与职业履历

时间 教育/任职节点 公开可核实信息
1996 清华大学计算机科学与技术工学学士 清华计算机系正式主页列明专业与年份。
1998 清华大学计算机系统结构工学硕士 清华计算机系正式主页列明专业与年份。
1998 加入清华大学计算机系 英文教师页标注 “Joined Department: 1998”。该时间与其硕士毕业年份一致。
2006 清华大学计算机软件工学博士 清华计算机系正式主页列明专业与年份。
2005—2007 Java 技术与开发者生态 曾获 Sun Microsystems 评选的 Java Champion(2005),并任软件行业协会 Java 技术委员会成员(2005—2007),反映其早期研究与工程社区连接。
2006—2010 前后 语义 Web 服务组合与国家项目阶段 团队在 Web Services Challenge 连续获奖;承担“面向数据处理的软件生产线”“自适应网构软件技术”等 863 课题。
2013—2021 知识图谱、教育与科技情报阶段 主持跨语言语义链接、知识本体推理、基础教育海量知识库、知识产权大数据挖掘等项目;建设 EduKG 并参与 AMiner 科技情报知识服务。
2021—至今 标准化、大模型与产业化阶段 任 IEEE P2807.6 教育知识图谱工作组主席;参与 GLM/ChatGLM 研制,并推进教育、金融、水利、环境等场景应用。

现任/近年学术与专业服务包括:中国计算机学会(CCF)杰出会员、CCF 计算机应用专委会荣誉主任、互联网教育智能技术及应用国家工程研究中心知识建模与分析实验室主任、IEEE P2807.6 教育知识图谱工作组主席、全国专业标准化技术委员会信息技术分技术委员会委员;曾任国际期刊 Service Oriented Computing and Applications(SOCA)编委。会议组织方面,他担任 2024 年全国知识图谱与语义计算大会主席、2025 年 CCF 第40届中国计算机应用大会主席;早期还担任 WWW 2008 海报主席及 ISWC、ICPP、ICWE、ICSOFT 等会议程序委员会成员。

代表性奖励包括:国家科技进步二等奖(“智能型科技情报挖掘和知识服务关键技术及其规模化应用”,清华页面列为 2021 年)、中国人工智能学会 2020 年度优秀科技成果奖(AMiner)、北京市科技进步一等奖(2017)、日内瓦国际发明展银奖(2017)、昆山国际发明展金奖(2016)。早期还以团队形式获得 Web Services Challenge 2006—2009 多项服务组合赛奖项。

三、学生培养情况

许斌具博士生导师资格,但其 KEG 个人页和清华计算机系公开页未发布可逐人核验的学生名册、学位层次、毕业年份与毕业去向。为避免把“共同作者”误写为“导师—学生”关系,下表将已检索到的情况分为严格可确认与论文网络推断两层;后者仅表明长期/多篇合著和主题连续性,不等同于正式指导关系。

博士生

姓名 学位/毕业年份 去向 与许斌的公开关系
暂无可由公开主页或院系新闻逐项核验者 已确认许斌为博士生导师,但此次检索未发现可安全归属其名下的博士生名单及去向。

硕士生

姓名 学位/毕业年份 去向 与许斌的公开关系
暂无可由公开主页或院系新闻逐项核验者 同上;不以论文作者排序或同实验室身份推定硕士生身份。

基于合著网络识别的核心青年合作群(非正式学生名册)

人员 持续主题与可见代表作 网络位置判断
童美涵(Meihan Tong) 2020—2024 年持续参与事件检测、文档级事件抽取(如 DocEEDocEE-zh 与许斌、李涓子、侯磊等持续合著,是事件知识获取方向的核心青年合作者;公开资料不足以确认其学位层次和去向。
齐骥(Ji Qi) 开放信息抽取鲁棒性、视觉语言推理、视频理解(如 EMNLP 2023 Outstanding Paper 的开放信息抽取论文、CogCoM) 横跨知识抽取与多模态大模型,且多次与许斌、侯磊、李涓子、唐杰、东昱晓共同署名,显示其位于 KEG 跨方向协作枢纽。
彭昊、祁韵佳、王晓智 指令遵循、奖励模型、信息抽取对齐(ADELIE、Agentic Reward Modeling、AGENTIF) 2024—2025 年围绕大模型对齐与智能体评价形成稳定合作小组;可视作许斌近期 LLM 方向的重要青年合作者。
虞继凡、张力丹(Daniel Zhang-Li)、王宇澄、林嘉音(Joy Lim) MOOC/教育知识、学习路径、教育型智能体与项目式学习 形成教育大模型/学习科学子网络;作者结构同时连接许斌、侯磊、李涓子及智源、自然语言处理等团队成员。
杨震、丁铭 图推荐负采样、时空图神经网络、CogVLM/CogVideoX 等 连接许斌与唐杰、东昱晓主导的图学习/多模态大模型方向。

上述“核心青年合作群”来自许斌公开论文列表的重复合著模式,不宜据此倒推出某人的确切导师、毕业年份或就业去向。

四、学术合作网络

1. KEG 内部合作

许斌主页直接点名李涓子、唐杰、东昱晓、侯磊为同组同事。以其个人公开论文页中 2021—2026 年可见条目作保守计数(不将未在该页列出的论文计入),与四人的共同署名至少呈现如下规模;数字是“该公开清单中能逐条观察到的下限”,不是 DBLP 全量统计。

KEG 同事 保守可见共同论文下限 代表性交叉合作 关系解读
李涓子(Juanzi Li) 约 20 篇以上 DocEE、MAVEN-FACT、KoLA、CogVLM、AGENTIF、教育型 LLM/智能体系列 最稳定的共同作者之一。合作覆盖事件抽取、知识图谱、LLM 对齐及教育智能体;两人也是智谱相关的学术—产业共同体成员。
侯磊(Lei Hou) 约 20 篇以上 DocEE、ADELIE、AGENTIF、StoryWriter、KoLA、教育智能体系列 在信息抽取、知识增强语言模型与教育应用的作者网络中高度重叠,扮演连接许斌研究线与 KEG NLP/知识图谱方向的关键节点。
唐杰(Jie Tang) 至少 10 篇 MOOCCubeX、KoLA、STAM、图推荐负采样、CogVLM、CogVideoX、LvBench 合作由教育知识库/学术知识服务延伸至图学习、多模态及 GLM 生态;同时通过 AMiner、智谱共同体形成项目和成果转化连接。
东昱晓(Yuxiao Dong) 至少 6 篇 KoLA、CogVLM、CogVideoX、CogCoM、LvBench、图推荐研究 集中在图表示学习、多模态大模型与视频理解,体现许斌从知识工程向多模态模型的横向协作。

其中,2024 年 KoLA 同时汇集李涓子、唐杰、许斌、侯磊以及大量 KEG 成员;2024 年 CogVLM 与 2025 年 CogVideoX 同时汇集许斌、李涓子、唐杰、东昱晓;2025 年 CogCoM 亦汇集五人中的四位。这些“大团队论文”不宜被解读为一对一指导,但能清楚显示 KEG 的共同技术平台和跨研究线共同署名结构。

2. 校内与跨机构学术合作

  • 清华大学内部:许斌参与人工智能通识教育(AIGE)研究中心,与马少平、张敏、艾清遥、王东、李超等共处核心成员网络;中心工作把知识图谱/大模型能力延展到 AI 通识教育。
  • 北京师范大学及教育技术网络:其所任“互联网教育智能技术及应用国家工程研究中心知识建模与分析实验室主任”及 IEEE P2807.6 工作组均形成实质连接。IEEE 标准由清华联合北京师范大学等单位提报,目标是规范 K-12 教育知识图谱的数据结构、本体、构建与应用。
  • 新加坡国立大学Image Enhanced Event Detection in News Articles(AAAI 2020)将许斌、李涓子、侯磊与 Tat-Seng Chua 连接,显示事件抽取与多模态信息抽取方向的国际合作。
  • 图学习与推荐系统网络:与香港科技大学/阿里巴巴相关研究者 Hongxia Yang、Chang Zhou,以及 KEG 的唐杰、东昱晓、丁铭、杨震等,在负采样、时空图神经网络推荐等问题上有共同论文;这是知识工程与工业推荐研究之间的重要交叉边。
  • 开源学术协作:个人论文页链接了 THU-KEG/AgentIF、ADELIE、Crab、VerIF、StoryWriter、LLMAEL 等代码仓库,以及 CogVLM、CogVideo 等开源项目。该层连接不等于企业雇佣关系,却使其研究成果经由公开代码触达更广泛的开发者和研究者社区。

五、业界合作关系深度分析

1. 智谱与 GLM:最核心的产业化连接

许斌是智谱 AI 联合创始人,并被清华官方页面称为 GLM 系列主要研制人之一;其本人/院系页面明确写明参与研发 ChatGLM。该产业连接并非单一顾问式合作,而是由 KEG 的知识工程、自然语言处理、知识图谱与模型研发积累转化而来。李涓子、唐杰、许斌等人既是长期学术合作者,也是智谱早期技术共同体的重要成员。其在该网络的特色角色是:将知识表示、教育知识图谱、事件抽取等符号知识能力接入大模型和行业智能体,而不只聚焦通用预训练。

从公开论文和代码看,CogVLM、CogVideoX、CogCoM、LvBench,以及 KoLA、AgentIF 等,构成“模型—多模态—评测—智能体”协作链条。应注意:论文共著或开源仓库贡献可证明科研协同,不自动证明每位论文作者在智谱任职。

2. 行业落地与国家级知识服务项目

清华计算机系主页列明,许斌团队将 GLM 能力用于教育、金融、水利、环境等行业,并已推动至国能集团、石化集团和芯片企业等场景;该页面未逐项公开企业项目负责人、合同规模或部署指标,因此不宜扩展为具体商业业绩断言。可明确的公开项目链条包括:

场景 项目/系统 关系价值
基础教育 863 课题支持的 EduKG 建成覆盖中小学学科的教育知识图谱;清华页称其含约 1000 个概念类、160 余万实体、2200 万三元组,并支撑后续 IEEE 教育知识图谱标准工作。
科技情报 国家重点研发课题与 AMiner 通过科技知识图谱、语义搜索和成果评价服务连接科技情报需求;相关成果获国家科技进步二等奖。
金融 “金融知识图谱长文档关系抽取研究”(2022—2023) 表明团队将关系抽取与知识建模能力以横向项目形式对接金融文本场景。
水利/能源 “基于大模型的 AI+流域水电梯级调度理论与方法研究”(2026—2030);“瀚沫”水电行业大模型公开介绍 表明其工作从通用模型延伸到能源调度与水电专业场景。
科普与公共知识 “基于知识图谱的‘科普中国’分析研究”(2022) 将知识图谱技术用于公共科普内容分析。

3. 标准、课程与生态层连接

IEEE P2807.6 的工作并非纯学术头衔,而是以 K-12 教育知识图谱的可共享、可集成和可评价为目标,连接教育内容提供方、技术提供方、图谱集成方与学校用户。配合其担任“JAVA程序设计进阶”主讲教师、参与 AIGE 中心,以及教育型 LLM 智能体论文,许斌的产业和社会影响路径可概括为“教育知识标准—数据/图谱基础设施—大模型产品/智能体—行业部署”。

公开检索没有发现可归属于本人的、与新华社直接合作的权威项目材料;因此本报告不将新华社列为其合作机构。

六、Connection 圈层总结

  1. 第一圈层:KEG 学术共同体。 李涓子、侯磊是许斌近年论文中最密集、主题最连续的协作者;唐杰、东昱晓则在学术知识服务、图学习、多模态与 GLM 技术线上构成高强度交叉。该圈层兼具共享学生作者池、共享数据/代码平台和共同产业转化特征。
  2. 第二圈层:知识工程与教育智能体青年合作群。 童美涵、齐骥、彭昊、祁韵佳、王晓智、虞继凡、张力丹、王宇澄、林嘉音、杨震、丁铭等,通过事件抽取、知识抽取、教育数据、LLM 对齐、多模态模型串联。公开材料可确认其合作核心性,但不足以逐一认定师生身份及毕业去向。
  3. 第三圈层:教育知识基础设施与标准网络。 北京师范大学、国家工程研究中心、IEEE P2807.6、AIGE 等机构/平台,把实验室研究扩展至基础教育知识图谱、AI 通识教育和标准治理。
  4. 第四圈层:产业与跨机构网络。 智谱/GLM 是最强产业节点;AMiner 与科技情报服务、金融关系抽取、水电调度、能源和工业部署构成应用节点;NUS 的 Tat-Seng Chua、香港科技大学/阿里巴巴相关图学习合作则提供国际和工业研究桥梁。

整体而言,许斌的关系网络以清华 KEG 为中心、以“知识图谱—教育知识工程—大模型/多模态—行业智能化”为主轴。其网络优势不只在合著数量,更在于能够把早期语义 Web 与知识服务积累持续转译为教育标准、开源评测、基础模型和行业应用;其中与李涓子、侯磊的日常科研耦合最强,与唐杰、东昱晓的模型与产业协作扩展性最显著。

参考公开资料

  1. 清华 KEG,许斌个人主页与论文列表:https://keg.cs.tsinghua.edu.cn/persons/xubin/https://keg.cs.tsinghua.edu.cn/persons/xubin/publications.html
  2. 清华大学计算机科学与技术系,许斌教师主页(教育、项目、奖励、成果):https://www.cs.tsinghua.edu.cn/info/1111/5271.htm
  3. 清华大学计算机科学与技术系,IEEE P2807.6 工作组主席新闻:https://www.cs.tsinghua.edu.cn/info/1034/5591.htm
  4. 清华大学,人工智能通识教育(AIGE)研究中心新闻:https://www.tsinghua.edu.cn/info/1182/118137.htm
  5. 清华大学计算机系,李涓子教师主页(用于 KEG 共同论文交叉核对):https://www.cs.tsinghua.edu.cn/info/1111/3487.htm
  6. 天津大学公开讲座介绍(许斌为智谱 AI 联合创始人):https://www.tju.edu.cn/info/1158/10211.htm