复旦大学 桂韬 研究员
报告生成时间:2026年8月20日
个人主页:桂韬
所属团队:复旦大学自然语言处理实验室(FudanNLP)
一、学者基本信息
| 字段 | 信息 |
|---|---|
| 姓名 | 桂韬(Tao Gui) |
| 出生年份 | 1989年(1989年11月22日生,复旦大学计算机学院2019年人物报道) |
| 职称 | 复旦大学自然语言处理实验室官网列为副教授、硕士生导师;其个人主页自述与张奇共同领导NLP-LI Lab。关于“长聘轨副教授、博士生导师”的现行聘任信息,公开页面未找到可直接确认的校方依据(待核实)。 |
| 所属单位 | 复旦大学计算机科学技术学院;现代语言学研究院页面亦列其为专职科研人员。 |
| 实验室职务 | 与张奇共同领导NLP-LI Lab,隶属黄萱菁教授团队;为FudanNLP教师成员。 |
| 学术头衔 | 第七届中国科协“青年人才托举工程”入选者;上海市启明星计划入选者。 |
| 国家级人才 | 已确认获得2022年度国家自然科学基金青年科学基金项目资助;未发现其获“国家优秀青年科学基金(国家优青)”的直接证据,不应标注为国家优青。 |
| 其他任职 | ACL、EMNLP、NAACL程序委员会成员/审稿人;TPAMI、AAAI、IJCAI、CIKM等会议或期刊程序委员会成员/审稿人(以其复旦公开简介所列为准)。 |
| 邮箱 | tgui@fudan.edu.cn |
| 研究方向 | 自然语言处理、信息抽取、鲁棒性与可解释性;近年扩展至大语言模型推理、AI Agents、RLHF与对齐、多模态大模型。 |
二、教育背景与职业履历
桂韬的学术训练具有“工科本科—部队经历—复旦NLP硕博—青年教师”的连续路径。复旦大学公开人物报道记载,他于2012年6月毕业于国防科技大学;现代语言学研究院主页将其本科学历概括为国防科技大学“计算机仿真”。毕业后他曾在部队任职,后退役备考,于2016年进入复旦大学计算机学院硕博连读。个人主页进一步明确其获复旦大学博士学位的年份为2021年,并列有复旦大学硕士、博士阶段的自然语言处理训练。
其博士培养关系有充分的校内公开佐证:2021年复旦大学计算机学院报道明确称其“师从黄萱菁教授和张奇教授”;2019年受访时,他亦明确回顾二人的指导以及与课题组协作开展研究的过程。因此,桂韬博士学位授予单位为复旦大学、共同指导教师为黄萱菁和张奇,可作确认性表述。
时间线如下:
- 2012年6月:国防科技大学本科毕业;随后在部队任职。
- 2016年:考入复旦大学计算机学院,进入硕博连读培养体系,研究自然语言处理。
- 2016—2021年:在黄萱菁、张奇指导下开展社交媒体文本处理、序列标注、信息抽取、鲁棒性与泛化性研究;其早期代表成果发表于EMNLP、AAAI、IJCAI、SIGIR等。
- 2021年:获复旦大学博士学位;复旦大学现代语言学研究院页面同年已列其为青年副研究员,并兼属计算机科学技术学院。
- 2022年:获国家自然科学基金青年科学基金项目资助。须注意,院方新闻中“本院有1项优青、1项面上、1项青年基金”的并列统计,并未将桂韬对应为优青;该新闻明确点名桂韬获得的是青年科学基金。
- 2023年至今:研究重心由NLP模型鲁棒性/可解释性延展至大模型对齐、强化学习与智能体。个人主页公开了MOSS-RLHF、AgentGym、TextFlint等开源研究线,并说明其与张奇共同领导NLP-LI Lab。
三、学生培养情况
公开网页未见桂韬个人课题组完整学生名册、学位层次、毕业年份及去向清单;且FudanNLP教师页将其列作“硕导”。为避免把论文署名直接等同于正式导师关系,以下列出其公开论文中由桂韬担任通讯作者或与其持续共同研究的青年作者。除特别说明外,毕业年份、当前去向和“是否为其独立指导学生”均标注为待核实。这些个案能够反映其在序列标注、NER、关系抽取与关键词生成方向的实际培养/协作网络,但不能替代学院正式导师备案。
1. [贾成业(Jiacheng Ye)](去向待核实,论文共同作者;桂韬为通讯作者)
贾成业与桂韬共同发表ACL 2021论文《ONE2SET: Generating Diverse Keyphrases as a Set》,作者页明确标注桂韬为通讯作者。该工作将关键短语生成从顺序生成改为集合生成,体现了桂韬在结构化文本生成和训练目标设计上的指导型研究线。桂韬个人主页还列出贾成业共同参与的IJCAI 2020文档级标签一致性NER工作及EMNLP 2020不确定性感知标签精炼工作,显示双方在2020—2021年间围绕序列标注持续协作。其学位类别、毕业年份与现工作单位未在所查公开来源中确认(待核实)。
2. [马若天(Ruotian Ma)](去向待核实,论文共同作者;桂韬为通讯作者)
马若天是一项ACL 2021关系抽取研究《SENT: Sentence-level Distant Relation Extraction via Negative Training》的第一作者,桂韬为通讯作者,合作者还包括李林阳、张奇、黄萱菁和周雅倩。该项合作将远程监督关系抽取中的噪声问题与负训练相结合,位于桂韬“信息抽取—鲁棒训练”主线的交叉处。其论文中呈现的第一作者/通讯作者结构提供了直接的研究指导关联证据;但公开资料不足以确认其是否为桂韬名下正式研究生、毕业年份及毕业后去向(待核实)。
3. [闫航(Hang Yan)](去向待核实,论文共同作者;桂韬为通讯作者)
闫航在ACL 2021论文《A Unified Generative Framework for Various NER Tasks》中担任第一作者,桂韬为通讯作者,合作团队还跨接复旦大学邱锡鹏团队成员。该成果将多种命名实体识别任务纳入统一生成框架,是桂韬从传统序列标注走向统一建模的代表性培养/合作案例。闫航后来在长上下文研究论文中仍以复旦大学、华为诺亚方舟实验室和上海人工智能实验室的联合作者网络出现,说明其研究已连接产业研究机构;但该论文不能据此确认其个人雇佣单位、学位毕业年份或师生隶属(待核实)。
4. [邹一诚(Yicheng Zou)](去向待核实,论文共同作者)
邹一诚与桂韬、张奇、黄萱菁合作发表COLING 2018情感分析论文《A Lexicon-Based Supervised Attention Model for Neural Sentiment Analysis》,获Area Chair Favorite Award;其后又与团队共同完成EMNLP 2019词典图神经网络中文NER研究。该轨迹展示了FudanNLP在词典知识、注意力机制和中文信息抽取之间的联合训练生态。公开页面可证实其为桂韬早期成果的持续共同作者,但无法确认其为桂韬独立指导学生、毕业年份或当前去向(待核实)。
5. [费子楚(Zichu Fei)](去向待核实,论文共同作者)
费子楚在桂韬公开论文列表中参与AAAI 2020图像分类数据增强研究,并与桂韬、贾成业、郑岩立等共同出现在EMNLP 2020不确定性感知标签精炼研究中。前者反映团队对多任务增强的探索,后者直接服务于序列标注的标签噪声与不确定性问题,和桂韬的鲁棒性研究主题高度一致。现有公开来源不足以确定其正式导师、学历层次、毕业年份及就业去向(待核实),故仅将其定位为可证实的青年共同作者。
6. [李正岩(Zhengyan Li)](去向待核实,论文共同作者)
李正岩与桂韬、贾成业、张奇、费子楚、龚业昀、黄萱菁合作发表EMNLP 2020论文《Uncertainty-Aware Label Refinement for Sequence Labeling》。该工作通过显式处理标签不确定性提升序列标注质量,是桂韬鲁棒性研究线的重要论文之一,也体现出其培养网络中“第一作者—通讯/资深作者—团队导师”协作结构。关于李正岩是否为桂韬直接指导研究生、其毕业时间及当前所属机构,检索到的公开信息不足(待核实)。
7. [郑锐(Rui Zheng)](复旦大学博士生身份见图书作者介绍,培养归属待核实)
郑锐与张奇、桂韬、黄萱菁合著《大规模语言模型:从理论到实践》(2024)。图书介绍将郑锐标为复旦大学计算机科学技术学院博士生,且其与桂韬共同参与预训练、监督微调、奖励建模和强化学习等大模型实践内容的整理。此项共同著作表明郑锐已进入桂韬所在张奇团队的大模型知识生产网络;但图书信息并未声明其导师为桂韬,毕业年份和当前去向也未公开确认(待核实)。
四、学术合作网络
4.1 实验室内部合作
桂韬的核心校内网络以黄萱菁—张奇—桂韬为主轴。黄萱菁、张奇既是其博士阶段的共同指导者,也是其早期社交媒体词性标注、中文NER、信息抽取论文中的稳定合作者;其个人主页又明确说明桂韬与张奇共同领导NLP-LI Lab,并处于黄萱菁团队之内。这构成“导师—共同负责人—学生/青年作者”的紧密知识传递网络。
横向协作方面,邱锡鹏团队成员在统一NER等工作中与其共同署名,反映FudanNLP内部围绕预训练、生成式建模与信息抽取的交叉合作。FudanNLP官网当前教师名单还包括黄萱菁、邱锡鹏、张奇、曹艺馨、周雅倩、郑骁庆、魏忠钰和桂韬,提供了其本地学术共同体的组织边界。共同教材《自然语言处理导论》(张奇、桂韬、黄萱菁)和《大规模语言模型:从理论到实践》(另含郑锐)则将合作延展至课程与学术传播。
4.2 跨机构合作
其跨机构合作可从项目和论文两条线观察。现代语言学研究院公开简介称其担任美团、海康威视、字节跳动等公司项目合作负责人;这是“存在项目合作”的直接证据,但未公开项目金额、期限、成果归属及每家企业的具体技术分工,不宜扩展为长期联合实验室或雇佣关系。
研究成果的开放协同亦值得关注:TextFlint作为多语言NLP鲁棒性评测平台于2021年开源,形成了供研究界和产业界使用的工具接口;MOSS-RLHF围绕PPO和奖励建模公开代码,AgentGym则通过多环境任务训练大模型智能体。上述项目使合作网络不局限于论文共同作者,而扩展为开源贡献者、复现实验者与应用开发者网络。另有论文作者来自华为诺亚方舟实验室、上海人工智能实验室等机构,但具体个人与桂韬的直接联合指导/项目关系应逐篇核对(待核实)。
4.3 国际合作
桂韬的国际连接主要通过国际会议共同体、开源传播和海外研究评价场景体现,而非公开披露的长期海外任职。其论文发表于EMNLP、ACL、AAAI、IJCAI、SIGIR、COLING等国际会议,并承担ACL、EMNLP、NAACL等程序委员会/审稿工作;早期Twitter词性标注研究直接以CMU团队已建立的任务基准为比较对象。个人主页公开的AgentGym、MOSS-RLHF与TextFlint代码仓库为国际研究者的使用、复现和扩展提供了基础。
截至本报告所查资料,未找到可可靠确认的海外博士后、访问学者、海外高校固定合作实验室或国际联合培养学生名单。因此,本节将其国际合作定位为“国际发表与学术服务—开源项目扩散—会议同行网络”,不将其表述为已有长期海外机构任职(待核实)。
五、业界合作关系深度分析
5.1 产业合作:从横向项目到开源基础设施
桂韬公开履历明确列举美团、海康威视、字节跳动为公司项目合作对象,表明其产学研联结并非仅来自学术报告或奖学金。结合其研究主题,合作的潜在技术接口集中于三类:其一,信息抽取、NER和社交媒体文本理解,可服务内容理解、检索与知识化处理;其二,TextFlint等鲁棒性评测工具,可支持模型在扰动、对抗样本和分布变化下的质量评估;其三,RLHF、奖励模型和AgentGym等研究,可对应大模型对齐、智能体训练与复杂环境评测。
需要区分“合作证据”与“应用成效”。公开资料能够确认其是上述企业项目的合作负责人,也确认其曾受百度、科大讯飞、滴滴出行等企业邀请作学术报告;但未公开披露企业项目名称、产品部署、专利转让、商业收入或独立产品指标。因此,报告不能将TextFlint、MOSS-RLHF或AgentGym直接归因为某一企业的商业化产品。较稳妥的判断是:桂韬的产业联系以联合项目、学术交流和开源工具/方法扩散为主,属于技术供给与人才交流型网络。
5.2 创业孵化:以科研成果孵化和开源生态为主,未见本人创业确证
在创业孵化维度,MOSS-RLHF、TextFlint、AgentGym等公开项目形成了可复用的研究基础设施:前者聚焦大模型人类反馈强化学习训练,TextFlint面向NLP鲁棒性评测,AgentGym面向多环境智能体训练。这类资产降低了研究团队、初创公司和企业研发部门试验相应能力的门槛,具有明显的“技术孵化器”属性。
但截至报告生成日,未检索到桂韬本人创办公司、担任创业企业高管、持股企业或由其主持的正式校内孵化企业的可靠公开记录。因此,不应将其描述为创业者。更准确的网络定位是:以高校课题组为核心,通过开源代码、教材、横向项目和企业技术交流,为大模型对齐与智能体方向提供科研转化的上游能力;其是否参与具体公司孵化、担任顾问或拥有成果转化权益,均为待核实事项。
六、重要奖项与学术兼职
| 类别 | 项目 | 时间/说明 |
|---|---|---|
| 人才项目 | 第七届中国科协“青年人才托举工程” | 已由复旦现代语言学研究院新闻确认。 |
| 人才项目 | 上海市启明星计划 | 中国中文信息学会获奖者页面列示。 |
| 科研资助 | 国家自然科学基金青年科学基金项目 | 2022年度获资助;不是“国家优秀青年科学基金”。 |
| 学术奖励 | 钱伟长中文信息处理科学技术奖一等奖 | 公开简历/校方学科介绍列示,具体获奖年度及个人完成人排序待核实。 |
| 论文奖励 | COLING 2018领域主席推荐奖(亦有页面表述为最佳论文提名) | 不同公开页面的奖项中文译名不完全一致,保留原始表述。 |
| 论文奖励 | NLPCC 2019亮点论文奖/杰出论文奖 | 不同公开页面存在“亮点论文奖”与“杰出论文奖”两种表述,具体奖项名称待核实。 |
| 学生时期荣誉 | 百度奖学金、IBM奖学金、2019和2020国家奖学金、复旦大学“学术之星”特等奖 | 复旦大学2021年报道及现代语言学研究院个人页均有列示。 |
| 学术服务 | ACL、EMNLP、NAACL程序委员会成员及审稿人 | 现代语言学研究院个人页列示。 |
| 学术服务 | TPAMI、AAAI、IJCAI、CIKM程序委员会成员及审稿人 | 现代语言学研究院个人页列示。 |
| 学术传播 | CCL 2020、CCL 2021报告;NLPCC 2021鲁棒性教程 | 现代语言学研究院个人页列示。 |
七、Connection圈层总结
- 第一圈层:博士导师与实验室领导核心。 黄萱菁、张奇是桂韬最稳固的学术关系节点:二人共同指导其博士训练,并在早期代表论文、教材编写和当前NLP-LI Lab组织中持续连接。该圈层决定了其从社交媒体NLP、信息抽取到大模型对齐的研究延续性。
- 第二圈层:FudanNLP内部协作与青年研究者网络。 邱锡鹏及FudanNLP其他教师构成本校横向协作环境;贾成业、马若天、闫航、邹一诚、费子楚、李正岩、郑锐等论文作者则构成可观察的研究训练/协作网络。必须注意,其中多数人的正式师生关系、毕业年份与去向尚无公开名册佐证。
- 第三圈层:方法、工具与开放生态。 TextFlint、MOSS-RLHF、AgentGym和相关论文/代码将桂韬连接至鲁棒性评测、RLHF和智能体研究社群。这个圈层的关系不以行政隶属为中心,而由代码复用、基准评测、论文复现和开源贡献形成。
- 第四圈层:产业与跨机构应用网络。 美团、海康威视、字节跳动是有公开项目合作表述的企业节点;百度、科大讯飞、滴滴出行等则至少与其存在公开学术交流。华为诺亚方舟实验室、上海人工智能实验室等可在相关论文合作网络中观察到,但具体到桂韬个人的项目职责须另行核对。
- 第五圈层:国际学术共同体。 ACL、EMNLP、NAACL、AAAI、IJCAI、SIGIR、COLING等会议与审稿服务构成其国际同行连接;该网络以高水平发表和学术服务为主要载体。公开资料不足以支持“长期海外任职/固定国际联合实验室”的更强结论。
综合而言,桂韬的关系网络呈现出“复旦NLP师承主轴强、青年作者协作密集、开源工具外溢明显、产学项目接口清晰”的结构。对学生去向、博士招生资格、长聘状态、企业项目细节及个人创业参与等信息,应以复旦研究生院、学院教师主页、学生公开个人主页或企业正式公告作后续补充,现阶段均保持待核实标注。