跳转至

北京大学 吴云芳 副教授

报告生成时间:2026年8月20日
个人主页:吴云芳
所属团队:北京大学计算语言学研究所 / 计算语言学教育部重点实验室


一、学者基本信息

字段 内容
姓名 吴云芳(Yunfang Wu)
出生年份 公开资料未披露
职称 副教授、博士生导师
所属单位 北京大学计算机学院
实验室职务 计算智能系副系主任;计算语言学研究所成员
学术头衔 北京大学人工智能研究院兼聘人员
国家级人才 公开资料未见国家级人才计划入选记录(待核实)
其他任职 CLSW 2017 程序委员会共同主席(PC Co-Chair);COLING、NLPCC、CCL、CLSW 等会议审稿人
邮箱 wuyf@pku.edu.cn
研究方向 自然语言处理、语言知识库构建、词法句法分析、基于大语言模型的语义理解与文本生成、跨模态语义理解、AI+教育

二、教育背景与职业履历

吴云芳的学术道路始于西南大学。根据北京大学人工智能研究院英文官方页面,她于1995年获得西南大学(Southwest University)理学学士学位。随后进入北京大学攻读博士研究生,师从计算语言学研究所的导师,于2000年至2003年间完成博士学位,2003年获得北京大学博士学位。其博士研究期间正值北京大学计算语言学研究所由俞士汶教授主持工作(俞士汶于1990年10月至2004年12月担任计算语言所负责人/副所长,1993年12月起任博士生导师),且吴云芳作为第八完成人参与了俞士汶主导的"综合型语言知识库"项目(该成果于2011年获国家科学技术进步二等奖),并长期从事《现代汉语语法信息词典》等语言知识库相关工作,多项证据高度提示其博士导师为俞士汶教授(待核实,未见官方页面明确署名导师信息)。

2003年至2005年,吴云芳在北京大学从事博士后研究。2005年起留校任教,历任讲师、副教授,隶属于北京大学信息科学技术学院(现计算机学院)。此后一直在北京大学工作至今,担任副教授、博士生导师,并出任计算智能系副系主任。她的研究方向从早期的中文语言知识库构建、词法句法分析,逐步扩展到阅读理解问题自动生成、智能问答、中文语法纠错,再到近年来的大语言模型语义理解、跨模态语义理解和AI+教育应用,展现了从传统计算语言学到深度学习时代的完整学术转型轨迹。

吴云芳主持了多项国家级科研项目,包括4项国家自然科学基金项目(1项青年项目、3项面上项目)、2项国家社科基金项目(1项青年项目、1项后期资助项目),并作为子课题负责人参与国家社科基金重大项目1项、作为课题骨干参与国家863项目2项。此外,她还主持了与人民教育出版社的产学研合作项目,以及7项其他产学研合作项目,并有资源成果转让。

三、学生培养情况

吴云芳作为博士生导师,培养了一批从事自然语言处理研究的青年学者。以下根据其官方主页发表的论文列表(吴云芳为通讯作者,标注*号),梳理其指导的学生信息。

1. Xiuyu Wu(吴秀宇,博士/硕士研究生,2018—2022年前后)

Xiuyu Wu 是吴云芳课题组中产出最为丰富的学生之一,主要研究方向为中文语法纠错(Chinese Grammatical Error Correction, CGEC)。在吴云芳指导下,Xiuyu Wu 以第一作者身份在 COLING 2022、EMNLP 2022(Findings)、ACL 2023 等顶级会议上发表多篇论文,提出了从拼写错误到语法纠错的新框架("From Spelling to Grammar"),以及基于位置偏移标签预测的语法纠错方法。此外,Xiuyu Wu 还与课题组其他成员合作了多篇论文,研究范围涵盖阅读理解干扰项生成等。其毕业后具体去向尚未从公开资料中确认(待核实)。

2. Fanyi Qu(屈凡一,博士/硕士研究生,2019—2024年前后)

Fanyi Qu 的研究方向为问题自动生成(Question Generation)和干扰项生成(Distractor Generation)。在吴云芳指导下,Fanyi Qu 以第一作者在 EMNLP 2021 发表了关于考试数据上问答对自动生成的论文,随后又在 ACL 2024(Findings)和 NAACL 2024 上发表关于无监督干扰项生成和上下文示例选择的研究。此外,Fanyi Qu 还参与了 COLING 2022 和 COLING 2024 的合作论文。其研究紧密结合教育场景,与吴云芳的"AI+教育"方向高度契合。毕业后具体去向尚未从公开资料中确认(待核实)。

3. Xin Jia(贾鑫,博士/硕士研究生,2018—2022年前后)

Xin Jia 的研究方向为考试型问题生成(Examination-Type Question Generation)。在吴云芳指导下,Xin Jia 以第一作者在 AAAI 2021 发表了 EQG-RACE 论文,研究基于考试数据的问题生成;在 ACL 2020 发表了关于利用复述提升问题生成质量的研究。此外,Xin Jia 还与课题组其他成员合作了 COLING 2022 的论文。值得注意的是,多篇论文的合作者中还包括孙栩(Xu Sun),表明存在组间联合指导的情况。Xin Jia 毕业后具体去向尚未从公开资料中确认(待核实)。

4. Zichen Wu(吴子辰,博士研究生,2020—2025年前后)

Zichen Wu 的研究方向为多模态语义理解。在吴云芳指导下,Zichen Wu 以第一作者在 COLING 2022 发表了关于利用文本结构知识增强预训练模型进行问题生成的论文,在 COLING 2024 发表了关于多提示专家混合(Mixture-of-Prompt-Experts)的多模态语义理解研究,并在 EMNLP 2025(Findings)发表了关于通过反事实推理和自适应专家路由消除多模态大语言模型虚假信号的研究。Zichen Wu 的研究体现了课题组从文本向多模态方向的拓展。毕业后具体去向尚未从公开资料中确认(待核实)。

5. Chenming Tang(唐晨明,博士/硕士研究生,2021—2025年前后)

Chenming Tang 的研究方向涵盖机器翻译和语法纠错中的上下文示例选择。在吴云芳指导下,Chenming Tang 以第一作者在 ACL 2023 发表了关于预训练语言模型在中文语法纠错模型集成中应用的论文,在 NAACL 2024 发表了关于基于非语法结构的上下文示例选择方法,在 EMNLP 2024 发表了关于语法增强的覆盖式上下文示例选择在机器翻译中的应用,并在 EMNLP 2025(Findings)发表了关于提示格式优于描述的研究。Chenming Tang 是近年产出密集的学生,体现了课题组在示例学习(In-context Learning)方向的深入探索。毕业后具体去向尚未从公开资料中确认(待核实)。

6. Sanwoo Lee(李相雨,博士研究生,国际学生,2022—2025年前后)

Sanwoo Lee 是一位国际学生(韩国籍,待核实),研究方向为自动作文评分(Automated Essay Scoring)和模型合并(Model Merging)。在吴云芳指导下,Sanwoo Lee 以第一作者在 EMNLP 2024(Findings)发表了关于零 shots 作文评分的研究,在 NAACL 2025 发表了关于基于贝叶斯优化的动态Fisher加权模型合并方法(该论文合作者包括来自百度的 Jingang Wang 和 Xunliang Cai),在 EMNLP 2025 发表了关于跨提示作文评分的可组合模型合并研究。Sanwoo Lee 的研究体现了课题组在AI+教育评估方向与产业技术的交叉融合。毕业后具体去向尚未从公开资料中确认(待核实)。

7. Xiaorui Zhou(周晓睿,硕士研究生,2018—2020年前后)

Xiaorui Zhou 是吴云芳早期指导的学生之一,以第一作者在 AAAI 2020 发表了关于协同注意力层次网络生成阅读理解连贯长干扰项的研究。该论文是课题组在阅读理解领域的重要工作,体现了吴云芳在智能问答和阅读理解方向的布局。合作者还包括 Senlin Luo(罗森林,来自北京理工大学,待核实)。Xiaorui Zhou 毕业后具体去向尚未从公开资料中确认(待核实)。

8. Wenbiao Li(李文彪,硕士研究生,2020—2022年前后)

Wenbiao Li 以第一作者在 EMNLP 2022 发表了关于统一神经网络模型进行文本可读性评估的研究,提出特征投影和长度平衡损失方法。该研究与吴云芳主持的人民教育出版社"中国儿童分级阅读文本标准研制"项目密切相关,是AI+教育方向的重要产出。毕业后具体去向尚未从公开资料中确认(待核实)。

四、学术合作网络

4.1 实验室内部合作

吴云芳所属的计算语言学研究所(Institute of Computational Linguistics, ICL)是北京大学计算机学院(原信息科学技术学院)下属的核心研究机构,同时也是计算语言学教育部重点实验室。根据官方信息,ICL现有教师包括:常宝宝(Baobao Chang)、胡俊峰(Junfeng Hu)、李素建(Sujian Li)、刘洋(Yang Liu)、穗志方(Zhifang Sui)、孙斌(Bin Sun)、孙栩(Xu Sun)、王厚峰(Houfeng Wang)、吴云芳(Yunfang Wu)、张化瑞(Huarui Zhang)。

在实验室内部,吴云芳与孙栩(Xu Sun)的合作最为密切。孙栩是北京大学计算机学院教授、机器学习与数据挖掘方向专家,在吴云芳课题组的多篇论文中作为共同作者出现(如 COLING 2022 的位置偏移标签预测论文、AAAI 2021 的考试型问题生成论文、ACL 2020 的问题生成复述论文),表明两位教师在学生培养上存在联合指导的紧密合作关系。此外,吴云芳早期研究中的合作者包括金澎(Peng Jin)、郭涛(Tao Guo)等课题组成员,共同发表了关于词义消歧的论文。文淼淼(Miaomiao Wen)也曾在吴云芳指导下从事介词短语边界识别研究。

吴云芳与ICL其他教师的合作更多体现在共同参与国家级项目层面。她参与的国家社科基金重大项目"面向网络文本的多视角语义分析方法、语言知识库及平台建设研究"以及国家863项目"面向基础教育的类人智能知识理解与推理关键技术",均涉及实验室多团队协作。此外,计算语言学研究所继承了俞士汶教授奠基的语言知识库传统,吴云芳作为"综合型语言知识库"项目的第八完成人,与该项目的其他参与者之间存在着深厚的学术传承关系。

4.2 跨机构合作

在跨机构合作方面,吴云芳的网络涵盖了北京大学校内其他院系、国内其他高校以及产业界。

在北京大学校内,吴云芳与中文系教师保持着密切的合作关系。裴雨来(北京大学中文系)曾与吴云芳合作发表关于义项区分方法的论文(第九届全国计算语言学学术会议)。詹卫东(北京大学中文系教授)虽隶属中文系,但长期与计算语言学研究所合作,是语言知识库方向的核心合作者之一。这种计算机学科与语言学学科的交叉合作,是北大计算语言学研究的特色传统。

在跨校合作方面,吴云芳的论文合作者包括 Senlin Luo(罗森林),从论文署名信息推测可能来自北京理工大学(待核实)。此外,吴云芳组织的国际语义评测任务(SemEval和NLPCC)也使其与国内外参与评测的团队建立了广泛的学术联系。

在产业界合作方面,吴云芳与百度公司的研究人员存在合作关系。在 NAACL 2025 发表的论文中,合作者包括 Qifan Wang、Jingang Wang 和 Xunliang Cai,根据公开学术记录,这几位研究者与百度搜索/自然语言处理团队相关(待核实具体机构归属)。此外,赵东岩(北京大学王选计算机研究所研究员)也曾在相关论文中与 Jingang Wang、Xunliang Cai 等人合作,进一步印证了这一产业合作网络的存在。

4.3 国际合作

吴云芳在国际学术界的影响力主要体现在她组织和发起的多个国际语义评测任务上。她先后组织了 SemEval-2007 Task 5(中文词义消歧评测)、SemEval-2010 Task 18(中文词义消歧与义项区分)、SemEval-2012 Task 4(中英文语义相关度评测)、NLPCC-2016 Task 3 以及 NLPCC-2017 Task 1。SemEval 是国际自然语言处理领域最具影响力的语义评测系列会议,吴云芳连续多届组织中文相关评测任务,表明她在国际中文语义评测领域的领导地位。

此外,吴云芳指导的学生 Sanwoo Lee 是一位国际学生(韩国籍,待核实),体现了其课题组的国际化程度。她担任 CLSW 2017(中国词汇语义学研讨会)的程序委员会共同主席,并长期担任 COLING、NLPCC、CCL 等国际会议的审稿人。论文发表方面,其课题组的研究成果发表在 ACL、EMNLP、NAACL、COLING、AAAI 等国际顶级会议和期刊上,包括 Language Resources and Evaluation(LRE)和 Journal of Computer Science and Technology(JCST),展现了良好的国际学术发表能力。

五、业界合作关系深度分析

5.1 产业合作项目

吴云芳的产业合作具有鲜明的"AI+教育"特色,是其学术研究与社会服务的核心交汇点。

人民教育出版社合作项目是吴云芳最具代表性的产业合作成果。2020年9月至2021年12月,吴云芳作为主持人承担了人民教育出版社委托的"中国儿童分级阅读文本标准研制"项目。在该项目中,她带领团队创新性地采用"大型语料库+神经网络"的方法,科学评定文本难度,成功研制出"儿童分级阅读体系"(汉语文本分级系统)。该系统部署在北京大学文科数智化公共平台上,是NLP技术应用于教育出版的典型案例。这一合作不仅体现了吴云芳在文本难度评估和可读性评估方向的研究积累,也展现了其将学术成果转化为社会产品的能力。

语言知识库技术转移是吴云芳产业合作的另一重要维度。她参与的"综合型语言知识库"(以《现代汉语语法信息词典》为基础)是俞士汶教授团队数十年积累的核心成果,该成果"持续对外授权应用",表明语言知识库的产业授权转让是计算语言学研究所的传统产学研模式。吴云芳官方主页明确记载"主持其他产学研合作项目7项,资源成果转让若干",说明她在语言知识库和相关NLP技术的产业转化方面有着持续而系统的投入。

2020年北京市科学技术进步二等奖("多情景跨领域中文文本智能校对关键技术及应用")直接体现了吴云芳研究成果的产业应用价值。中文文本智能校对技术在出版、媒体、教育等领域有广泛需求,该奖项表明其研究在产业落地方面获得了官方认可。

与百度等科技企业的合作也值得关注。在 NAACL 2025 发表的论文中,吴云芳课题组的论文合作者包括来自百度的研究人员(Jingang Wang、Xunliang Cai,待核实具体机构归属),研究内容为模型合并技术,该技术在搜索和大模型部署中有直接应用价值。这表明吴云芳课题组近年开始与大型科技企业在前沿NLP技术方面展开合作。

此外,吴云芳参与的国家863项目"面向基础教育的类人智能知识理解与推理关键技术"(2015-2017)本身就具有产业导向,面向基础教育场景的智能技术应用。

5.2 创业孵化与技术转化

吴云芳的研究团队虽然没有公开资料显示有直接的创业孵化案例,但其技术成果的转化路径值得深入分析。

其一,"汉语文本分级系统"作为面向教育出版行业的技术产品,通过北京大学文科数智化公共平台对外提供服务,形成了"研究—平台—应用"的转化链条。人民教育出版社作为中国最大的教育出版机构之一,其委托项目的完成本身就是产学研合作的标杆案例。

其二,吴云芳长期构建的中文语言资源(包括词义标注语料库、篇章关系标注语料库、词汇语义知识库等)通过国际语义评测任务(SemEval、NLPCC)向全球研究界开放,形成了"资源建设—评测组织—学术影响—产业关注"的间接转化路径。这种通过开放评测数据集吸引产业界关注的模式,在NLP领域是一种常见且有效的技术影响力建设策略。

其三,"资源成果转让若干"的官方表述表明,吴云芳团队的语言知识库和相关NLP技术存在直接的商业授权转让,虽然具体受让方信息未公开,但这一渠道表明其研究具有直接的商业价值。

其四,吴云芳课题组近年研究方向的转变——从传统语言知识库转向大语言模型、跨模态理解——表明团队正在积极适应产业技术范式的变革。与百度研究人员的合作论文,以及在 EMNLP、ACL 等顶会上发表的关于模型合并、提示学习等前沿主题的研究,表明课题组正在建立与产业前沿接轨的研究能力。

六、重要奖项与学术兼职

类别 内容
国家级奖项 2011年,"综合型语言知识库",国家科学技术进步二等奖(第八完成人)
省部级奖项 2020年,"多情景跨领域中文文本智能校对关键技术及应用",北京市科学技术进步二等奖
学术兼职 CLSW 2017 程序委员会共同主席(PC Co-Chair)
会议审稿 COLING、NLPCC、CCL、CLSW 等国际会议审稿人
评测组织 SemEval-2007 Task 5、SemEval-2010 Task 18、SemEval-2012 Task 4、NLPCC-2016 Task 3、NLPCC-2017 Task 1 的组织者
国家级项目参与 参与2项国家973计划项目、3项国家863项目(含1项副组长、1项课题骨干)

吴云芳还出版了1部关于文本分析的学术著作(书名具体信息待核实),发表研究论文超过50篇,部分发表于 COLING、LRE、JCST 等国际顶级期刊和会议。近年来课题组在 ACL、EMNLP、NAACL、COLING、AAAI 等CCF-A/B类会议上发表论文数量显著增长,2022年至2025年间发表了24篇代表性论文(根据官方主页精选论文列表统计),显示了团队在国际学术发表方面的强劲势头。

七、Connection圈层总结

吴云芳的学术关系网络可从以下圈层进行总结:

第一圈层:学术传承圈。 吴云芳的学术根基深植于北京大学计算语言学研究所的学术传统。她于2000-2003年在北京大学攻读博士学位,正值俞士汶教授主持计算语言学研究所工作期间。她作为第八完成人参与"综合型语言知识库"项目并获国家科技进步二等奖,长期从事《现代汉语语法信息词典》等语言知识库相关工作,这些事实高度提示其学术血脉可追溯至俞士汶这一中国计算语言学的开创者谱系(师承关系待核实)。这一传承赋予了她在中国中文信息处理领域的学术正统性和资源积累。

第二圈层:实验室协作圈。 在计算语言学研究所内部,吴云芳与孙栩(Xu Sun)在学生联合指导方面合作最为密切,二人共同指导的学生在问题生成、语法纠错等方向产出了大量论文。ICL的其他教师——常宝宝、穗志方、孙斌、王厚峰、刘洋、李素建、胡俊峰、张化瑞——构成了她的日常学术协作环境,尤其在国家级重大项目上存在多团队协作。吴云芳担任计算智能系副系主任的行政职务,也使其在系内协调中扮演重要角色。

第三圈层:学生培养圈。 吴云芳培养的学生形成了以自然语言处理为核心的研究网络,涵盖中文语法纠错(Xiuyu Wu、Chenming Tang)、问题生成(Fanyi Qu、Xin Jia)、多模态理解(Zichen Wu、Ming Zhang)、文本可读性评估(Wenbiao Li)、阅读理解干扰项生成(Xiaorui Zhou)、自动作文评分(Sanwoo Lee)等方向。这些学生的研究主题高度集中在"AI+教育"和"语义理解"两大主线,体现了吴云芳研究方向的系统性布局。学生毕业后去向尚未充分公开,但从发表记录可见部分学生已具备独立开展高水平研究的能力。

第四圈层:产业合作圈。 吴云芳的产业网络以教育出版行业为核心,人民教育出版社是关键合作伙伴。语言知识库的技术授权转让形成了持续的产学研收入来源。近年来与百度研究人员在模型合并等前沿方向的合作论文,表明产业网络正在向大型科技企业扩展。2020年北京市科技进步奖的获得,标志着其产业应用研究获得了官方层面的认可。

第五圈层:国际学术圈。 吴云芳通过连续组织 SemEval 和 NLPCC 的中文语义评测任务,在国际NLP评测社区建立了显著的学术影响力。担任 CLSW 2017 PC Co-Chair 以及多个国际会议审稿人,构成了其国际学术服务的基线。课题组国际学生(Sanwoo Lee)的招收和在国际顶会(ACL、EMNLP、NAACL、COLING、AAAI)上的持续发表,进一步巩固了其国际学术可见度。

总体而言,吴云芳的学术关系网络呈现出"继承传统语言知识库底蕴、深耕AI+教育应用、近年加速国际化与前沿化"的三维结构。她从俞士汶学术谱系中继承的语言知识库传统为其提供了学术根基和产业转化基础,而近年向大语言模型和跨模态方向的转型则正在拓展其国际学术影响力和产业合作的新维度。