人大信息学院 刘桃 副教授
报告生成时间: 2026年8月
个人主页: http://info.ruc.edu.cn/jsky/szdw/ajxjgcx/jsjkxyjsx1/fjs2/21f23181b89343bcb53ca48ff18056f4.htm (中国人民大学信息学院官方教师页面) DBLP: https://dblp.org/pid/43/656-1.html (英文名 Tao Liu 0001,DBLP 官方机构标注:Renmin University of China, School of Information / 数据工程与知识工程教育部重点实验室) Google Scholar: 公开资料未检索到可确认归属于本人的 Google Scholar 主页("Tao Liu" 同名学者过多,无法可靠消歧)
一、学者基本信息
刘桃,中国人民大学信息学院计算机科学与技术系副教授,博士生导师资格与招生情况以学院官方目录为准。主要从事深度学习、语音与图像跨模态信息处理、自然语言处理方面的研究,主持多项国家自然科学基金项目,在 ICME、ICIP、ICMR、AAAI、CIKM、ACL、EMNLP、COLING、IEEE TPDS、Bioinformatics、Data Science and Engineering 等国际会议和期刊发表论文多篇。其研究特色方向为"听音辨貌"(Voice-Face Association,语音—人脸跨模态匹配与检索),即从一个人的声音推断其面貌特征、或从面貌检索声音,是国内较早系统开展该方向研究的学者之一;另一特色方向为法律信息服务系统(法律文本挖掘、律师信息整合与推荐)。
教育与工作经历
| 时间 | 机构 | 职位/学位 | 导师/合作导师 |
|---|---|---|---|
| 2016年9月至今 | 中国人民大学信息学院 | 副教授 | — |
| 2008年7月—2016年8月 | 中国人民大学数据工程与知识工程教育部重点实验室(DEKE) | 讲师 | — |
| 2004年9月—2008年7月 | 哈尔滨工业大学计算机科学与技术学院 | 博士 | 公开资料未披露(据博士期间论文合作者推断为王晓龙教授,见第四章) |
| 2002年9月—2004年7月 | 哈尔滨工业大学计算机科学与技术学院 | 硕士 | 公开资料未披露 |
| 1998年9月—2002年7月 | 内蒙古大学计算机学院 | 学士 | — |
研究方向
- 听音辨貌(语音—人脸跨模态建模):语音与面貌的跨模态匹配、检索与关联学习(含监督与无监督设定),及其在政府治理场景中的应用
- 声图文多模态信息处理:多模态数据的一体化语义表示
- 自然语言处理:文本分类、词/文档表示学习(Ngram2vec、神经词袋模型)、中文形态与语义类推、专业领域术语自动抽取
- 法律信息服务系统:法律文本聚类、法律语义网知识检索、多源律师信息整合与推荐
讲授课程
机器学习、数据库技术与应用、文本挖掘、深度学习
代表性科研项目(据人大信息学院官网)
| 项目 | 类型 | 时间 | 角色 |
|---|---|---|---|
| 语音与面貌的跨模态建模技术及其在政府治理中的应用 | NSFC 结余经费新立项 | 2023年至今 | 主持人 |
| 多模态数据的一体化语义表示方法 | NSFC 结余经费新立项 | 2019年至今 | 主持人 |
| 深度学习支持的政府治理大数据分析与预测关键技术研究 | 国家自然科学基金联合基金项目 | 2018年1月—2022年12月 | 参与人 |
| 专业领域术语的自动抽取方法研究 | 中国人民大学科学研究基金面上项目 | 2008年10月—2010年12月 | 主持人 |
二、DBLP数据统计
身份确认与消歧说明
"Tao Liu" 是 DBLP 上同名现象最严重的华人学者姓名之一——与本 pid 同名的消歧条目多达 80 个(Tao Liu、Tao Liu 0002 至 Tao Liu 0080+,分布于大连理工、浙江大学、香港大学、PNNL、NIH、Lehigh 等全球各机构)。经消歧确认,人大信息学院刘桃对应的 DBLP 身份为 pid 43/656-1(Tao Liu 0001),依据如下:
- DBLP 官方机构标注直接匹配:该 pid 的作者页面带有官方 affiliation 备注 "Renmin University of China, School of Information, Beijing, China" 与 "Ministry of Education, Key Labs of Data Engineering and Knowledge Engineering, China"(即人大数据工程与知识工程教育部重点实验室),与官网履历(2008年入职 DEKE 实验室)完全吻合;
- 代表论文直接匹配:人大官网教师页列出的三篇代表性论文(ICME 2023 "EFT: Expert Fusion Transformer"、ICIP 2023 "Local-Global Contrast"、ICMR 2022 "Self-Lifting")均收录于该 pid 名下,作者组合一致(Guangyu Chen, Deyuan Zhang, Tao Liu, Xiaoyong Du);
- 时间线匹配:该 pid 的发表记录始于 2006—2007 年(哈尔滨工业大学攻读博士期间,合作者为哈工大 NLP 团队),2009 年起转为人大 DEKE 团队(合作者为何军、杜小勇等),与官网教育/工作履历逐段对应。
消歧可靠度高,本章统计可直接采用该 pid 数据。
DBLP发表记录统计
据 DBLP BibTeX 记录(截至2026年8月),该 pid 共收录 48 条发表条目(含会议论文、期刊论文与 arXiv 预印本)。
按年份分布:
| 年份 | 论文数 | 代表性会议/期刊 |
|---|---|---|
| 2006—2007 | 5篇 | Bioinformatics、JCLC、IEEE SMC(哈工大博士期间) |
| 2009—2012 | 12篇 | WAIM、ChinaGrid、CIKM、IUCS、ADMA(人大早期,法律信息方向) |
| 2013—2015 | 4篇 | WISE、IEEE SMC、ICMLC、arXiv |
| 2016—2017 | 13篇 | AAAI、EMNLP×5、ACL、COLING、ECAI、APWeb×3、DASE、ICWS、SMC(NLP 表示学习高产期) |
| 2018—2019 | 9篇 | ACL、EMNLP(UER)、NLPCC、TPDS、DASE、arXiv(Voice-Face Benchmark) |
| 2020—2023 | 5篇 | IJMLC、ICMR、ICME、ICIP、arXiv(WavMark)(听音辨貌方向) |
从趋势看,其学术产出呈明显的三阶段演进:2009—2012年的法律文本挖掘起步期 → 2015—2019年的自然语言表示学习高产期(年度峰值8篇,2017年) → 2019年至今聚焦语音—人脸跨模态的转型期。总量不大(48条),但方向转换脉络清晰。
核心合作者统计(基于DBLP BibTeX记录,已剔除会议编委等非作者人员)
| 合作者 | DBLP pid | 合作次数 | 合作年份 | 身份/所属机构 |
|---|---|---|---|---|
| Xiaoyong Du(杜小勇) | 47/3542-1 | 37次 | 2009—2023 | 人大信息学院教授(曾任信息学院院长、理工处处长),最核心合作者,全时段覆盖 |
| Zhe Zhao(赵哲) | — | 17次 | 2015—2019 | 博士生(推测),Ngram2vec/UER 第一作者,后加入腾讯 AI Lab |
| Bofang Li(李博凡) | — | 12次 | 2015—2019 | 博士生(推测),词/文档表示学习方向 |
| Minghui Li(李明辉) | — | 7次 | 2006—2014 | 哈工大时期合作者,博士期间及之后持续合作 |
| Deyuan Zhang(张德元) | 75/8426 | 6次 | 2015—2023 | 人大信息学院合作者(师生关系,推测),听音辨貌方向的共同作者 |
| Xiaolong Wang(王晓龙) | 91/952-1 | 7次 | 2006—2020 | 哈尔滨工业大学教授(推断为博士导师,见第四章) |
| Shen Li(李绅) | — | 6次 | 2017—2018 | 博士生(推测),中文类推/类比推理方向 |
| He Hu(胡鹤) | h/HeHu | 7次 | 2009—2012 | 人大信息学院同事(现为副教授),早期联合培养学生论文 |
| Guangyu Chen(陈光宇) | c/GuangyuChen | 5次 | 2018—2023 | 博士生(推测),听音辨貌方向核心学生 |
| Puwei Wang(王普伟) | — | 5次 | 2016—2019 | 博士生(推测),服务计算/文本表示方向 |
| Hongyan Liu(刘红岩) | — | 3次 | 2009—2013 | 清华大学经管学院教授,跨机构合作 |
| Jun He(何军) | — | 3次 | 2009—2013 | 人大信息学院教授,实验室同事 |
| Biao Fan(樊彪) | — | 3次 | 2009—2011 | 硕士生(推测) |
| Ying Zhan(詹瑛/占颖,中文名待核) | — | 3次 | 2017—2019 | Puwei Wang 团队合作者(推测) |
| 腾讯 AI Lab 团队(Hui Chen、Jinbin Zhang、Xin Zhao、Wei Lu、Xi Chen、Haotang Deng、Qi Ju 等) | — | 各1—2次 | 2019 | UER 预训练工具包联合研发 |
| 微软亚洲研究院(Yu Wu、Shujie Liu、Furu Wei) | — | 各1次 | 2023 | WavMark 音频水印论文合作 |
| Chuyuan Xiong | — | 1次 | 2019 | Voice-Face Benchmark 论文第一作者(时为海外博士生,推测) |
三、博士教育背景
博士阶段(哈尔滨工业大学,2004—2008年)
刘桃于2004年9月至2008年7月在哈尔滨工业大学计算机科学与技术学院攻读博士学位。官方页面未披露博士导师姓名。但从 DBLP 记录看,其博士期间(2006—2007年)及前后(至2011年)的论文持续与王晓龙教授(Prof. Xiaolong Wang)共同署名,且同期合作者刘秉权(Bingquan Liu)、刘远超(Yuanchao Liu)均为哈工大王晓龙 NLP 团队成员,可基本推断其博士研究在王晓龙教授团队中完成。王晓龙教授为哈工大荣休教授、国务院政府特殊津贴专家,开创了汉语语句级智能输入技术(成果授权微软并发展为微软拼音输入法),获2024年度 CCF-NLP 最高科学技术奖——这一师承解释了刘桃扎实的自然语言处理与中文信息处理功底。
博士期间代表性成果:
- Bioinformatics 2007:"Protein-protein interaction site prediction based on conditional random fields"——将序列标注方法用于蛋白质相互作用位点预测(生物信息学交叉方向)
- JCLC 2007:"The Effectiveness Study of Local Maximum Feature for Chinese Unknown Word"——中文未登录词识别
- IEEE SMC 2007:基于修辞结构的多文档自动摘要;基于 bootstrapping 的领域术语抽取
- IEEE SMC 2007(与徐睿峰等):中文形态语义类推研究
- AAAI 2011(博士毕业后):"Partially Supervised Text Classification with Multi-Level Examples"——部分监督文本分类,与杜小勇、王晓龙等联合署名,是其哈工大—人大学术网络的衔接点
值得注意的是,其硕士与博士均在哈工大完成(2002—2008年连续六年),本科就读于内蒙古大学计算机学院。
加入人大后的第一个研究方向:法律信息服务(2008—2012年)
2008年入职人大 DEKE 实验室后,刘桃最初的研究方向是法律信息服务系统,与何军教授(法律信息处理方向)、杜小勇教授合作,指导学生完成了一系列工作:KeyOnto 法律语义网知识检索模型(ChinaGrid 2009)、AutoPCS 短语文本分类系统(2009)、法律文本引用关系聚类(ChinaGrid 2010)、多源律师信息整合与推荐(ICMLC 2011)等。该方向延续至其术语抽取研究(WAIM 2010 图互增强领域术语抽取、ChinaGrid 2012 随机游走领域术语抽取),与其主持的首个人大科研基金项目"专业领域术语的自动抽取方法研究"(2008—2010)对应。"法律信息服务系统"至今仍列为其官方研究方向之一。
四、导师/师承分析
师承谱系
王晓龙(哈尔滨工业大学教授,微软拼音输入法技术开创者,
2024年度 CCF-NLP 最高科学技术奖得主)
└── 刘桃(博士,2008届,导师关系据论文署名推断,官方未披露)
└── 中国人民大学信息学院 副教授
├── 陈光宇(Guangyu Chen,博士生,推测)——听音辨貌方向
├── 赵哲(Zhe Zhao,博士生,推测)——词表示学习,后赴腾讯 AI Lab
├── 李博凡(Bofang Li,博士生,推测)——词/文档表示学习
├── 李绅(Shen Li,博士生,推测)——中文类比推理
└── 王普伟(Puwei Wang,博士生,推测)——服务计算与文本分类
重要说明:王晓龙—刘桃的指导关系系基于以下证据的推断,而非官方披露:(1) 刘桃2004—2008年在哈工大计算机学院攻读博士;(2) 其2006—2011年论文反复与王晓龙共同署名(SMC 2007、AAAI 2011 等,共6篇);(3) 同期合作者刘秉权、刘远超均为王晓龙团队成员;(4) 2007年论文中王晓龙署名位置在最后(资深作者位)。若需精确确认,建议查阅其博士学位论文扉页。
学术谱系的上溯
王晓龙教授1989年获哈尔滨工业大学计算机应用博士学位,是哈工大计算机应用学科(国内最早一批计算机应用博士点)培养的学者,其开创的语句级拼音输入技术授权微软公司发展为微软拼音输入法,在中文信息处理领域影响深远。刘桃的研究轨迹(中文信息处理 → 文本挖掘 → 多模态)延续了这一谱系的"语言/信息处理"主线。
加入人大后的学术网络核心:杜小勇
杜小勇教授(Xiaoyong Du) 是理解刘桃学术网络的关键人物。杜小勇曾任中国人民大学信息学院院长、校长助理、理工处处长,是 DEKE 教育部重点实验室的核心人物。DBLP 记录显示两人自2009年起合作达 37次,贯穿刘桃在人大任职的全部时段(2009—2023年),覆盖法律信息(2009—2012)、文本表示(2015—2019)、听音辨貌(2019—2023)三个阶段。值得注意的是,在刘桃的听音辨貌系列论文中,杜小勇始终作为最后一位作者(资深/通讯作者位)署名,表明该方向的工作得到杜小勇的直接支持——一位资深院领导持续十余年为一位普通讲师/副教授的研究"背书",在人大信息学院内部属于较为紧密的长期绑定关系。何军教授(法律信息方向)、胡鹤副教授(语义Web/人工智能,同为哈工大背景)则是其早期(2009—2012年)联合培养学生论文的主要同事合作者。
五、现单位团队与核心合作者
所属团队定位
刘桃现任职于中国人民大学信息学院计算机科学与技术系,隶属于数据库与智能信息检索实验室(DBIIR)——该实验室是数据工程与知识工程教育部重点实验室(DEKE)的重要组成部分。据实验室官方页面,DBIIR 实验室的"多模态信息处理"方向由何军、刘桃、胡鹤三人共同承担,联系人为何军教授。在人大信息学院的多媒体与语音计算版图中,刘桃与金琴教授(多媒体智能计算、人机交互方向)分属不同实验室,但研究主题(声图文多模态)高度互补;学院退休教师许洁萍副教授(中科院声学所博士,音频/音乐信息检索方向)的退休也使刘桃成为学院内语音信号处理方向的主要在任教师之一。
学生团队(基于DBLP高频合作推断)
| 姓名(英文/DBLP) | 合作次数 | 合作年份 | 推测身份与研究方向 |
|---|---|---|---|
| Guangyu Chen(陈光宇) | 5次 | 2018—2023 | 核心博士生,听音辨貌方向(无监督关联学习、专家融合Transformer、语音人脸表示对比学习),曾在微软亚洲研究院参与 WavMark 研究(推测为实习) |
| Deyuan Zhang(张德元) | 6次 | 2015—2023 | 人大信息学院合作者,从文本表示(2015年文档嵌入)到听音辨貌(2019—2023)持续合作,现为人大教师(师生关系,推测) |
| Zhe Zhao(赵哲) | 17次 | 2015—2019 | 高产博士生,Ngram2vec(EMNLP 2017)、UER 预训练工具包(EMNLP 2019)第一作者,毕业后加入腾讯 AI Lab |
| Bofang Li(李博凡) | 12次 | 2015—2019 | 高产博士生,Neural Bag-of-Ngrams(AAAI 2017)、情感分类文档嵌入(COLING 2016)等 |
| Shen Li(李绅) | 6次 | 2017—2018 | 博士生,中文形态语义类推(ACL 2018) |
| Puwei Wang(王普伟) | 5次 | 2016—2019 | 博士生,加权神经N-gram、QoS感知服务组合(TPDS 2019) |
| 早期学生(Biao Fan、Jingjing Kang、Wenjuan Wu、Xiaoyun Hou、Nana Xu、Ye Li 等) | 各2—3次 | 2009—2013 | 硕士生(推测),法律信息与服务计算方向 |
跨机构核心合作者
| 合作者 | 所属机构 | 合作次数 | 合作年份 | 领域 |
|---|---|---|---|---|
| Xiaolong Wang(王晓龙) | 哈尔滨工业大学 | 7次 | 2006—2020 | 中文信息处理,推断为博士导师 |
| Minghui Li(李明辉) | 哈工大时期合作者 | 7次 | 2006—2014 | 文本分类、术语抽取 |
| Hongyan Liu(刘红岩) | 清华大学经管学院 | 3次 | 2009—2013 | 社交网络用户属性预测(WISE 2013 微博用户年龄预测) |
| Aleksandr Drozd | 东京工业大学(论文署名) | 2次 | 2017—2019 | 词向量评测(EMNLP 2017、DASE 2019),词表示学习国际比较研究 |
| Satoshi Matsuoka | 东京工业大学 | 1次 | 2019 | Scaling Word2Vec on Big Corpus(DASE) |
| Chuyuan Xiong | 加州大学圣地亚哥分校(推测) | 1次 | 2019 | Voice-Face Cross-modal Matching and Retrieval Benchmark |
| Buzhou Tang(汤步星) | 哈尔滨工业大学(深圳)(推测) | 2次 | 2017—2020 | 临床文本命名实体识别、图神经网络 |
六、业界合作关系深度分析
刘桃的产业合作记录在其 DBLP 记录中呈现"少量但高质"的特征,主要涉及腾讯、微软两家,另有政府治理应用导向的科研项目。
1. 腾讯(Tencent AI Lab)
合作深度:★★★☆☆(开源工具包联合研发)
2019年 EMNLP 系统演示论文 "UER: An Open-Source Toolkit for Pre-training Models" 由刘桃团队与腾讯 AI Lab 联合完成——论文署名中 Zhe Zhao(刘桃博士生)、Hui Chen、Jinbin Zhang、Xin Zhao、Wei Lu、Xi Chen、Haotang Deng、Qi Ju 等均为腾讯 AI Lab 成员,杜小勇、刘桃为人大方作者。UER(Universal Encoder Representations)是中文预训练模型开源工具包,在中文 NLP 社区有较大影响力, GitHub 开源后成为多个中文预训练模型的训练基础设施。这是刘桃网络中规模最大的一次产学合作:其学生赵哲毕业后加入腾讯 AI Lab,形成了"联合培养→联合产出→人才输送"的完整合作链路。
2. 微软亚洲研究院(Microsoft Research Asia)
合作深度:★★☆☆☆(单篇高水平联合论文)
2023年 arXiv 论文 "WavMark: Watermarking for Audio Generation"(后发表于国际会议)由陈光宇(刘桃学生)、Yu Wu、Shujie Liu(微软亚洲研究院语音组)、刘桃、杜小勇、Furu Wei(韦福如,MSRA 首席研究员)联合完成。WavMark 是面向生成式音频的深度学习水印技术,在 AIGC 内容溯源场景有重要价值。该论文连接了刘桃的语音方向专长与 MSRA 的语音生成研究,推测系陈光宇在 MSRA 实习期间完成。与 Furu Wei(MSRA 自然语言计算组负责人、多项 NeurIPS/ICML 最佳论文级工作作者)的联合署名是该网络中含金量最高的产业界连接之一。
3. 政府治理与法律行业应用
合作深度:★★☆☆☆(纵向项目驱动,未见企业署名论文)
刘桃主持的项目"语音与面貌的跨模态建模技术及其在政府治理中的应用"(2023年起)与参与的国家自然科学基金联合基金项目"深度学习支持的政府治理大数据分析与预测关键技术研究"(2018—2022年)均以政府治理为应用场景;其长期的"法律信息服务系统"方向(律师推荐、法律文本聚类)指向司法/法律服务行业的应用落地。但公开资料中未检索到与企业联合署名的横向合作论文或明确的横向项目清单,此类合作若存在,多以项目形式而非论文形式开展。
4. 学生毕业去向
- 赵哲(Zhe Zhao):毕业后加入腾讯 AI Lab(NLP 方向),后转向产业界 AI 研究岗位,是 UER 工具包的持续维护者
- 李博凡(Bofang Li):学术去向公开资料未披露
- 陈光宇(Guangyu Chen):博士期间有微软亚洲研究院研究经历(推测为实习),从事语音水印与跨模态研究
- 早期法律信息方向学生的去向公开资料未披露
5. 产学研合作总结
与同院系高产学者相比,刘桃的产学研合作规模有限,但呈现清晰的"工具与基准输出"特征:UER 工具包(与腾讯)和 Voice-Face Benchmark(跨模态检索基准数据集)都是面向社区的开放资源,WavMark(与微软)则是面向 AIGC 治理的前沿技术。其产业合作与其说是项目制绑定,不如说是通过学生实习与开源合作自然形成的网络。
七、Connection 圈层总结
第一圈层(单位内长期核心合作者): 杜小勇教授(37次合作,2009—2023年,全网络最高频)是刘桃在人大十五年间唯一贯穿所有研究阶段的合作者——从法律信息到文本表示再到听音辨貌,杜小勇均以资深作者身份署名,提供学术平台与资源支撑。何军教授、胡鹤副教授(DBIIR 实验室多模态信息处理方向的三人组)是其日常科研的同事圈层,胡鹤同为哈工大背景,存在校友纽带。
第二圈层(博士阶段师承与哈工大网络): 王晓龙教授(哈工大,6次合作,推断为博士导师)奠定了其中文信息处理的学术根基;哈工大 NLP 团队(刘秉权、刘远超、徐睿峰)构成其博士时期的学术共同体;李明辉(7次,2006—2014年)是跨越哈工大与人大两阶段的持续合作者。这一哈工大中文信息处理谱系是其学术身份的源头。
第三圈层(自主培养的学生网络): 赵哲(17次)与李博凡(12次)是2015—2019年文本表示学习高产期的两大支柱;陈光宇(5次)与张德元(6次)是2019年后听音辨貌转型的核心执行者。学生毕业去向(腾讯 AI Lab、微软亚洲研究院实习)直接打通了其产业合作渠道。
第四圈层(产业与跨机构网络): 腾讯 AI Lab(UER 工具包联合研发+学生输送)与微软亚洲研究院(WavMark,韦福如团队)是其两个明确的产业连接点;清华大学刘红岩(社交网络挖掘)与东京工业大学 Drozd/Matsuoka(词向量规模化)是其主要学术跨机构合作;政府治理与法律服务(律师推荐系统)构成其应用落地的特色场景。
网络结构特征: 刘桃的学术网络是一个典型的"单核长寿型"结构——以杜小勇为恒定核心,围绕其先后形成哈工大师承圈(2002—2008)、法律信息圈(2009—2012)、文本表示圈(2015—2019)、听音辨貌圈(2019—2023)四个依次更替但鲜少重叠的子网络。他没有博士后经历、没有海外访学记录、没有大规模横向项目,网络密度主要依赖单位内部的长期共生关系。其研究方向的三次大跨度转换(法律信息→词表示→语音人脸跨模态)在每一段都重建了新的合作子网络,而杜小勇是唯一贯穿始终的节点——这种结构使其网络稳定性强但外向扩张性相对有限。
产出规模与趋势: DBLP 收录48篇(2006—2023年),年均约2.7篇,属于稳定的中等产出型学者。2019年后转向听音辨貌方向以来,发表节奏放缓(每年1—3篇),但方向高度聚焦,ICMR/ICIP/ICME 三大多媒体会议连续发表,且 WavMark、Voice-Face Benchmark 等工作显示其在 AIGC 音频安全与跨模态基准建设上的独特定位。
八、数据来源与局限性说明
本报告主数据来自 DBLP 官方作者消歧记录(pid: 43/656-1,Tao Liu 0001),通过该 pid 的完整 BibTeX 记录(48条)解析合著频次与论文信息;消歧依据为 DBLP 官方机构标注与人大官网教师页所列代表性论文的精确匹配,可靠度高。
报告同时结合以下信息源: - 中国人民大学信息学院官方教师页面(教育经历、工作经历、研究方向、讲授课程、科研项目、代表论文) - 中国人民大学信息学院数据库与智能信息检索实验室(DBIIR)官方页面(确认多模态信息处理方向由何军、刘桃、胡鹤共同承担) - 王晓龙教授公开履历(百度百科词条,含 CCF-NLP 最高科学技术奖、微软拼音输入法背景) - DBLP 作者消歧页面(确认同名条目达80个)
主要局限性: 1. 博士导师未获官方确认:人大官网仅列出学位与院校,未披露导师姓名。王晓龙教授的导师关系系基于2006—2011年论文持续共同署名、哈工大 NLP 团队成员重合等证据的推断,建议以其博士学位论文扉页为一手确认来源; 2. 学生身份均为推测:DBLP 记录不含师生角色信息,赵哲、李博凡、陈光宇、李绅、王普伟等人的博士生身份系根据署名顺序、合作年份和主题连贯性推断;张德元现为人大教师,但其与刘桃的具体关系(师生或同事)未能从公开资料确认; 3. Google Scholar 主页缺失:因 "Tao Liu" 同名过多且未检索到带机构自证的主页,本报告未提供 Google Scholar 引用数据; 4. 官网教师页代表性论文仅列3篇:2023年后的最新发表(如 WavMark 的正式发表版本、2024—2026年论文)可能未完整收录于 DBLP 或未被本次调研捕获; 5. 横向项目与工业界合作可能被低估:政府治理、法律服务方向的横向合作通常不产生公开署名论文,本报告的产业合作分析仅基于 DBLP 可见记录; 6. 中文论文未统计:DBLP 对其2008—2010年间的中文期刊论文(对应法律信息与术语抽取方向的国内发表)收录可能不全,早期实际产出应高于48条。