哈尔滨工业大学 冯骁骋 教授
报告生成时间:2026年8月20日
个人主页:冯骁骋
所属团队:哈尔滨工业大学计算学部社会计算与信息检索研究中心(HIT-SCIR)
一、学者基本信息
| 字段 | 内容 |
|---|---|
| 姓名 | 冯骁骋(Xiaocheng Feng) |
| 出生年份 | 1988年8月 |
| 职称 | 教授(原副教授,已晋升) |
| 所属单位 | 哈尔滨工业大学计算学部 |
| 实验室职务 | HIT-SCIR文本生成组(TG)组长;人工智能学院副院长 |
| 学术头衔 | 博士生导师 |
| 国家级人才 | 入选中国科协第六届青年人才托举工程 |
| 其他任职 | 中文信息处理黑龙江省重点实验室主任助理(曾任);鹏城国家实验室双聘副研究员;CCF高级会员 |
| 邮箱 | xiaocheng.feng@hit.edu.cn(待核实);hitjf414@hit.edu.cn(公开联系邮箱,见于哈工大通知) |
| 研究方向 | 自然语言处理、文本生成、机器翻译、代码生成、大语言模型 |
二、教育背景与职业履历
冯骁骋,男,1988年8月出生,其学术生涯与哈尔滨工业大学社会计算与信息检索研究中心(HIT-SCIR)紧密交织。
教育阶段:冯骁骋于2013年进入哈尔滨工业大学攻读博士学位,为SCIR实验室2013级博士生,在中心最初的分组中归属于TM(翻译/文本挖掘)组。其博士导师为刘挺教授(时任哈工大计算学部主任、SCIR实验室创始人兼主任),秦兵教授(现任SCIR研究中心主任)亦在其培养过程中发挥重要指导作用(待核实是否为联合培养导师)。博士期间,他的研究方向聚焦于自然语言处理与文本生成,在ACL、AAAI、IJCAI、TKDE、Chinese Science等CCF A/B类国际会议及期刊发表多篇论文。其博士学位论文获中国中文信息学会优秀博士学位论文奖,这是国内中文信息处理领域的重要荣誉。
职业履历:博士毕业后,冯骁骋留校任教,先后担任哈工大计算学部副教授、博士生导师。在副教授期间,他担任智能科学与技术系副主任、中文信息处理黑龙江省重点实验室主任助理等职务。约2024至2025年间晋升为教授。截至2025年,他担任哈尔滨工业大学人工智能学院副院长,同时继续担任HIT-SCIR文本生成组(TG)组长,是研究中心核心教师团队成员之一。
行政与教学:冯骁骋长期担任哈工大"仲荣"人工智能青年教师研习班班主任(自2023年第一期起),负责课程体系设计与教学组织。他亦参与计算学部博士研究生招生工作,列入2026年博士研究生招生委员会成员。
三、学生培养情况
冯骁骋作为HIT-SCIR文本生成组(TG)组长,培养了多名博士和硕士研究生。以下列出代表性学生(信息主要来源于HIT-SCIR历届毕业生公示名单)。
1. 冯夏冲(香港大学博士后,博士毕业生)
冯夏冲为冯骁骋指导的2018级博士生(本科为2014级),归属于文本生成组(TG)。据其个人主页(xcfeng.net)确认,他在哈工大期间由秦兵教授和冯骁骋教授共同指导。冯夏冲的研究方向涵盖文本生成与大语言模型,是冯骁骋团队中学术产出最为突出的学生之一。他参与了多项重要研究,包括AAAI 2026 Oral论文"Causal Tracing of Object Representations in Large Vision Language Models"以及ACL 2025论文。博士毕业后,冯夏冲前往香港大学从事博士后研究,继续在自然语言处理领域深耕。
2. 覃立波(中南大学教师,博士毕业生/合培)
覃立波为HIT-SCIR 2013级本科生(LA组)和2018级博士生(LA组),后留校转为教师方向。据公开报道,覃立波现为中南大学教授,在对话系统和大模型思维链研究方向有较高影响力,曾在CNCC 2025"大模型长思维链推理的前沿与未来"分论坛做特邀报告。值得注意的是,覃立波与冯骁骋合译了Sebastian Raschka所著《Build a Large Language Model (From Scratch)》中文版(覃立波、冯骁骋、刘乾译),展现了师门间的深厚学术联系。虽覃立波博士期间分组为LA(语言分析),但其与冯骁骋在学术翻译和出版方面有密切合作。
3. 陈双(腾讯,博士毕业生)
陈双为2017级博士生,归属于文本生成组(TG)。据SCIR毕业生名单,陈双博士毕业后前往腾讯从事研发工作。陈双的本科亦在SCIR完成(2013级本科生,TM组),是中心内部本硕博贯通培养的典型代表。
4. 龚恒(腾讯,博士毕业生)
龚恒为2018级博士生,归属于文本生成组(TG)。其本科亦在SCIR完成(2013级本科生,TM组)。博士毕业后前往腾讯从事研发工作,体现了文本生成组学生在产业界的持续输出。
5. 冯掌印(华为,博士毕业生)
冯掌印为2019级博士生,归属于文本生成组(TG)。其本科亦在SCIR完成(2014级本科生,TM组)。博士毕业后前往华为(北京)从事研发工作,体现了冯骁骋团队与华为之间的产学研人才输送通道。
6. 黄毅翀(哈工大在读博士,硕士毕业生)
黄毅翀为2020级硕士生(TG组),硕士毕业后选择留校攻读博士学位,继续在HIT-SCIR文本生成组从事研究。他是冯骁骋团队中"硕士转博士"培养路径的代表,体现了团队对优秀学生的持续吸引力。
7. 叶扬帆(哈工大在读博士,硕士毕业生)
叶扬帆为2023级硕士生(TG组),硕士毕业后选择留校攻读博士学位。作为冯骁骋团队最新一代的学术传承者,叶扬帆已参与ACL 2025论文的发表工作。
8. 崔一鸣(科大讯飞,博士毕业生)
崔一鸣为2018级博士生,虽分组为LA(语言分析),但据冯骁骋团队与科大讯飞的密切合作关系推断,其研究工作与文本生成组有交叉。博士毕业后前往科大讯飞(讯飞)从事研发工作。崔一鸣也参与了《Build a Large Language Model (From Scratch)》中文版的翻译工作(待核实具体角色)。
硕士培养概况:除上述博士生外,冯骁骋在文本生成组还培养了大量硕士生。根据SCIR历届毕业生名单,TG组硕士毕业生去向包括:拼多多(陈昱宇、杨浩正、肖腾朝)、百度(孙卓)、腾讯(孙亚威、吴佳铭)、字节跳动(张凌源、叶成豪)、东方财富(冯晨)、中国邮政(马思成)、航天信息(聂润泽)等知名企业,充分体现了其学生在产业界的广泛认可度。
四、学术合作网络
4.1 实验室内部合作
冯骁骋作为HIT-SCIR文本生成组组长,与中心内部教师形成了紧密的合作网络。核心合作者包括:
- 刘挺教授(哈工大党委常委、副校长):冯骁骋的博士导师,SCIR实验室创始人。两人长期合作,刘挺作为资深导师在重大项目申请和学科建设方面提供支持。
- 秦兵教授(SCIR研究中心主任):与冯骁骋共同指导多名博士生(如冯夏冲),在ACL 2025等论文中频繁共同署名。秦兵在情感计算、知识图谱方向的研究与冯骁骋的文本生成方向形成互补。
- 车万翔教授(研究中心副主任兼语言分析组组长):在教材出版(《自然语言处理:基于大语言模型的方法》)和THUNLP-HIT-SCIR学术联谊会等活动中密切协作。
- 张伟男教授(对话技术组组长):同为SCIR核心教师,在"仲荣"研习班等教学活动中协作,研究方向上对话技术与文本生成有交叉。
- 赵森栋副教授(健康智能组组长):两人均为SCIR中青年骨干,在ACL 2025论文中共同署名(如GainRAG论文),学术互动密切。
- 丁效教授(研究中心副主任):在中心管理和学术活动中有协作。
- 刘元兴副研究员(对话技术组副组长):为2019级博士生(DT组),已留校任教,体现了SCIR内部的人才梯队建设。
4.2 跨机构合作
冯骁骋在国内学术界建立了广泛的跨机构合作网络:
- 清华大学THUNLP实验室:HIT-SCIR与清华THUNLP建立了定期的学术联谊机制。2021年5月第二届THUNLP & HIT-SCIR学术联谊会上,冯骁骋与清华孙茂松教授、刘洋教授、刘知远副教授等共同出席,两校师生进行深度学术交流。
- 中南大学:通过学生覃立波(现任中南大学教授)建立了学术联系,覃立波在对话系统和大模型思维链方向的研究与冯骁骋的文本生成方向高度互补。
- 中国人民大学:冯骁骋曾受邀在人大高瓴人工智能学院"大模型:前沿技术与未来应用"研讨会上做"检索增强的大语言模型"报告,与人大NLP团队有学术交流。
- 鹏城国家实验室:冯骁骋担任鹏城国家实验室双聘副研究员,与大模型研究基础设施方面有合作。
- 广东省安全智能新技术重点实验室:冯骁骋曾受邀在SAILING讲坛做特邀报告,与华南地区学术机构有交流。
4.3 国际合作
冯骁骋的国际合作主要体现在以下几个方面:
- 微软亚洲研究院(MSRA):冯骁骋主持MSRA Collaborative Research Program,与微软亚洲研究院保持长期科研合作关系。这也是其产业国际合作的重要渠道。
- 国际会议服务:担任ACL、EMNLP、NAACL等国际顶级NLP会议的程序委员会领域主席(Area Chair)/高级成员,通过会议审稿和程序委员会工作与国际学术界建立联系。
- 学生国际化培养:其博士生冯夏冲毕业后前往香港大学从事博士后研究,打开了与香港大学NLP团队的合作通道。
- 论文合作:在ACL 2025、AAAI 2026等国际顶级会议论文中,冯骁骋与多位国际同行有共同署名,体现了在国际学术舞台上的活跃度。
五、业界合作关系深度分析
5.1 产业科研合作
冯骁骋与多家国内外头部科技企业保持长期科研合作关系,形成了"学术研究—技术转化—人才培养"的完整闭环:
- 华为:冯骁骋与华为保持长期科研合作,其博士生冯掌印毕业后加入华为(北京)。华为也是SCIR实验室"语言技术平台LTP"的付费使用企业之一。冯骁骋主持的科技创新2030—新一代人工智能重大项目子课题等国家级项目可能涉及与华为的产业合作。此外,学生严未圻(2021级硕士,QA组)毕业后亦前往华为。
- 腾讯:腾讯是冯骁骋团队学生最主要的就业去向之一。文本生成组硕士毕业生中,孙亚威、吴佳铭前往腾讯(深圳),博士毕业生陈双、龚恒亦加入腾讯。SCIR的"大词林"知识图谱被腾讯广泛使用,语言技术平台LTP亦被腾讯付费使用。
- 科大讯飞:冯骁骋与科大讯飞的合作尤为深入。在ACL 2025论文中,科大讯飞研究员伍大勇、胡国平作为共同作者出现,表明冯骁骋与讯飞研究团队在检索增强生成等前沿方向有实质性科研合作。博士毕业生崔一鸣加入科大讯飞,学生刘洋(2017级硕士,LA组)亦前往讯飞。科大讯飞还牵头了国家"863"计划"高考机器人项目",冯骁骋在高考议论文自动生成方面的研究与该项目有潜在关联。
- 微软(MSRA):冯骁骋主持MSRA Collaborative Research Program,与微软亚洲研究院有直接的科研项目合作。SCIR实验室博士毕业生刘璟曾前往微软亚洲研究院,付瑞吉前往科大讯飞,体现了MSRA与SCIR长期的人才与研究合作传统。
- 字节跳动:冯骁骋文本生成组的多名硕士毕业生(张凌源、叶成豪等)前往字节跳动就业,体现了与字节跳动在人才输送方面的联系。
5.2 大模型研发与产业转化
冯骁骋作为HIT-SCIR文本生成组组长,主导或参与了多个具有产业影响力的大模型研发项目:
- "活字"系列大模型:哈工大SCIR自主研发的开源对话大模型,最新版本"活字3.5"基于Chinese-Mixtral-8x7B。该模型在GitHub获得超过千次Star,HuggingFace下载量累计达1.3万次,是团队产业转化的标志性成果。
- "本草"医学大模型:国内首个开源医学大模型,基于"活字"基座,GitHub开源代码获4.7K Star(国内医学模型榜首)。该模型被华为、腾讯、讯飞等企业用于行业大模型开发,体现了冯骁骋团队研究成果的直接产业价值。
- "风筝"航天知识大模型:由HIT-SCIR文本生成组(HIT-SCIR-TG)直接推出,冯骁骋作为组长应为该项目的核心负责人。风筝2.0基于通义千问Qwen3进行领域后训练,支持中英文双语航天知识建模,训练语料规模达52万余条。该项目展现了文本生成组在垂直领域大模型方面的研发能力。
- "珠算"代码大模型:SCIR自主研发的代码大模型,与冯骁骋"代码生成"研究方向直接相关。
这些大模型的研发和开源,不仅体现了冯骁骋团队的技术实力,也构建了与华为、腾讯、讯飞等企业的深度产业合作生态——企业使用其开源模型进行行业应用开发,同时通过联合科研和人才输送形成持续的合作关系。
六、重要奖项与学术兼职
| 类别 | 具体内容 | 年份 |
|---|---|---|
| 人才计划 | 中国科协第六届青年人才托举工程 | 入选 |
| 学术奖项 | 中国中文信息学会优秀博士学位论文奖 | 博士毕业时 |
| 科技奖励 | 黑龙江省科技进步二等奖 | — |
| 行业奖项 | 世界人工智能大会(WAIC)云帆奖·璀璨明星 | 2022 |
| 提名/候选 | CCF自然语言处理专委会青年新锐学者候选人 | 2023 |
学术兼职:
- 中国中文信息学会(CIPS)自然语言生成与智能写作专业委员会副秘书长
- 中国计算机学会(CCF)YOCSEF哈尔滨主席(后任副主席)
- CCF高级会员
- ACL、EMNLP、NAACL等国际会议程序委员会领域主席(Area Chair)/高级成员
- 鹏城国家实验室双聘副研究员
- 哈工大计算学部博士研究生招生委员会成员(2026年)
主持科研项目:
- 科技创新2030—新一代人工智能重大项目子课题一项
- 国家实验室重点项目课题一项
- 国家自然科学基金面上项目和青年项目各一项
- 黑龙江省重点研发项目一项
- 黑龙江省优秀青年基金一项
- MSRA Collaborative Research Program
七、Connection圈层总结
冯骁骋的学术关系网络可从以下圈层进行总结:
第一圈层(核心师门):以刘挺教授(博士导师)和秦兵教授(研究中心主任、联合指导导师)为核心,冯骁骋作为HIT-SCIR文本生成组组长,与车万翔、张伟男、丁效、赵森栋等SCIR中青年骨干教师形成紧密的实验室内部合作网络。这一圈层是冯骁骋学术发展的根基,也是其日常科研和教学活动的主要协作圈。
第二圈层(学术传承):冯骁骋培养了多名优秀博士生,其中冯夏冲(香港大学博士后)、覃立波(中南大学教授)已在校外独立发展学术生涯,陈双、龚恒、冯掌印等进入腾讯、华为等头部企业。其硕士毕业生广泛分布于拼多多、腾讯、百度、字节跳动等企业。学生网络既是冯骁骋学术影响力的延伸,也是其产学研合作的桥梁。
第三圈层(国内学术网络):通过THUNLP-HIT-SCIR学术联谊会等机制与清华大学NLP团队(孙茂松、刘洋、刘知远)建立联系;通过学术报告和会议与中国人民大学高瓴人工智能学院、广东省安全智能新技术重点实验室等机构有交流;通过鹏城国家实验室双聘身份连接大模型研究基础设施。CCF和CIPS的学术兼职(YOCSEF哈尔滨主席、自然语言生成专委会副秘书长)进一步扩展了其在国内学术圈的影响力。
第四圈层(产业合作网络):与华为、腾讯、科大讯飞、微软(MSRA)四家头部科技企业保持长期科研合作关系。特别是与科大讯飞(伍大勇、胡国平为ACL 2025共同作者)和微软(MSRA Collaborative Research Program)有实质性的联合科研产出。通过"活字""本草""风筝""珠算"等开源大模型,与企业的产业转化合作持续深化。
第五圈层(国际学术网络):通过ACL、EMNLP、NAACL等国际会议的领域主席工作和论文发表,在国际NLP学术界保持活跃。学生冯夏冲在香港大学的博士后经历,进一步拓展了其国际学术连接。
总体而言,冯骁骋的学术关系网络呈现出"以HIT-SCIR为根基、以文本生成为核心方向、产学研深度融合"的鲜明特征。作为1988年出生的青年学者,他已从刘挺教授的学生成长为SCIR文本生成方向的学术带头人,并在大模型时代通过开源模型研发和产业合作,将学术影响力延伸至产业界,形成了较为完整的学术-产业生态闭环。