NJU-MCG 王利民 教授
报告生成时间:2026年8月20日
个人主页:王利民
所属团队:南京大学计算机学院媒体计算组(MCG)/ 计算机软件新技术全国重点实验室
一、学者基本信息
| 项目 | 信息 |
|---|---|
| 姓名 | 王利民(Limin Wang) |
| 现职 | 南京大学计算机学院教授、博士生导师;MCG 成员,研究方向为视频理解和动作识别^[1] |
| 研究阵地 | 南京大学计算机软件新技术全国重点实验室;与上海人工智能实验室、深圳先进技术研究院等开展联合视频大模型研发 |
| 研究方向 | 计算机视觉、多模态大模型,重点为视频理解、动作识别、视频基础表征、长视频多模态推理 |
| 学术产出与影响 | 南京大学主页载明:在 IJCV、TPAMI、CVPR、ICCV、NeurIPS 等发表论文 100 余篇,引用 3.4 万余次;两篇第一作者论文单篇引用超过 4000 次^[2]。该数值为主页发布时的口径,不将其等同于实时 Google Scholar 数值。 |
| 代表成果 | TDD、TSN、VideoMAE、InternVideo 系列;近期项目包括面向长视频多跳推理的 Video-o3(2026 年开源)^[3] |
| 人才项目 | 2018 年入选国家级青年人才项目;多个独立公开来源(南大计算机学科介绍、南大CV师资盘点)将其归为“国家优青”,与其 2015 年 CUHK 博士、2015–2018 ETH Zurich 博后、2018 年回国的时间线吻合;具体类别(优青/海外优青)以基金委官方名单为准 |
| 学术服务 | CVPR、ICCV、NeurIPS 领域主席;IJCV 编委;2025 年受邀担任 TPAMI 副编辑^[2]^[3]。 |
二、教育背景与职业履历
王利民的学术轨迹连接了南京大学、香港中文大学多媒体实验室(MMLab)与苏黎世联邦理工学院(ETH Zurich)计算机视觉实验室三个节点。可公开交叉确认的信息显示,他于 2007 年进入南京大学计算机科学与技术系,2011 年赴香港中文大学攻读博士学位,毕业后在 ETH Zurich 的计算机视觉实验室从事博士后研究,2018 年回到南京大学任教^[4]。其个人主页亦明确记录了 2018 年 4 月加入南京大学计算机科学与技术系的时间点^[3]。
博士导师方面,据王利民个人主页(明确记载其于香港中文大学师从汤晓鸥教授获博士学位)及公开访谈(本人回忆联系汤晓鸥教授后进入 CUHK MMLab,并称自己为汤晓鸥招收的首位南大本科生),可将汤晓鸥教授视作其博士阶段的学术导师与关键师承节点。该脉络也解释了其后来与中国计算机视觉开源、产业化生态之间的持续连接;但本报告不据此推断其与所有 MMLab 校友存在直接项目合作。
时间线可概括如下:
- 2007—2011 年:南京大学计算机科学与技术系本科阶段。其后期开始接触计算机视觉,建立视频理解研究兴趣。
- 2011 年起:香港中文大学博士阶段,进入汤晓鸥教授领导的 MMLab。早期视频动作识别研究由此进入国际主流问题域。
- 博士后阶段:赴 ETH Zurich 计算机视觉实验室从事博士后研究。该阶段补强了国际计算机视觉训练与合作网络。
- 2015 年前后:TDD 以深度特征轨迹推进视频动作识别;公开访谈称其在 UCF101 上首次突破 90% 精度。随后,TSN 成为以稀疏时间片段建模长视频的代表性架构,并获得首届 ActivityNet 挑战赛冠军这一公开记录^[5]。
- 2018 年:回归南京大学任教授、博士生导师,并在 MCG 内建设以视频理解为核心的研究与培养方向。
- 2022—2026 年:研究主线从专用视频表征推进至通用视频基础模型与视频多模态大模型:2022 年 VideoMAE 与 InternVideo 1.0,2024 年 InternVideo2,2025 年 InternVideo2.5 与 VideoChat-Flash,2026 年开源 Video-o3。值得注意的是,VideoMAE 论文展示了 90%—95% 高掩码率的视频自监督预训练范式,并报告了 UCF101 91.3% 等结果^[6]。
这一履历的核心特征是:在学术上由“动作识别模型设计”连续演化至“视频基础模型—多模态理解—长视频推理”,在组织上则由 MMLab/ETH Zurich 所形成的国际训练背景,落到南京大学 MCG 的稳定人才培养平台,再通过上海人工智能实验室获得大规模模型协同研发能力。
三、学生培养情况
MCG 官网当前列有涂浚、支原、高若朋、毛溢凡、张佳明、刘春旭、潘天蕊、王帅、张国珍、陈阳、许一凡、黄子政、贾梓瀚、曾祥宇、李志梁、梁锦文、罗星宇、朱宇涵等博士研究生^[1]。官网按研究组而非按单一导师展示成员,因此下列“关系”均严格表述为公开论文合作或 MCG 培养关系;除有独立公开资料者外,不擅自标注为王利民唯一指导的博士生,亦不虚构博士毕业去向。
1. 童湛(腾讯 AI Lab 研究员,MCG 校友与 VideoMAE 核心论文作者)
童湛(Zhan Tong)是可追溯去向最清晰的代表性校友之一。公开活动信息将其标注为腾讯 AI Lab 研究员,并与南京大学计算机科学与技术系硕士研究生谈婧共同介绍 VideoMAE;MCG 新闻同时记录其与高子腾获得南京大学优秀硕士论文奖^[7]^[8]。作为 VideoMAE 第一作者,他将视频管道掩码与高掩码率预训练落入可复现模型,论文作者还包括王利民。这一案例显示,MCG 的培养链条不仅指向论文发表,也能将学生送入腾讯 AI Lab 等工业研究机构,并保持围绕视频自监督学习的知识延续。
2. 谈婧(南京大学硕士研究生,MCG 视频时序理解方向学生)
谈婧在公开活动时的身份为南京大学计算机科学与技术系硕士研究生;其分享主题覆盖 PointTAD 时序动作检测,并与已在腾讯 AI Lab 任研究员的童湛共同讲解视频自监督表示学习^[8]。她代表了 MCG 在硕士阶段将学生嵌入完整研究流水线的模式:一端参与具有明确任务定义的时序动作检测,另一端接入 VideoMAE 代表的视频基础表征议题。公开资料未见其毕业后的确切去向,故本报告不作推断;但其与童湛的并列公开分享,反映出校友—在读学生之间围绕同一技术路线的传帮带关系。
3. 高子腾(MCG 硕士校友,优秀硕士论文获奖者)
MCG 在 2023 年公开报道高子腾与童湛获得南京大学优秀硕士论文奖^[7]。这一记录足以确认其为 MCG 培养体系中的代表性硕士校友,而不能据此判断其唯一导师、毕业后机构或职位。与童湛被业界明确识别为腾讯 AI Lab 研究员相比,高子腾的公开去向材料较少;将其列入报告的意义在于呈现王利民所在研究组的双层人才输出:既有进入工业研究机构的校友,也有以高质量学位论文体现研究训练质量的毕业生。
4. 曾祥宇(南京大学博士研究生,InternVideo2.5 联合作者)
曾祥宇(Xiangyu Zeng)在 MCG 官网列为博士研究生,并在 InternVideo2.5 论文中以“南京大学、上海人工智能实验室”双重机构出现^[1]^[9]。这种双机构署名是观察王利民团队培养机制的重要样本:学生仍以南京大学博士生身份接受学位培养,同时进入上海 AI 实验室与高校联合的模型研发网络,参与长而富上下文、时空 token 压缩、偏好优化等大模型工作。其尚在读,因而不存在“博士毕业去向”可报告;双重机构参与本身则说明学生获得了基础研究和大规模工程研发的并行训练。
5. 马畅联(南京大学硕士研究生,InternVideo2.5 联合作者)
马畅联(Changlian Ma)在 MCG 官网列为硕士一年级学生,在 InternVideo2.5 论文中同样以“上海人工智能实验室、南京大学”双重机构署名^[1]^[9]。这一组合说明其较早进入联合大模型项目,并非仅在校内做孤立课题。对培养而言,价值在于能直接接触长视频理解、视觉任务偏好优化、层级 token 压缩等前沿问题;对关系网络而言,他是连接 MCG 学生层与 OpenGVLab/上海 AI 实验室工程研究层的青年节点。公开资料未披露其未来就业或深造选择,应保留为空白。
6. 陈廷王(上海人工智能实验室研究人员,InternVideo2.5 联合作者与跨机构青年合作者)
陈廷王(Chenting Wang)并未在 MCG 当前学生名录中,因而不应称作王利民的学生;其列入本节是为了区分“正式学位培养学生”与“联合项目青年研究者”。InternVideo2.5 将其署为上海人工智能实验室作者,而王利民、曾祥宇、马畅联等构成南京大学—上海 AI 实验室交叉作者群^[9]。该关系体现了王利民学生在联合项目中与实验室青年研究人员并肩协作的日常机制:高校提供学位培养和问题沉淀,实验室提供更大规模的模型、数据与工程协作。其职位和所属以论文署名为限,不延伸为师生关系。
7. 朱宇涵(南京大学博士研究生,MCG 长视频/世界模型方向在读成员)
朱宇涵(Yuhan Zhu)为 MCG 官网列示的博士研究生,其姓名也出现在王利民主页所列 2026 年 CVPR 论文 InternVideo-Next: Towards World-Understanding Video Models 的作者序列中^[1]^[3]。这表明其参与了从 InternVideo2.5 的长视频细粒度理解进一步走向“世界理解视频模型”的研究线。作为在读博士生,他的去向尚未形成,不能以论文题目替代职业信息;但其在团队内承担的角色可以清楚描述为:在新一代视频基础模型主题下,与王利民团队共同发表成果的博士生节点。
总体看,MCG 的学生培养呈现三类通路:其一,以童湛为例,通过视频基础研究进入腾讯 AI Lab 等产业研究岗位;其二,以谈婧、高子腾为例,通过硕士论文、任务型项目和公开学术交流形成高质量研究训练;其三,以曾祥宇、马畅联、朱宇涵为例,在读阶段即嵌入南京大学—上海 AI 实验室联合研发。由于 MCG 公示页未提供导师配属、毕业年份与全体校友去向,本报告不将研究组成员名单误写成完整的“王利民博士毕业生名录”。
四、学术合作网络
4.1 实验室内部:MCG、软件新技术全国重点实验室与校内协同
王利民的校内核心节点是 MCG。MCG 由武港山教授牵头,王利民教授、唐杰副教授、刘杰助理研究员及研究生共同构成^[10];其内部覆盖媒体内容分析、多媒体检索、对象建模、视频/图像增强与视频理解。王利民聚焦视频理解和动作识别,因而承担了 MCG 从传统媒体计算走向视频基础模型的重要方向。
与南京大学 LAMDA(周志华团队)的关系,公开材料支持的结论应保持克制:两者均是南京大学计算机学院/人工智能研究生态中的重要团队,但研究组织、直接合著或联合项目不能仅凭同校身份推定。较合理的理解是并列且互补的校内圈层:LAMDA 更代表机器学习理论、数据挖掘与学习算法传统,MCG 更聚焦视觉媒体与视频多模态;在学院大模型中心、课程、学生交流和共同学术活动等校级平台上存在生态邻近性,但本报告未发现可据以断言“王利民与周志华直接共同领导某项目”的公开证据。
4.2 跨机构:上海人工智能实验室—深圳先进技术研究院联合研发
InternVideo 系列构成其最紧密的跨机构合作主轴。南京大学官方报道明确:InternVideo2.5 由上海人工智能实验室、南京大学、深圳先进技术研究院联合发布,王利民任该大模型技术负责人;其前代分别为 2022 年的 InternVideo 1.0 与 2024 年的 InternVideo 2.0^[11]。论文作者单位则将王利民、曾祥宇、马畅联标为南京大学/上海 AI 实验室相关节点,将余巍、何一南、陈廷王、乔宇等置于上海 AI 实验室,王雅丽亦连接深圳先进技术研究院^[9]。
这不是一次性论文挂名式合作,而是“高校研究议题—实验室规模化研发—多机构数据/评测和开源发布”相耦合的持续协同。联合团队从模型表征(InternVideo1.0)、多模态对话与评测(InternVideo2.0、InternVid、MVBench),推进至长而富上下文建模(InternVideo2.5);其中 InternVid 数据集覆盖 700 多万视频、总时长近 76 万小时,MVBench 覆盖 9 个维度,这些公开指标表明合作已延伸至数据、基准与应用链路^[12]。
4.3 国际合作:师承网络、开源扩散与全球同行可见度
国际合作的历史根部来自香港中文大学 MMLab 与 ETH Zurich CVL 的训练经历;前者提供汤晓鸥师承节点,后者提供欧洲计算机视觉研究经历。成果传播层面,VideoMAE、InternVideo 代码均公开发布,因而其网络不局限于署名作者,而向全球研究者、下游开发者与模型社区扩展。南京大学主页称 InternVideo 已获 Google、Meta、NVIDIA 等企业关注和使用^[2],这可用于说明国际技术影响与采用关注,不能自动等同为上述企业与王利民团队已建立正式联合实验室、资助合同或共同专利关系。
五、业界合作关系深度分析
5.1 产业合作:上海 AI 实验室、央视、华为及国际企业关注
上海人工智能实验室是最深层的产业化/新型研发机构合作方。其价值不仅在于联合署名,更在于提供支撑视频大模型迭代的工程、模型、数据和开源平台;王利民作为 InternVideo2.5 技术负责人,将南京大学 MCG 的视频理解研究对接到“书生”大模型谱系。2025 年版本将视频记忆能力从约 3000 帧扩展至 10000 帧量级,官方称相对前代提升至少 6 倍,并将目标定位于长视频细节、目标跟踪与分割等任务^[13]。
中央广播电视总台(央视)是可被公开验证的应用场景。南京大学报道指出,InternVideo 已支持央视巴黎奥运会直播,能够定位运动员得分瞬间及相关慢动作,生成赛事回放视频集锦,从而提升节目编创效率^[11]。这类合作的重要性在于其把“长视频检索—事件定位—节目编辑”闭环置于高时效媒体生产环境,而非仅做离线基准测试;但公开材料未披露部署规模、商业合同、系统所有权与效果的第三方审计数据,故不作进一步量化。
华为方面,南京大学官方称 InternVideo 系列已与华为技术公司在终端视频内容分析、自动驾驶、AIGC 内容生成等场景开展合作^[11]。这显示其技术路线具备从通用视频表征向端侧内容理解、车载时空感知和生成内容生产延伸的潜力。Google、Meta、NVIDIA方面,官方表述为“关注和使用”,可确认技术外溢与国际影响;由于未公开具体产品集成、合作条款或共同研发项目,应将其定位为“使用/关注关系”,而非正式商业合作伙伴。
5.2 产学研:从论文、数据和开源到场景验证的转化机制
王利民团队的产学研路径具有四层结构。第一层是方法论文:TDD、TSN、VideoMAE 逐步解决视频表征、长时序采样和自监督预训练问题。第二层是可复用资产:以开源代码、预训练权重、InternVid 数据集及 MVBench 基准降低社区进入门槛。第三层是联合研发平台:南京大学学生与上海 AI 实验室研究人员的双机构协作,形成模型持续迭代。第四层是行业验证:央视体育直播、华为终端/自动驾驶/AIGC 场景将模型能力置于真实业务链条。
这一机制的优势是避免“论文—产品”之间完全断裂:学术端以公开评测保证可比较性,实验室端完成大规模训练与系统工程,媒体与企业端提出长视频、时延、稳定性和内容生产等约束,反向推动长上下文、细粒度定位与高效压缩研究。其边界也应明确:公开报道能够确认技术合作与应用展示,但不足以判断营收、采购金额、模型在各企业的生产覆盖率或实际业务收益。因此,本报告将其界定为以公开模型、联合研发和场景验证为核心的深度产学研网络,而不对商业化规模作未经披露的推算。
六、重要奖项与学术兼职
| 类别 | 项目 | 公开信息与时间 |
|---|---|---|
| 科研奖励 | 广东省技术发明一等奖 | 南京大学教师主页列示^[2] |
| 论文荣誉 | ACM MM 2023 最佳论文提名/荣誉 | 主页称“唯一最佳论文提名奖”;个人主页记录 RefineTAD 获 ACM MM 2023 Best Paper Honorable Mention,应以具体英文奖项为准^[2]^[3]。 |
| 科研奖励 | 世界人工智能大会青年优秀论文奖 | 教师主页列示^[2] |
| 学术影响 | AI 2000 人工智能全球最具影响力学者榜单 | 入选 2022 年度,教师主页列示^[2] |
| 学术影响 | 全球华人 AI 青年学者榜单 | 入选 2022 年度,教师主页列示 |
| 学术影响 | 爱思唯尔中国高被引学者 | 教师主页列示 2021—2023 年度入选 |
| 期刊服务 | IJCV 编委 | 个人主页记录 2023 年受邀加入^[3] |
| 期刊服务 | TPAMI 副编辑 | 个人主页记录 2025 年受邀担任^[3] |
| 会议服务 | CVPR、ICCV、NeurIPS 领域主席 | 南京大学教师主页列示^[2] |
七、Connection圈层总结
第一圈层:师承与核心研究共同体。 汤晓鸥—香港中文大学 MMLab 是王利民学术谱系的关键源头;ETH Zurich 博士后经历补充了国际计算机视觉训练。回到南京大学后,MCG 与软件新技术全国重点实验室成为其稳定的组织基地,武港山、唐杰、刘杰及研究生群体构成近距离协同环境。
第二圈层:学生、校友与青年研究者。 童湛进入腾讯 AI Lab,是“学术训练—工业研究”的明确校友节点;谈婧、高子腾呈现硕士研究训练;曾祥宇、马畅联、朱宇涵则代表以在读学生身份参与视频大模型前沿项目的梯队。该层的突出特点是以论文、开源、基准和联合项目把人才培养嵌入持续研究循环,而非只在毕业时发生一次连接。
第三圈层:跨机构联合研发。 上海人工智能实验室、南京大学、深圳先进技术研究院围绕 InternVideo 构成最强合作三角,乔宇、王雅丽以及上海 AI 实验室研究团队是重要合作节点。其关系已经跨越单篇论文,覆盖模型版本迭代、数据集、评测基准、开源发布与应用验证。
第四圈层:产业与国际技术扩散。 央视巴黎奥运直播场景验证了视频理解模型在媒体生产链中的价值;华为合作拓展至终端、自动驾驶和 AIGC;Google、Meta、NVIDIA 对 InternVideo 的关注和使用体现全球技术扩散。需要严格区分:央视与华为有公开场景合作表述,Google、Meta、NVIDIA 是公开的关注/使用影响关系,尚无材料支持把后者写成合同型联合研发。
总体判断。 王利民的关系网络呈现“师承型计算机视觉共同体—南京大学 MCG 人才基地—上海 AI 实验室规模化研发—媒体与企业场景验证—国际开源扩散”的链式结构。其最显著的网络能力不只是维持高频论文合作,而是将视频理解的基础研究、人才培养、开源基准和真实长视频应用连接为可持续迭代的闭环。