中山大学 杨思蓓 教授
报告生成时间:2026年8月20日
个人主页:杨思蓓
所属团队:中山大学人机物智能融合实验室(HCP-Lab,Human Cyber Physical Intelligence Integration Lab)
一、学者基本信息
| 项目 | 信息 |
|---|---|
| 姓名 | 杨思蓓(Sibei Yang) |
| 现职 | 中山大学计算机学院副教授(引进人才系列)、博士生导师、逸仙学者 |
| 人才称号 | 国家级青年人才;上海领军人才(海外)计划;浦江人才计划 |
| 公开联系邮箱 | sibeiyang9@gmail.com |
| 个人主页 | https://sibeiyang.github.io/ |
| Google Scholar | 链接 |
| GitHub | https://github.com/sibeiyang |
| 课题组 | SooLab(GitHub 组织) |
| 研究领域 | 跨模态视觉感知、理解、生成与交互;核心方向包括:1)多模态大模型(LLM/MLLM);2)视觉-语言统一理解与生成;3)具身智能;4)开放世界视觉感知与理解 |
| 论文与影响力 | 累计发表 CCF-A 类/中科院一区论文近 60 篇,其中第一作者/通讯作者 CCF-A 类论文 40 余篇;Google Scholar 引用 3,600 余次 |
| 学术榜单 | 入选斯坦福大学/Elsevier"全球前 2% 顶尖科学家"榜单(2025 年连续入选) |
| 院系页面 | 中山大学计算机学院 / 英文页面 |
资料主要来自中山大学计算机学院主页、个人主页 sibeiyang.github.io 以及 HCP-Lab 官网 sysu-hcp.net。学院主页当前标注职称为副教授(引进人才系列),系 2025 年 6 月由上海科技大学加盟中山大学。
二、教育背景与职业履历
杨思蓓的学术路径横跨浙江大学、香港大学、香港理工大学、上海科技大学与中山大学五所机构,形成了一条从竺可桢学院本科到香港博士、再到独立建组的完整青年学者发展线。
本科阶段(2012—2016)。 杨思蓓于 2012 年进入浙江大学竺可桢学院,攻读计算机科学与技术专业,2016 年获学士学位。竺可桢学院作为浙江大学拔尖创新人才培养特区,她于 2012 年入选教育部"珠峰计划",该计划面向基础学科和交叉学科选拔顶尖本科生。这一阶段的训练奠定了其在计算机视觉与机器学习方向的学术根基。
博士阶段(2016—2020)。 2016 年 9 月,杨思蓓赴香港大学计算机科学系攻读博士学位,获香港政府奖学金(Hong Kong PhD Fellowship)资助。博士导师为俞益洲(Yizhou Yu)教授——香港大学计算机科学系教授兼人工智能实验室主任、ACM 与 IEEE Fellow、美国 NSF CAREER Award 获得者,在计算机图形学、计算机视觉和深度学习领域卓有建树。杨思蓓在博士期间聚焦于跨模态视觉-语言理解,代表性工作包括指称表达分割(referring expression segmentation)和视觉定位(visual grounding),已在 CVPR、ICCV、ECCV、TPAMI 等顶级会议与期刊上发表多篇第一作者论文。2020 年 9 月获博士学位。
香港理工大学阶段(2020—2021)。 博士毕业后,杨思蓓即获聘香港理工大学计算机系研究助理教授(Research Assistant Professor)兼博导,完成了从博士到独立 PI 的快速转换。在港理工期间,她继续推进视觉-语言多模态研究,并开始向开放世界视觉理解方向拓展。
上海科技大学阶段(2021—2025)。 2021 年 6 月,杨思蓓加入上海科技大学信息科学与技术学院(SIST)任助理教授、研究员、博导,属视觉与数据智能中心(VDI Center)成员。在上科大四年期间,她建立了独立的 SooLab 课题组,研究方向从早期的视觉-语言理解逐步扩展到多模态大模型、视频理解、幻觉缓解(hallucination mitigation)和具身智能。这一时期是其学术产出最密集的阶段:2023 年 7 篇 ICCV 论文、2023 年 2 篇 NeurIPS 论文(含 Free-Bloom 零样本文生视频、DDCoT 多模态推理链)、2024 年 ECCV/ICLR/CVPR 论文、2025 年 5 篇 NeurIPS + 7 篇 ICCV + 6 篇 CVPR + 3 篇 ICLR + 2 篇 ACL 论文、2026 年 3 篇 CVPR + 2 篇 ICLR + ICML 论文。她还在上科大承担本科生教学,开设"人工智能 I"课程。
中山大学阶段(2025 至今)。 2025 年 6 月,杨思蓓以引进人才系列副教授身份加盟中山大学数据科学与计算机学院,同时加入林倞教授创立的 HCP-Lab,成为该实验室核心成员之一。HCP-Lab 目前包含李冠彬、梁小丹、王可泽、王广润、王州霞、魏朋旭、刘阳、杨思蓓、董浩业、李继昌等青年科学家,其中 7 人为国家级青年人才。杨思蓓的加盟进一步增强了实验室在多模态大模型和 LVLM 幻觉研究方向的实力。课题组首届博士毕业生(2026 届)已获多家头部科技企业人才计划录取。
三、学生培养情况
杨思蓓累计指导超过 25 名学生在 CCF-A 类会议上以第一作者或共同一作身份发表论文,其中包括 8 名本科生。其课题组 SooLab 的学生培养呈现"高产出、多方向、跨层次"的鲜明特征:博士生在 NeurIPS、CVPR、ICCV、ICLR 等顶会连续发表多篇第一作者论文,本科生亦有 ICML 级别的突破。以下列出代表性学生及其培养线索。
1. 施诚(Cheng Shi,博士研究生,核心学生)
施诚是 SooLab 产出最为密集的博士生,个人主页为 chengshiest.github.io。他在 2024—2026 年间以第一作者身份发表了包括 Vision Function Layer in Multimodal LLMs(NeurIPS 2025)、Vision Transformer Needs More Than Register(CVPR 2026)、WeaveTime(CVPR 2026,与张宇琳合著)、Free on the Fly(CVPR 2025,与戴启源合著)及 Rethinking Query-based Transformer for Continual Image Segmentation(CVPR 2025,SimCIS)等多篇顶会论文。施诚曾两次获得国家奖学金(2023、2024 年),在课题组内承担视觉 Transformer 架构、多模态大模型功能层以及持续学习分割等核心方向。其与俞益洲教授在多篇论文中共同署名,体现了博士导师—学生—导师导师之间的学术传承链。施诚的 GitHub 组织 SooLab 维护了课题组的开源代码,包括 SimCIS、AllPath、LAST-ViT 等项目。
2. 唐家锦(Jiajin Tang,博士研究生,核心学生)
唐家锦是 SooLab 另一位高频产出博士生,个人主页为 toneyaya.github.io。他在 2025—2026 年以第一作者或共同一作身份发表了 Sim-DETR: Unlock DETR for Temporal Sentence Grounding(ICCV 2025)、Closed-Loop Transfer for Weakly-supervised Affordance Grounding(ICCV 2025)、Augmenting Moment Retrieval(ICCV 2025,与魏正轩合著)、Chart Deep Research in LVLMs(ICLR 2026)以及多篇 NeurIPS 论文(含 Discovering Compositional Hallucination in LVLMs 和 Intervene-All-Paths)。唐家锦曾获国家奖学金(2025 年)和优秀学生奖(2023 年),研究方向横跨时序定位、可供性推理(affordance grounding)和多模态大模型幻觉分析,体现了课题组"理解—推理—生成"全链路培养思路。
3. 张宇琳(Yulin Zhang,博士研究生,核心学生)
张宇琳是 SooLab 视频理解方向的主力博士生,个人主页为 zhangyl4.github.io。她以第一作者发表了 Eyes Wide Open: Ego Proactive Video-LLM for Streaming Video(NeurIPS 2025)和 WeaveTime: Streaming from Earlier Frames into Emergent Memory in VideoLLMs(CVPR 2026),并在 No More Sibling Rivalry: Debiasing Human-Object Interaction Detection(ICCV 2025)中担任共同第一作者。张宇琳曾获国家奖学金(2025 年),其工作专注于流式视频大模型的长程记忆与主动感知,是课题组在 Video-LLM 方向的核心培养成果。
4. 郑戈(Ge Zheng,博士研究生/研究实习生)
郑戈在 2025 年密集参与了 SooLab 的多模态幻觉研究线,以共同第一作者发表了 Why LVLMs Are More Prone to Hallucinations in Longer Responses(ICCV 2025,与钱嘉烨合著)和 Intervene-All-Paths(NeurIPS 2025),并作为共同作者参与了 Discovering Compositional Hallucination in LVLMs(NeurIPS 2025)。其研究方向聚焦于大视觉语言模型(LVLM)的幻觉机理分析与缓解策略,是课题组在该前沿方向的骨干力量。
5. 钱嘉烨(Jiaye Qian,博士研究生/研究实习生)
钱嘉烨与郑戈共同构成 SooLab 幻觉研究线的双子核心。他以共同第一作者发表了 Intervene-All-Paths: Unified Mitigation of LVLM Hallucinations across Alignment Formats(NeurIPS 2025)和 Why LVLMs Are More Prone to Hallucinations in Longer Responses(ICCV 2025,与郑戈合著)。其工作揭示了 LVLM 在不同对齐格式下幻觉的统一成因,并提出了跨格式的缓解框架,开源代码见 github.com/SooLab/AllPath。
6. 戴启源(Qiyuan Dai,博士研究生)
戴启源是 SooLab 开放世界视觉理解方向的核心学生。他以第一作者发表了 Free on the Fly: Enhancing Flexibility in Test-Time Adaptation with Online EM(CVPR 2025)和 Adaptive Part Learning for Fine-Grained Generalized Category Discovery(CVPR 2025,与黄涵卓合著),聚焦于测试时自适应(test-time adaptation)与细粒度广义类别发现,体现了课题组在开放世界感知方向的培养布局。
7. 黄涵卓(Hanzhuo Huang,博士研究生)
黄涵卓在生成式 AI 和细粒度理解两条线上均有贡献。他以第一作者发表了 RefAny3D: 3D Asset-Referenced Diffusion Models for Image Generation(ICLR 2026),并作为共同作者参与了 Adaptive Part Learning for Fine-Grained Generalized Category Discovery(CVPR 2025)。其工作将 3D 资产引导的扩散模型与细粒度类别发现相结合,展示了课题组在"理解—生成"统一框架下的培养路径。
8. Zhendong(本科生,ICML 2026 第一作者)
Zhendong 是 SooLab 培养的本科生代表。根据中山大学主页 2026 年 5 月的 News 记录,他以本科生身份发表了 ICML 2026 第一作者论文,并已选择留在课题组继续研究生学习。这一案例充分体现了杨思蓓在本科生科研培养方面的突出成效——累计 8 名本科生在 CCF-A 类会议上以第一作者或共同一作身份发表论文。
四、学术合作网络
4.1 导师谱系与实验室内部合作网络
俞益洲(Yizhou Yu)教授是最核心的学术谱系节点。 杨思蓓于 2016—2020 年在香港大学攻读博士,导师为俞益洲教授。俞教授 2000 年获加州大学伯克利分校博士学位,曾任伊利诺伊大学厄巴纳-香槟分校(UIUC)教职十二年,后任香港大学计算机科学系教授兼人工智能实验室主任,是 ACM Fellow 和 IEEE Fellow,曾担任 IEEE TPAMI、IEEE TIP 和 IEEE TVCG 编委。俞益洲的研究涵盖计算机图形学、计算机视觉、深度学习与医学 AI,在 SIGGRAPH、CVPR、ICCV、NeurIPS 等顶级会议均有深度参与。杨思蓓与俞益洲在博士期间及毕业后持续合作,后者在多篇 SooLab 论文中担任共同作者(如 Vision Function Layer in MLLMs NeurIPS 2025、Vision Transformer Needs More Than Register CVPR 2026),形成了"博士导师—独立 PI—共同指导学生"的跨代际学术传承链。
李冠彬教授是 HCP-Lab 内部最紧密的同辈合作者。 李冠彬现任中山大学计算机学院副院长、教授、国家优秀青年基金获得者,亦毕业于香港大学计算机科学系(2012—2016 年博士),与杨思蓓具有共同的学术谱系背景。两人在多篇论文中合作,包括 Sim-DETR: Unlock DETR for Temporal Sentence Grounding(ICCV 2025,李冠彬为共同作者、杨思蓓为通讯作者)、VLDrive: Vision-Augmented Lightweight MLLMs for Efficient Language-grounded Autonomous Driving(ICCV 2025)、以及 Direct Language Embedding Enables Gaussian Splatting for Large Scenes(CVPR 2026 Finding)。李冠彬亦主持 CCF-腾讯犀牛鸟科研基金和美团北斗科研合作基金,与杨思蓓的产业合作网络形成互补。在 HCP-Lab 内部,李冠彬—杨思蓓构成了"视觉-语言理解"方向的核心合作对。
林倞教授是 HCP-Lab 的顶层学术节点。 林倞为国家杰青获得者、IEEE/IAPR Fellow、CCF-ACM Award for AI 获得者,于 2010 年创立 HCP-Lab。杨思蓓在 Sim-DETR(ICCV 2025)论文中与林倞共同署名,林倞作为实验室创始人提供了顶层学术平台。HCP-Lab 累计发表论文 1,000 余篇,获得 ACL 2025 Outstanding Paper Award、CVPR 2024 Best Paper Candidate(两篇)、ICCV 2019 Best Paper Nomination 等一系列顶级论文奖,承担国家 2030 重大项目、国家重点研发计划项目等,共获科研经费超 1 亿元。
上海科技大学视觉与数据智能中心(VDI)网络。 杨思蓓在上科大期间(2021—2025)是 VDI 中心成员,与汪婧雅(Jingya Wang,现上科大助理教授)、马月昕(Yuexin Ma)等形成密切的跨方向合作关系。杨思蓓与汪婧雅在 SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model(CVPR 2025)中合作,该论文还联合培养了余春霖(Chunlin Yu)和王涵情(Hanqing Wang)等上科大研究生。VDI 中心的跨方向协作将视觉-语言理解(杨思蓓)、具身 AI 与三维视觉(汪婧雅)和三维场景感知(马月昕)有机结合,其合作产出在 ECCV 2024 的 Part2Object 论文中亦有体现(施诚、张宇琳、杨斌、唐家锦、马月昕、杨思蓓共同署名)。
4.2 跨机构与主题型合作网络
-
多模态大模型幻觉研究网络。 这是杨思蓓近两年最为密集的合作主题。2025 年 NeurIPS 和 ICCV 共录用 5 篇论文聚焦 LVLM 幻觉分析与缓解,核心团队包括郑戈、钱嘉烨、唐家锦和施诚,产出包括 Discovering Compositional Hallucination(NeurIPS 2025,杨思蓓为第一作者兼通讯作者)、Intervene-All-Paths(NeurIPS 2025)、Why LVLMs Are More Prone to Hallucinations in Longer Responses(ICCV 2025)等。该方向还与外部研究者 Wenjie Wang(NeurIPS 2025 Auto-Search and Refinement 和 ICLR 2026 Chart Deep Research 的共同作者)和 Xing Chen(ICLR 2026 Chart Deep Research 共同作者)形成跨机构合作。
-
视觉-语言理解与定位网络。 这是杨思蓓从博士阶段延续至今的核心方向。早期与俞益洲、李冠彬合作的工作包括 Cross-Modal Relationship Inference for Grounding Referring Expressions(IEEE TIP)、Propagating Over Phrase Relations for One-Stage Visual Grounding(ECCV 2020)等。在 HCP-Lab 内部,与林倞、李冠彬合作的有 Structured Attention Network for Referring Image Segmentation(IEEE TMM 2021,林倞、杨思蓓、李冠彬共同署名)。近期则延伸至时序句子定位(Sim-DETR, ICCV 2025)和时刻检索(AMR, ICCV 2025)。
-
图神经网络与视觉综述网络。 2024 年发表于 IEEE TPAMI 的综述 A Survey on Graph Neural Networks and Graph Transformers in Computer Vision: A Task-Oriented Perspective 汇集了杨思蓓与 Chaoqi Chen、Yushuang Wu、Qiyuan Dai、Hong-Yu Zhou、Mutian Xu、Xiaoguang Han(韩晓光,香港中文大学深圳)、俞益洲等人的合作。韩晓光同为港大博士(2017 年毕业),现为香港中文大学(深圳)副教授,该合作连接了港大—中大(深圳)的视觉与图形学交叉网络。
-
自动驾驶与具身智能网络。 杨思蓓在 VLDrive(ICCV 2025)中与 Ruifei Zhang、Wei Zhang、Xiao Tan、Xiang Wan、Xiaonan Luo 和李冠彬合作,将多模态大模型应用于自动驾驶场景。HCP-Lab 本身与字节跳动、华为、广州视源科技等企业开展广泛合作,在自主机器人和具身智能领域有深厚的产学研基础。
五、业界合作关系深度分析
5.1 产业合作项目与科研基金
杨思蓓主持了多项包含校企合作在内的科研项目,形成了从基础研究到产业应用的完整资助链条:
-
腾讯犀牛鸟专项(校企合作项目)。 这是杨思蓓在学院主页明确列出的校企合作项目。腾讯犀牛鸟基金是腾讯公司面向高校教师的科研资助计划,聚焦 AI、计算机视觉、自然语言处理等前沿方向。该合作将杨思蓓的多模态大模型研究直接对接腾讯的产品场景需求。值得注意的是,HCP-Lab 的李冠彬教授也主持 CCF-腾讯犀牛鸟科研基金,林倞教授与字节跳动有深度合作,形成了实验室层面的多元产业对接。
-
国家自然科学基金面上项目与青年项目。 这是杨思蓓的基础研究主力资助来源,覆盖其视觉-语言理解和开放世界视觉感知等核心方向。
-
上海领军人才(海外)计划。 该计划是上海市面向海外引进高层次人才的专项支持,杨思蓓在上科大期间获此资助,支持其在多模态大模型方向的研究。
-
浦江人才计划。 上海市浦江人才计划面向海外留学回国人员,杨思蓓获此资助,进一步强化了其在上海阶段的科研资源。
-
启动培育项目。 作为中山大学引进人才,杨思蓓获校级启动培育项目支持,用于课题组建设和设备采购。
5.2 产业人才输送与学术-产业连接
杨思蓓课题组的首届博士毕业生(2026 届)获多家头部科技企业人才计划录取,这一信息在学院主页被特别强调,体现了其培养的学生在产业界的竞争力。从课题组的研究方向来看,多模态大模型、LVLM 幻觉缓解和视频理解均为当前大厂 AI 团队最紧缺的能力方向,学生毕业后可对接的企业方向包括:
-
大模型团队(如字节跳动、腾讯、阿里、百度等)。 课题组在 NeurIPS、ICLR 连续发表的多模态大模型和幻觉缓解论文,直接对应大厂 LLM/MLLM 团队的技术需求。Vision Function Layer in MLLMs(NeurIPS 2025)和 Intervene-All-Paths(NeurIPS 2025)均提供了可直接落地的技术方案。
-
自动驾驶团队。 VLDrive(ICCV 2025)将轻量级多模态大模型应用于自动驾驶场景,与张瑞飞、张伟、谭晓等合作者的产业背景相呼应。HCP-Lab 本身与华为在自动驾驶和智能感知领域有合作基础。
-
视频 AI 与内容生成团队。 课题组在 Video-LLM 方向的产出(Eyes Wide Open NeurIPS 2025、WeaveTime CVPR 2026)对应短视频平台和内容生成企业的核心需求。
杨思蓓还积极参与产业相关学术活动。根据公开报道,她曾担任 YOCSEF 广州"工业大模型安全应用的信任构建与实施路径"论坛的引导嘉宾,与广州视源电子科技股份有限公司等企业代表同台交流,体现了其在产业大模型安全应用方向的影响力。
在 HCP-Lab 层面,实验室与知名 IT 及人工智能上市企业(如字节跳动、华为、广州视源科技等)开展广泛合作,并积极推动多家知名科创企业的孵化与发展。杨思蓓的加盟进一步增强了实验室在多模态大模型方向的产业对接能力。
六、重要奖项与学术兼职
| 年份 | 奖项/荣誉/兼职 | 说明 |
|---|---|---|
| 2025 | 斯坦福大学/Elsevier"全球前 2% 顶尖科学家"榜单 | 连续入选 |
| 2025 | ECCV 2026 Area Chair | 2025 年 12 月获任 |
| 2025 | ICLR 2026 Area Chair | 2025 年 8 月获任 |
| 2025 | ICCV 2025 Area Chair | 2024 年 12 月获任 |
| 2024 | ICLR 2025 Area Chair | — |
| 2024 | WACV 2024 Area Chair | 2023 年 5 月获任 |
| — | NeurIPS Area Chair | 多届担任 |
| — | 上海领军人才(海外)计划 | 上海市级高层次人才引进计划 |
| — | 浦江人才计划 | 上海市海外留学回国人员资助 |
| — | 香港政府奖学金(Hong Kong PhD Fellowship) | 博士期间获授,香港研究资助局最高级别奖学金 |
| 2012 | 教育部"珠峰计划" | 本科阶段入选,面向基础学科拔尖学生 |
| — | 中山大学逸仙学者 | 中山大学人才称号 |
| — | 国家级青年人才 | HCP-Lab 7 名国家级青年人才之一 |
七、Connection圈层总结
杨思蓓的学术关系网络可从三个圈层加以总结:
第一圈层:课题组内部(SooLab)。 这是最核心、最紧密的合作圈层。杨思蓓在上海科技大学和中山大学建立的 SooLab 课题组,已培养超过 25 名学生在 CCF-A 类会议上以第一作者或共同一作身份发表论文,其中 8 名为本科生。核心博士生施诚、唐家锦、张宇琳构成了三条高产出研究线(视觉 Transformer/多模态大模型功能层、时序定位/幻觉分析、视频理解/Video-LLM),郑戈和钱嘉烨组成了 LVLM 幻觉研究的双子核心,戴启源和黄涵卓覆盖了开放世界理解与生成式 AI 方向。课题组 GitHub 组织 SooLab 维护了 SimCIS、AllPath、LAST-ViT、AMR 等多个开源项目。学生中多人获国家奖学金,首届博士毕业生(2026 届)已获多家头部科技企业人才计划录取。
第二圈层:HCP-Lab 与同机构合作网络。 杨思蓓于 2025 年加盟中山大学 HCP-Lab 后,融入了一个以林倞教授为顶层节点、包含 10 余名青年科学家的体系化研究团队。其中 7 人为国家级青年人才,累计承担国家 2030 重大项目、国家重点研发计划项目等 80 余项,获科研经费超 1 亿元,发表论文 1,000 余篇。在实验室内部,李冠彬教授是与杨思蓓最紧密的同辈合作者——两人共享港大博士背景和视觉-语言理解研究方向,已在多篇论文中共同署名。梁小丹教授(阿里巴巴青橙奖得主、中山大学通用具身智能中心主任)在具身智能方向提供互补。王可泽、王广润、魏朋旭、刘阳等在不同方向形成交叉合作节点。HCP-Lab 与字节跳动、华为、广州视源科技等企业的产业合作网络为杨思蓓的业界连接提供了平台级支撑。
第三圈层:跨机构与导师谱系网络。 杨思蓓的学术谱系以香港大学俞益洲教授为根节点。俞益洲是 ACM/IEEE Fellow、港大 AI 实验室主任,曾在 UIUC 任教十二年,其学术网络连接加州大学伯克利分校(博士母校)、UIUC 和港大。同谱系的李冠彬(港大 2016 届博士)亦在中山大学 HCP-Lab,形成了"同一博士导师—同一实验室"的双重连接。在上海科技大学阶段,杨思蓓作为 VDI 中心成员与汪婧雅(三维视觉/具身 AI)、马月昕(三维场景感知)等形成跨方向合作。与韩晓光(港大 2017 届博士、香港中文大学深圳副教授)在 TPAMI 综述论文中的合作,进一步扩展了港大校友的跨校视觉网络。与 Wenjie Wang、Xing Chen 等外部研究者在 NeurIPS/ICLR 论文中的合作,则体现了其在多模态大模型幻觉研究方向的国际化协作。在产业层面,腾讯犀牛鸟专项将课题组与腾讯 AI 团队直接对接,而 HCP-Lab 整体的企业合作网络(字节跳动、华为、广州视源科技等)提供了更广泛的产业落地通道。