清华NICS-EFC 韩松 教授(MIT)
报告生成时间:2026年8月20日
个人主页:Song Han
所属团队:MIT EECS(NICS-EFC实验室核心校友,博士期间联合创立深鉴科技)
一、学者基本信息
| 项目 | 内容 |
|---|---|
| 姓名 | 韩松(Song Han) |
| 现任职务 | MIT 电气工程与计算机科学系(EECS)副教授(终身教职,2024年晋升) |
| 所在机构 | 麻省理工学院(MIT) |
| 实验室 | MIT HAN Lab(负责人) |
| 博士导师 | Bill Dally 教授(斯坦福大学,NVIDIA 首席科学家) |
| 本科母校 | 清华大学电子工程系(约2008–2012) |
| 博士母校 | 斯坦福大学电气工程系(约2012–2017) |
| 研究方向 | 高效深度学习、模型压缩与量化、稀疏神经网络推理、AI硬件加速、大语言模型(LLM)高效推理、TinyML |
| Google Scholar 引用 | 极高(Model Compression领域顶级学者,单篇Deep Compression引用逾万次) |
| 产业身份 | 深鉴科技联合创始人、OmniML联合创始人(被NVIDIA收购)、NVIDIA Research Efficient AI团队负责人 |
二、教育背景与职业履历
2.1 教育经历
韩松本科毕业于清华大学电子工程系。在清华期间,他在汪玉教授的指导下接触了高效计算与硬件加速领域的早期研究,为其后续在模型压缩方向的开创性工作奠定了根基。本科毕业后,韩松赴斯坦福大学电气工程系攻读博士学位,师从NVIDIA首席科学家Bill Dally教授。在斯坦福期间,韩松将研究视角聚焦于深度学习模型的压缩与高效推理,提出了"Deep Compression"(深度压缩)技术,通过剪枝、训练量化和霍夫曼编码将神经网络压缩数十倍而不损失精度,该论文获ICLR 2016最佳论文奖。与此同时,他还提出了EIE(Efficient Inference Engine)稀疏神经网络推理引擎,首次将权重稀疏性引入现代AI芯片设计,该论文成为ISCA 50年历史上引用量排名前5的论文之一。此外,ESE(Efficient Speech recognition Engine)稀疏LSTM推理引擎获FPGA 2017最佳论文奖。
2.2 职业履历
- 2016年:博士期间与清华大学汪玉教授、姚颂(CEO)和单羿(CTO)联合创立深鉴科技(DeePhi Tech),担任联合创始人,将深度压缩技术产业化。
- 2018年:深鉴科技被赛灵思(Xilinx,现AMD)以约3亿美元收购,成为中国首家成功退出的AI芯片创业公司;收购后,创始团队向清华大学捐赠500万美元。
- 2018年:加入MIT EECS,担任助理教授,创立MIT HAN Lab。
- 2021年:联合创立第二家创业公司OmniML,聚焦边缘AI模型协同设计与部署平台。
- 2023年:OmniML被NVIDIA悄然收购,韩松同时担任NVIDIA Research Efficient AI团队负责人。
- 2024年:晋升MIT EECS副教授(终身教职)。
从清华到斯坦福再到MIT,韩松的学术轨迹贯穿了中国顶尖高校与美国顶级研究机构的AI硬件加速研究体系,同时通过两次成功创业将学术成果深度融入产业。
三、学生培养情况
韩松自2018年在MIT建立HAN Lab以来,培养了大量优秀的博士生和研究人员,其校友去向涵盖了全球顶级AI企业与研究机构,充分体现了其在学生培养方面的卓越能力。根据MIT HAN Lab官网信息,已知的主要校友包括:
| 学生姓名 | 当前去向 | 研究方向 |
|---|---|---|
| 林吉(Ji Lin) | OpenAI 研究科学家 | LLM量化、高效推理、边缘AI |
| 韩涵(Han Cai) | NVIDIA Research | 硬件感知神经架构搜索(Once-for-All Network) |
| 刘志健(Zhijian Liu) | UCSD 助理教授 | 高效视觉模型、模型压缩 |
| 唐浩天(Haotian Tang) | Google DeepMind → Meta | 多模态模型加速、BEVFusion |
| 林宇军(Yujun Lin) | NVIDIA Research | 模型压缩、高效深度学习 |
| 王伟晨(Wei-Chen Wang) | Eigen AI 联合创始人 | 高效AI系统 |
| 王韩锐(Hanrui Wang) | Eigen AI 联合创始人 | 高效AI硬件协同设计 |
| 陈伟铭(Wei-Ming Chen) | NVIDIA | 高效推理引擎 |
其中,林吉(Ji Lin)本科同样毕业于清华大学电子工程系,是韩松与NICS-EFC体系之间人才流通的又一典型案例。林吉在MIT期间参与了AWQ、StreamingLLM等多项重要研究,毕业后加入OpenAI。韩涵开发的Once-for-All Network在多项低功耗计算机视觉竞赛中获得第一名。此外,韩松还与两位博士生林吉和蔡涵共同开设了MIT公开课程"EfficientML.ai",系统讲授生成式AI时代的模型压缩与加速技术,该课程资料全部公开,在全球AI社区产生了广泛影响。
四、学术合作网络
4.1 与NICS-EFC的渊源
韩松与清华大学NICS-EFC实验室的渊源深厚,是连接该实验室与国际AI硬件加速社区的关键桥梁人物,具体体现在以下几个层面:
(1)本科阶段的学术启蒙
韩松本科就读于清华大学电子工程系期间,在汪玉教授指导下开展了早期研究工作。汪玉长期从事智能芯片与高能效电路系统研究,是NICS-EFC实验室的创始人。韩松在清华接受的研究训练为其在斯坦福攻读博士期间提出Deep Compression技术奠定了方法论基础——即算法与硬件协同优化的核心理念。
(2)深鉴科技的联合创立
2016年,韩松在斯坦福攻读博士期间,与汪玉教授、姚颂(汪玉课题组本科生、时任深鉴科技CEO)和单羿(汪玉博士生、CTO)联合创立了深鉴科技。创始团队中,汪玉以知识产权转化入股,韩松提供核心的深度压缩算法技术,姚颂负责商业化运营,单羿负责技术研发。深鉴科技的核心技术正是基于韩松在ICLR 2016发表的Deep Compression和FPGA 2017发表的ESE等研究成果,将神经网络剪枝、深度压缩技术及系统级优化应用于FPGA芯片,推出了深度学习处理器(DPU)等产品。2018年深鉴科技被赛灵思以约3亿美元收购后,创始团队向清华大学捐赠500万美元,设立"孟昭英讲席教授基金"和"刘润生励教励学基金",回馈母校。
(3)持续的人才输送与学术联动
韩松在MIT HAN Lab培养的多名学生具有清华大学背景(如林吉),形成了NICS-EFC → MIT HAN Lab的人才输送通道。汪玉教授亦于2019年8月至2020年1月赴斯坦福大学担任访问学者,持续保持与国际AI硬件加速学术圈的紧密联系,并在此后创立了"无问芯穹"等大模型硬件优化公司。韩松与NICS-EFC体系之间的学术合作和人才交流构成了一个持续运转的学术生态闭环。
4.2 跨机构合作
韩松的跨机构合作网络极为广泛,涵盖学术界和产业界的多个顶级机构:
- 斯坦福大学/Bill Dally团队:韩松的博士导师Bill Dally教授是NVIDIA首席科学家,斯坦福大学计算机体系结构领域的领军人物。韩松在斯坦福期间的研究直接得到了NVIDIA的产业资源支持,EIE论文中提出的稀疏矩阵推理架构后来影响了NVIDIA安培(Ampere)GPU架构中的稀疏张量核心(Sparse Tensor Core)设计。
- NVIDIA Research:韩松目前同时担任NVIDIA Research Efficient AI团队负责人,其团队的SmoothQuant、AWQ等LLM量化技术已被NVIDIA TensorRT-LLM正式集成,成为INT4 AWQ和INT8 SmoothQuant量化方案的核心技术来源。
- 清华大学/NICS-EFC:通过与汪玉教授的长期合作,韩松的研究成果在Xilinx FPGA平台上得到了深度验证和产业化应用。
- Google/Meta/Samsung:韩松的研究成果在Facebook(现Meta)、Samsung等多家科技巨头得到广泛应用。
- OmniML/Qualcomm:韩松联合创立的OmniML获得了高通风投(Qualcomm Ventures)的投资,聚焦边缘AI模型部署。
4.3 国际学术影响
韩松在国际AI社区的影响力体现在多个维度:
- 顶会最佳论文三连:ICLR 2016最佳论文(Deep Compression)、FPGA 2017最佳论文(ESE)、MLSys 2024最佳论文(AWQ),跨越模型压缩、FPGA加速和LLM量化三个子领域,极为罕见。
- ISCA历史高引:EIE论文成为ISCA 50年历史(1953–2023)中引用量排名前5的论文之一。
- 开源生态影响:MIT HAN Lab的GitHub仓库拥有超过4.2万关注者,AWQ项目在HuggingFace上获得超过1900万次下载,StreamingLLM项目在GitHub上获得7.2万星标。
- EfficientML.ai公开课程:韩松开发的开放讲座系列在全球AI社区广泛传播,系统讲授从模型压缩到LLM量化的前沿技术。
- TED演讲与MIT校长播客:韩松受邀进行TED演讲"Efficient AI Computing",并接受MIT校长Sally Kornbluth的播客采访"Inside Efficient AI: From GPUs to GPTs"。
五、业界合作关系深度分析
5.1 深鉴科技(DeePhi Tech)
深鉴科技是韩松产业化的第一座里程碑,也是NICS-EFC学术成果走向产业的最典型案例。
- 创立时间:2016年
- 创始团队:汪玉(清华大学教授,以知识产权入股)、韩松(斯坦福博士生,核心技术提供者)、姚颂(清华本科生,CEO)、单羿(汪玉博士生)
- 核心技术:深度压缩(Deep Compression)、神经网络剪枝、深度学习处理器(DPU)、FPGA上的稀疏LSTM推理引擎(ESE)
- 融资历程:获得高榕资本、金沙江创投、赛灵思、三星风投等知名机构投资
- 收购退出:2018年被赛灵思(Xilinx)以约3亿美元收购,成为国内首家成功退出的AI芯片创业公司
- 历史意义:深鉴科技的成功证明了清华大学NICS-EFC实验室"算法-硬件协同优化"研究范式的产业价值,也开创了中国AI芯片创业的先河。收购后,创始团队向清华大学捐赠500万美元,用于支持电子工程系的人才培养和高端人才引进。
5.2 OmniML与NVIDIA的深度绑定
- OmniML创立:2021年,韩松联合创立OmniML,总部位于加利福尼亚州,聚焦边缘设备AI模型协同设计、训练和部署平台。
- 融资:2022年3月获得1000万美元种子轮融资,由GGV Capital领投,Qualcomm Ventures、Foothill Ventures等跟投。
- 被NVIDIA收购:2023年7月,NVIDIA悄然收购OmniML(金额未公开),利用其AI压缩软件技术将大语言模型部署到边缘设备,增强自动驾驶汽车、无人机和工业机器人的AI芯片能力。
- NVIDIA Research角色:收购后,韩松同时担任NVIDIA Research Efficient AI团队负责人,其团队的AWQ和SmoothQuant技术被直接集成至NVIDIA TensorRT-LLM推理引擎中,成为INT4 AWQ和INT8 SmoothQuant量化方案的标准实现。
5.3 Deep Compression的产业化影响
Deep Compression技术的影响远超深鉴科技单一公司的范畴,已成为全球AI模型压缩领域的标准技术范式:
- NVIDIA:EIE中提出的权重稀疏性概念直接影响了NVIDIA安培GPU架构的稀疏张量核心设计;AWQ和SmoothQuant被集成至TensorRT-LLM。
- Xilinx(现AMD):深鉴科技的深度压缩技术在FPGA平台上得到产业化验证和部署。
- Facebook(现Meta):模型压缩技术被应用于大规模推理服务优化。
- Samsung:在移动端AI部署中采用了相关压缩技术。
- Google:研究成果在Google的AI基础设施中得到应用。
- HuggingFace生态:AWQ量化模型在HuggingFace上获得超过1900万次下载,成为开源社区最主流的LLM量化方案之一。
5.4 产业影响总结
韩松的两次创业经历——深鉴科技(被赛灵思3亿美元收购)和OmniML(被NVIDIA收购)——均实现了从学术研究到产业落地的完整闭环。其研究成果不仅在学术界产生了深远影响(三篇顶会最佳论文、ISCA历史前5高引),更通过NVIDIA TensorRT-LLM、Xilinx FPGA、HuggingFace等平台在全球AI产业中得到了大规模应用。韩松是目前少数同时具备顶级学术声誉、成功创业经验和深度产业整合能力的AI学者之一。
六、重要奖项与学术兼职
6.1 重要奖项
| 年份 | 奖项 | 说明 |
|---|---|---|
| 2016 | ICLR 最佳论文奖 | Deep Compression: Compressing Deep Neural Networks with Pruning, Trained Quantization and Huffman Coding |
| 2017 | FPGA 最佳论文奖 | ESE: Efficient Speech Recognition Engine with Sparse LSTM on FPGA |
| 2019 | MIT Technology Review "35 Innovators Under 35" | 因Deep Compression技术让AI程序在低功耗移动设备上高效运行 |
| 2020 | NSF CAREER Award | 因加速机器学习的高效算法和硬件 |
| 2020 | IEEE "AI's 10 to Watch" | 人工智能未来十大新星 |
| 2023 | Sloan Research Fellowship | 斯隆研究奖(计算机科学方向),"诺奖风向标" |
| 2024 | MLSys 最佳论文奖 | AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration |
6.2 学术兼职
- MIT HAN Lab 负责人
- NVIDIA Research Efficient AI 团队负责人
- EfficientML.ai 开放讲座系列主讲人
- 多个顶级AI会议(ICLR、NeurIPS、ICML、MLSys、ISCA等)程序委员/领域主席
- MIT EECS 课程"6.5940: Efficient Deep Learning Computing"主讲教授
七、Connection圈层总结
韩松在学术关系网络中占据了一个极为独特的枢纽位置,其圈层可从以下四个维度进行总结:
第一圈层:NICS-EFC核心圈
韩松是清华大学NICS-EFC实验室走出的最具国际影响力的校友之一。他与NICS-EFC创始人汪玉教授之间既是师生关系(本科阶段指导),又是创业合伙人关系(深鉴科技联合创始人),构成了NICS-EFC学术体系中"产学研"融合的经典案例。姚颂作为深鉴科技CEO,后来转型商业航天(东方空间)和物理智能机器人,进一步扩展了该圈层的产业影响力。单羿作为汪玉的博士生和深鉴创始团队成员,也是该核心圈的重要节点。
第二圈层:斯坦福-Bill Dally学术圈
韩松的博士导师Bill Dally教授是计算机体系结构领域的泰斗级人物,同时担任NVIDIA首席科学家。这一学术传承使韩松天然连接了学术前沿与产业最前沿——斯坦福的体系结构研究传统与NVIDIA的GPU硬件生态。EIE论文对NVIDIA安培架构稀疏张量核心的影响,是这一圈层学术-产业双向流动的最典型案例。
第三圈层:MIT HAN Lab学术圈
韩松在MIT建立的HAN Lab已成为全球高效AI计算领域最活跃的研究团队之一。其培养的学生分布在OpenAI、NVIDIA、Google DeepMind、Meta、UCSD等顶级机构和企业,形成了一个覆盖学术界和产业界的高效AI人才网络。特别值得注意的是,多位学生(如林吉)同样具有清华大学背景,体现了NICS-EFC → MIT HAN Lab的人才输送通道持续运转。
第四圈层:产业生态圈
韩松通过深鉴科技(赛灵思/AMD收购)、OmniML(NVIDIA收购)两次成功创业,以及与NVIDIA、Qualcomm、Samsung、Facebook、Google等巨头的深度合作,构建了一个覆盖芯片设计、模型部署、边缘计算和大语言模型推理的全栈产业生态网络。其AWQ和SmoothQuant技术被NVIDIA TensorRT-LLM集成、在HuggingFace上获得1900万次下载,标志着其研究成果已成为全球AI基础设施的组成部分。
总体评价
韩松是NICS-EFC实验室体系中连接中国学术圈与国际AI硬件加速社区的最关键桥梁。他以清华本科为起点,以斯坦福博士为加速器,以MIT教职和两次成功创业为落脚点,构建了一个横跨中美学术界和全球AI产业界的独特关系网络。他的Deep Compression技术从一篇ICLR最佳论文出发,最终成为NVIDIA GPU架构、HuggingFace开源生态和全球AI推理基础设施的标准组件,堪称学术研究产业化影响的典范。在NICS-EFC实验室的学术版图中,韩松代表着"国际化"与"产业化"两个维度的最高成就。