![]()
随着 AI 行业的重心从模型训练转向大规模部署,让模型跑得更快、更便宜的推理技术正在密集吸引资本。
近日,麻省理工学院(MIT)韩松教授的博士毕业生李沐阳正式官宣创业,出任 Nunchux AI 联合创始人兼 CEO。他在社交媒体上写道,“今天对我来说是有意义的一天。七年前,我还是一名本科生,就开始研究高效生成式 AI。当时很少有人预见,生成式模型会成为人们日常使用的东西。”
公司的其他联创还包括卡内基梅隆大学(CMU)机器人研究所副教授朱俊彦,以及与李沐阳长期合作、深耕高效人工智能、模型量化和系统优化的 Yujun Lin 和 Zhekai Zhang。
导师韩松在第一时间连发两条祝贺,对学生赞赏有加:“沐阳在这个领域还没火起来的时候就开始研究了,Zhekai 和 Yujun 一直和他站在一起。还有朱俊彦,他是我认识的这个领域最敏锐的人之一,他们共同成立了 Nunchux AI。”
他在另一条推文中补充:“十年间,同一个问题依旧存在,只是变得更难了。俊彦从大学时代起就是我钦佩的人,他一直站在视觉生成的前沿。”
![]()
(来源:X@songhan_mit)
在韩松的实验室,创业不是新鲜事。
韩松本人在博士期间与汪玉、姚颂等人共同创立神经网络压缩算法公司深鉴科技(DeePhi Tech),后被 Xilinx 收购。2021年,他与两位清华校友吴迪(CEO)、毛慧子(CTO)在加州创立OmniML,聚焦边缘设备上的高效人工智能,2023 年被英伟达收购。
学生们继承了这一传统。2025 年,HAN Lab 的第一位博士生王翰锐和同门联合创立 Eigen AI,专注大语言模型推理和模型优化。同年,另一位 HAN Lab 前成员、现任加州大学圣地亚哥分校助理教授刘至简开始筹备创办高效推理公司 Inco AI。今年 8 月,Inco AI 发布首个产品,一套名为 DFlash 2 的推测解码草稿模型。
Nunchux AI 是师门创业谱系的最新一环,也是其中首家聚焦多模态生成式 AI 的公司。
创始人李沐阳 2019 年本科毕业于上海交通大学,后加入 CMU 机器人研究所的朱俊彦课题组攻读硕士,2023 年 5 月进入韩松团队读博。
这七年间,李沐阳专注于探索一个问题:模型需要具备哪些条件才能真正被人们日常使用?答案是三个词,响应要快、运行要便宜、结果要可靠。这条主线跨越了图像生成模型的完整代际迭代:从生成对抗网络(GAN)到扩散模型(Diffusion Model),再到今天参数量越来越大的图像、视频乃至世界模型。
他近几年的研究工作,组成了 Nunchux AI 的技术路线图。
2020 年到 2024 年,李沐阳主导的 GAN Compression(CVPR 2020)、高效空间稀疏推理(SIGE,NeurIPS 2022)等工作,将神经网络和生成模型的计算成本大幅压缩,推理效率不断提高。2024 年,他主导推出DistriFusion,把高分辨率扩散模型的推理拆分到多张 GPU 上并行执行。
2025 年,他和团队利用 SVDQuant,将大型扩散模型推进到 W4A4 推理(权重和激活值都用 4 位表示),进入扩散模型量化的深水区。
另外两位联合创始人的背景也深嵌于这条主线:Yujun Lin 2025 年 4 月从 HAN Lab 博士毕业,随后担任英伟达研究科学家,专攻计算机架构与机器学习交叉领域的软硬件协同设计;Zhekai Zhang 是 SVDQuant 论文的共同一作,也是 Nunchux AI 的前身、Nunchaku 推理引擎的核心开发成员。
为将 SVDQuant 的理论收益转化为实际速度,李沐阳和团队于 2024 年底开发出 Nunchaku 推理引擎,用系统级优化实现显著的端到端显存和延迟压缩,让一台手提电脑也能跑动原本需要工作站显卡才能部署的图像生成模型。
Nunchaku 发布后,在开源社区引起巨大反响,其主仓库在 GitHub 上已收获约 3,900 stars,至今仍在迭代版本,支持通义 Z-Image 系列、ComfyUI 原生 LoRA 节点、20系显卡的 INT4 等。团队还在积极维护开发者社群,在开源图像生成用户群中建立信任。
以此为底座,Nunchux AI 推出了名为 Modelverse 的商业服务层,将30余个图像、视频和虚拟形象模型整合进一套API系统。允许开发者调用 Nunchux AI 针对底层系统优化后的模型,也可以通过同一接口接入合作伙伴提供的模型,运行模式分为主打快速的极速档(Radical Speed)和侧重成本的极值档(Radical Value)。
![]()
(来源:Nunchux)
可以确认的是,公司目前已收到了来自 Emergence Capital、E14 基金(MIT 媒体实验室的种子基金)等机构的早期投资,但具体金额尚未披露。
公司成立后,团队的学术产出并未中断。最近发表的论文 FourTune 中,参与工作的创始人单位标注已经变为 Nunchux AI。这篇论文延续 SVDQuant 的技术路线,提出了 W4A4G4 端到端全4位的后训练框架。
目前,多模态推理应用程序接口不是完全空白的市场:fal.ai 凭借定制 CUDA 核函数在 FLUX 系列上实现了业界领先的推理速度,获得 Adobe、Shopify、Canva 等大客户的青睐;Replicate 拥有最大的社区模型生态;WaveSpeed 则通过独家接入即梦、可灵等模型建立差异化;Runware、Novita AI 和 Atlas Cloud 等也在争夺市场份额。
Nunchux AI 的差异化在于,它不只是纯粹的应用程序接口聚合和 GPU 调度平台,还要做从量化算法到推理核函数的垂直整合。结合SVDQuant 和 Nunchaku 两大自研技术,在相同硬件下实现更低延迟和更低成本。
商业模式上,底层推理引擎 Nunchaku 依然保持开源,用户可为上层软件提供的应用程序接口服务、企业级优化等付费。
![]()
(来源:Nunchux AI)
朱俊彦在社交媒体上感叹,推理提速是一场长达十年的马拉松:“十年前,我们没日没夜地泡在一台泰坦 X 显卡上跑 Theano,就是想让创作者在发问后立即能看到结果。”
图像模型现在的运行成本大约是当时的一万倍,视频还要再高两个数量级。但追求速度的目的从未改变:“延迟决定了结果是否能在创意还属于你的时候出现,成本决定了你能问多少个问题,质量决定了这些答案是否值得被给出。”
Nunchux的目标是同时做到这三点,且在质量上“绝不妥协”。
参考内容:
https://x.com/songhan_mit
https://x.com/lmxyy1999/status/2095644770517533126
https://www.nunchux.ai/blog/building-the-frontier-of-multimodal-inference
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.