网易首页 > 网易号 > 正文 申请入驻

单卡5090跑满血DeepSeek V4Flash,已开源,Token自由了!

0
分享至

编辑 | 泽南

「这个结果太疯狂了。」

本周五,AI 社区热烈讨论的是一个端侧大模型部署技术,它能让笔记本 RTX 4060 跑 Qwen 3.6-35B,桌面 RTX 5090 跑得起 DeepSeek-V4-Flash 284B。而且都是单卡,模型都是满血的。



Codex 生产 trace 的中位 decode 速度是 33 token/s,笔记本 RTX 4060 跑 Qwen3.6-35B 的 39.3 token/s 已经超过了这个数。



来自 UC Berkeley、MIT 等机构的联合团队开源了名为FreeToken的全新开源边缘端推理系统。并列一作杨硕(Shuo Yang)是伯克利 EECS 博士生,范晓泽(Xiaoze Fan)在 UT Austin,两人本科均毕业于上海交通大学。FreeToken 的作者还包括 Ion Stoica、Matei Zaharia、Kurt Keutzer、韩松等顶尖学者。

该系统专门针对 MoE(混合专家)大模型在消费级硬件上的本地部署进行了全栈协同设计,打破了大规模前沿模型必须依赖数据中心集群的硬件门槛。



  • 论文:《FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution》
  • 论文链接:https://arxiv.org/abs/2608.16157
  • GitHub:https://github.com/FlashML-org/FreeToken
  • 官网:https://www.flashml.ai/

FreeToken 现在已经提供了 Windows / Linux 桌面 App(带 GUI),CLI 一行 uv pip install "freetoken [accel]" 即可载入。

消费级硬件能跑什么?

传统的 CPU-GPU 权重卸载(Offloading)方案往往因为 PCIe 带宽瓶颈导致推理速度极慢(每秒几 token 甚至卡顿),而FreeToken 实现了「交互级实用速度」的本地推理



除了每秒 Token 速度,在处理长 Prompt(如 4-16k 上下文)时,传统 Offloading 方案因逐层从系统内存拉取 Expert 导致严重 I/O 阻塞。FreeToken 将首 Token 延迟(TTFT)降低了 42-58%

针对如今常见的 Agent 工具,如 Claude Code、OpenClaw 等循环交互、逐步追加上下文的场景,在多次工具调用与思维链(CoT)迭代中,由于 FreeToken 引入的 Token 边界轻量级检查点与状态复用,后续多轮交互的 TTFT 减少了 65-80%

论文在不同 PCIe 规格(PCIe 3.0 x8、PCIe 4.0 x16、PCIe 5.0 x16)及不同 CPU(如 Intel i7、AMD Ryzen 9、Threadripper)下进行了测试,当系统后台有其他高 I/O 任务抢占总线时,算法可以自动提升 CPU 端分流计算比例;当总线空闲时则提升 GPU 载入比例。

也就是说,无论处于何种总线带宽受限环境,系统均能稳定收敛至该硬件拓扑下的理论最大吞吐上限

论文作者还做了压力测试,模拟用户在后台开启 3D 渲染、游戏导致可用显存骤降 4-8GB 的场景。传统方案会直接触发 CUDA Out of Memory (OOM) 崩溃退出,FreeToken 可以在 0 停机开销下无缝收缩 GPU 驻留的 LRU Cache 大小,将更多未命中 Expert 转交 CPU 计算,保证推理服务平滑降级而不中断。

可以说,现在跑大模型不需要死磕模型 100% 上显存了。

对于 MoE 这类稀疏激活架构,只要通过软硬件协同的「动态带宽感知 + 双缓冲数据流 + 状态复用」,完全可以利用 PC 上较为常见的 DDR5 大内存 + PCIe 高带宽通道 + 消费级单卡,以极高性价比获得可以日常个人使用的体验。

当然这意味着显存不够,内存来凑。比如 DeepSeek V4 Flash 的专家池约 140GB,就需要 32GB 显存(RTX 5090)加上最好有 192GB 的内存来跑才比较稳。

为什么 FreeToken 能做到?

如今,大模型开放权重解决的是谁能拿到模型,没解决「谁能跑得起模型」。 Kimi-K3、GLM-5.2、DeepSeek-V4-Flash 的能力已经逼近闭源第一梯队,但跑它们仍然默认要数据中心。结果就是能力的差距在快速收窄,可及性的差距还是很大。

如果以游戏平台 Steam 观之,大家的电脑约 72% 有 N 卡,其中最常见的单卡是笔记本版的 RTX 4060,如果大模型能把它们用起来情况就会大不一样。那么就需要一个能把 GPU、CPU、主机内存、互连当成一个统一平台来调度的服务系统。

MoE 恰好给了我们这个机会,以目前最火的 DeepSeek-V4-Flash 为例,它有 284B 总参数、43 层、每层 256 个路由专家选 6 个,单 token 只激活 13B。在部署精度下,活跃参数量塞得进 RTX 5090 的 32GB。

但稀疏只减少了计算,没有等比例减少内存,完整专家池仍然远超显存。当前的瓶颈在于,Prefill 会摧毁 MoE 的稀疏性:单个 token 只走 k 个专家,但一个长 prompt 里所有 token 路由的并集,几乎覆盖每层的全部专家。于是每次 prefill 都要把接近完整的专家池流过 PCIe 一遍。

在 DeepSeek-V4-Flash 的部署上,FP4 部署要搬约 140GB 专家权重,RTX 5090 需要额外的两秒钟,按需取专家的引擎,会把这整段暴露成 GPU 空转。

雪上加霜的是 Agent 每轮工具调用都会改上下文。而 Qwen3.6-35B 用 gated DeltaNet、Kimi-K3 用 KDA 这类循环层,会把整段前缀压成一个演化状态,不能局部复用,只能靠 checkpoint。一个 checkpoint 占的内存相当于几百 token 的 KV,所以引擎只能存少量。上下文一改,改动点之后的 checkpoint 全部失效,只能回退到上一个有效点,重算几千 token。而 RTX 5090 的 dense BF16 吞吐只有 H100 的约 1/5、B200 的约 1/10,扛不住这种重复劳动。

FreeToken 的解法是重新定义了端侧异构硬件的协同调度逻辑:

  • 全层双缓冲(Double-Buffered Prefill)。在 Prompt 处理阶段,FreeToken 实现了计算与数据搬运的完全重叠:当 GPU 正在计算第 l 层时,第 l+1 层的 Expert 权重已经通过 PCIe 后台预取流式传输,基本消除了 I/O 等待气泡。
  • 带宽自适应的混合调度(Bandwidth-Adaptive Execution)。运行时实时探测本机的 PCIe 实际带宽 与 CPU 瞬时算力,动态计算出最优分流比率 q*。一部分 Expert 命中 GPU LRU 缓存,未命中部分根据实时带宽智能分流,部分传输到 GPU,部分直接原地在 CPU 并行计算,将硬件吞吐拉到极限。
  • 面向 Agent 的智能状态复用(Agentic State Reuse)。现代 Coding Agent 或工具调用模型会频繁微调 / 修改上下文历史(如添加思考步骤或工具返回结果)。FreeToken 在特殊 Token 边界设置轻量检查点,遇到上下文编辑时仅需从最近锚点恢复并增量 Prefill,避免重复计算整个上下文。
  • 弹性显存动态热扩缩容。针对个人电脑经常有其他应用(如游戏、浏览器、开发工具)抢占显存的情况,FreeToken 支持在不重启 Serving 服务的前提下动态热调整显存中的 Expert Cache 大小,保证服务不中断。



其中面向 Agent 的机制非常有趣,这么做可以说是真的是瞄准如今热门的 Agent 任务在优化了。

结语

FreeToken 证明了让大模型走向普及的关键,不仅在于开源模型权重,更在于端侧调度软件系统的工程设计与算法重构。

通过将个人电脑的 CPU、系统内存、PCIe 总线与 GPU 作为一个统一的弹性计算平台,开发者和个人用户今后完全可以在本地笔记本或游戏 PC 上跑起顶尖 MoE Agent,极大降低了本地部署高智能模型的成本。

好了,现在就差个传说中的 Qwen3.8-A3B 了。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
人均“十万加”,特朗普考虑出兵干预

人均“十万加”,特朗普考虑出兵干预

中国新闻周刊
2026-08-22 18:41:16
从2-1到2-5再到4-5!中超疯狂一战,成都蓉城落败,冠军悬念回来了?

从2-1到2-5再到4-5!中超疯狂一战,成都蓉城落败,冠军悬念回来了?

中超伪球迷
2026-08-22 21:37:08
60岁大爷勇闯AI做动画被全网催更 独家专访:作品灵魂由人把控

60岁大爷勇闯AI做动画被全网催更 独家专访:作品灵魂由人把控

封面新闻
2026-08-22 13:14:21
24小时内,中方专机准点抵达,朝方发布强硬警示,离战争越来越近

24小时内,中方专机准点抵达,朝方发布强硬警示,离战争越来越近

荷兰豆爱健康
2026-08-22 08:22:11
央视新版《西游记》即将上线!

央视新版《西游记》即将上线!

随州派
2026-08-22 14:56:33
梅西导演大逆转!4分钟独造2球,戏耍8人防线,连刷6大纪录

梅西导演大逆转!4分钟独造2球,戏耍8人防线,连刷6大纪录

石场阿鑫
2026-08-22 20:07:19
飞机起飞后才敢官宣移民美国:安踏前CEO徐阳的“体面告别”

飞机起飞后才敢官宣移民美国:安踏前CEO徐阳的“体面告别”

天天热点见闻
2026-08-22 09:08:20
宋丹丹被曝做财产公证,有12个小目标,每月给儿子30万,孙子50万

宋丹丹被曝做财产公证,有12个小目标,每月给儿子30万,孙子50万

林轻吟
2026-08-22 07:15:04
曝浙江一美女在女厕被强奸,对方将其内裤撕烂,女孩自曝详细经过

曝浙江一美女在女厕被强奸,对方将其内裤撕烂,女孩自曝详细经过

180视角
2026-08-22 09:13:25
2-0!英超首轮大冷门:8.7亿豪门惨遭升班马掀翻 创造34年耻辱纪录

2-0!英超首轮大冷门:8.7亿豪门惨遭升班马掀翻 创造34年耻辱纪录

狍子歪解体坛
2026-08-22 21:25:29
全球首例!51岁男子双大腿被机器绞断离体近3小时后送医,苏州医疗团队8小时手术成功接回,术后20个月已能借助助行器站立行走

全球首例!51岁男子双大腿被机器绞断离体近3小时后送医,苏州医疗团队8小时手术成功接回,术后20个月已能借助助行器站立行走

三湘都市报
2026-08-20 20:54:27
国新办发布会结束!2026养老金上调消息,为什么这次没有公布?

国新办发布会结束!2026养老金上调消息,为什么这次没有公布?

白昼说故事
2026-08-22 09:38:39
堪称最离谱的枕边翻车现场,清华学霸杨奇函被女友趁熟睡时蚂蚁搬家式转走百万

堪称最离谱的枕边翻车现场,清华学霸杨奇函被女友趁熟睡时蚂蚁搬家式转走百万

东方不败然多多
2026-08-22 04:34:50
特朗普的梦里,这些地方都应该是美国的领土

特朗普的梦里,这些地方都应该是美国的领土

News脑洞
2026-08-22 19:09:42
“两女孩买三张火车票占座放零食”引热议,其妈妈最新回应:全程27小时,担心俩孩子旁边坐的是陌生男性,因此没退成人票

“两女孩买三张火车票占座放零食”引热议,其妈妈最新回应:全程27小时,担心俩孩子旁边坐的是陌生男性,因此没退成人票

都市快报橙柿互动
2026-08-22 20:26:49
许家印两子许智健许腾鹤同日获刑,清华哈佛白读,23亿信托全没了

许家印两子许智健许腾鹤同日获刑,清华哈佛白读,23亿信托全没了

次元君情感
2026-08-22 07:08:25
77岁老人转院时,EICU整理的病患物品袋混入敌敌畏,监控证实为一服毒患者家属误投,警方调解失败建议诉讼

77岁老人转院时,EICU整理的病患物品袋混入敌敌畏,监控证实为一服毒患者家属误投,警方调解失败建议诉讼

大风新闻
2026-08-22 22:23:07
为前夫担保后负债600万,52岁女演员朱晏:债务缺口还有500多万,一个月瘦了10斤,但从未崩溃失眠,这些东西压不垮我

为前夫担保后负债600万,52岁女演员朱晏:债务缺口还有500多万,一个月瘦了10斤,但从未崩溃失眠,这些东西压不垮我

鲁中晨报
2026-08-22 15:46:04
杭州酒局事件仍在发酵!曝出新消息:一个未参加酒局的人受人之托,出面斡旋,结果把自己卷入漩涡

杭州酒局事件仍在发酵!曝出新消息:一个未参加酒局的人受人之托,出面斡旋,结果把自己卷入漩涡

火山詩话
2026-08-22 06:32:54
森林北大方公开:已生娃,没分手...

森林北大方公开:已生娃,没分手...

阿废冷眼观察所
2026-08-22 14:57:09
2026-08-22 23:28:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13816文章数 142724关注度
往期回顾 全部

科技要闻

苹果裁员200人:Vision Pro砍游戏团队

头条要闻

俄美均对联大主席贝尔伯克强烈不满 指责其行为"越界"

头条要闻

俄美均对联大主席贝尔伯克强烈不满 指责其行为"越界"

体育要闻

字母+汤神,有没有搞头?

娱乐要闻

《空枪》预测票房缩水,手握王炸都没赢

财经要闻

蔡昉解读经济:扩大消费需求的政策思考

汽车要闻

最能代表东方神韵的新旗舰 体验面子里子都拉满的比亚迪大汉

态度原创

教育
旅游
数码
游戏
公开课

教育要闻

重庆烟草局2026招聘出炉:计划88%岗位"本科可报",结果66%录了硕士

旅游要闻

客流集聚、民宿满房,这里的“凉资源”如何变身“热产业”?

数码要闻

当贝推出RX10投影仪:0.33" DMD显示芯片、1200CVIA,5499元

FS社新作被批素材复用严重!像《血源》和黑环

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版