网易首页 > 网易号 > 正文 申请入驻

喜欢折腾的小伙伴可以试试这个,单卡 RTX 5090 能跑 DeepSeek V4 284B

0
分享至

最近本地大模型这条线又冒出来一个挺有意思的项目,叫 FlashML-org/FreeToken。

如果只看项目介绍,你很容易把它当成又一个 Ollama、llama.cpp,或者一个新的本地模型启动器。但我顺着作者 Shuo Yang 的帖子、论文和项目文档研究了一圈以后,发现它真正想解决的问题,其实和大多数本地推理工具不太一样。

以前我们在本地跑大模型,最先考虑的通常都是一个问题:

我的显卡有多少显存?这个模型能不能塞进去?

FreeToken 换了个思路。

既然一个超大的 MoE 模型本来就很难完整塞进显存,那不如别硬塞了,干脆把显卡、CPU、系统内存和 PCIe 一起利用起来,让整台电脑共同完成推理。

于是作者现在展示出了几组很容易吸引眼球的数据:8GB 显存的 RTX 4060 Laptop,可以跑 Qwen3.6 35B,速度大约 39 tok/s;单张 RTX 5090,可以跑 DeepSeek-V4-Flash 284B,速度大约 22~25 tok/s;RTX PRO 6000 甚至可以跑 GLM-5.2 753B,速度大约 15 tok/s。



如果你喜欢折腾本地模型,这个项目确实值得关注一下。但它最值得看的,不只是“能跑多大模型”,而是它背后那套思路:本地推理的上限,也许真的不该只看显存了。



一、先把最大的误区说清楚:284B 并没有塞进 RTX 5090

看到“单卡 RTX 5090 跑 DeepSeek V4 284B”,很多人的第一反应一定是:32GB 显存居然能装下一个 284B 模型?

答案当然是否定的。

这里最容易被标题带偏。FreeToken 论文里测试 DeepSeek-V4-Flash 的那台机器,除了 RTX 5090 这张显卡之外,还有 192GB 的 DDR5 系统内存。也就是说,真正支撑这件事成立的,并不只是 5090 的显存,而是显卡加上一大坨系统 RAM 共同参与了推理。

这也是理解 FreeToken 的第一把钥匙。

它不是让显卡“突然变大了”,也不是让 32GB 显存 magically 装下几百 B 参数,而是换了一套问题定义方式:显存不再是模型容量的唯一边界,系统内存也被拉进了战场。

尤其是 DeepSeek-V4-Flash 这种 MoE,也就是 Mixture of Experts,混合专家模型。它虽然总参数高达 284B,但每生成一个 Token,并不会把全部参数都算一遍,而只是激活其中一部分专家。这样一来,你就会发现,真正难的不是“算不动”,而是“这么多专家权重放在哪里,什么时候调出来”。

FreeToken 本质上就是在解决这个问题。



二、FreeToken 的核心思路:显存不够,系统内存来补

FreeToken 最值得讲的一点,就是它不再把系统内存当成一个无关角色。

以前我们讨论本地大模型,经常会把注意力全部放在显卡上,仿佛电脑里只有 GPU 是干活的,CPU 和 RAM 都只是打下手。FreeToken 完全不是这个逻辑,它把整台电脑拆成了一个异构计算平台。

你可以把它简单理解成两层仓库。

第一层是 GPU 显存,这是一个高速但空间很小的仓库,里面放最常用、最值得提前缓存的 Expert。第二层是系统内存,这是一个大得多但速度慢一些的仓库,里面保存模型更完整的 Expert 权重。

模型开始工作后,Router 会判断这一轮需要调用哪些专家。如果这些专家已经在显存里,那当然最好,直接计算,速度最快。如果没有命中,FreeToken 再从系统内存这边调度。

所以 FreeToken 的本质,并不是“把超大模型完整搬到显卡上”,而是把大模型拆成了“显存缓存 + 内存仓库”的结构。

也正因为这样,8GB 显存的 4060 Laptop 才有机会跑 35B。不是因为 35B 模型突然只需要 8GB,而是因为 FreeToken 让“8GB 显存”这件事,不再等于“模型大小上限”。

这也是它和很多传统本地推理工具最大的区别。它不是只解决“怎么启动”,而是在重新回答“模型到底应该存在哪里,怎么调度最合适”。



三、最妙的一步:搬不过去的 Expert,干脆让 CPU 直接算

如果只是把 Expert 存在系统内存里,然后每次需要的时候通过 PCIe 搬到显卡,其实还不够。因为 PCIe 带宽再高,也是有限的。

这个时候 FreeToken 又做了一步非常聪明的优化。

假设当前这个 Token 需要 12 个 Expert,其中 8 个已经在 GPU Cache 里,剩下 4 个不在。最直观的做法,就是把那 4 个全部从系统内存搬进显存,然后交给 GPU 计算。但这样一来,GPU 很可能要在那里等数据,PCIe 一旦成为瓶颈,整体速度就上不去。

FreeToken 没这么干。

它会先根据当前这台机器的真实情况,去估算两件事:一是 PCIe 的搬运速度,二是 CPU 加内存这一侧的计算速度。然后动态决定,哪些 Expert 值得搬到 GPU,哪些 Expert 干脆别搬了,直接留在 CPU 这一边算。

结果就变成了这样一种分工:

一部分 Expert 通过 PCIe 传给 GPU,由显卡来算;另一部分 Expert 直接在 CPU 和系统内存这一侧完成计算。两边同时进行,最后再把结果合起来。

这就是 FreeToken 那套 bandwidth-adaptive CPU-GPU execution 的核心精神。大白话就是:不死磕“全部交给 GPU”,而是根据这台电脑的真实硬件能力,动态分配工作。

这一步非常关键,因为它意味着 FreeToken 不是一套死的规则,而是一种面向具体机器的调度系统。你换一台不同带宽、不同内存、不同 CPU 的电脑,它的分工策略也可能完全不一样。



四、它不只加速生成,还专门优化了 Prefill

很多人平时只盯着 tok/s,默认大模型快不快,就是看生成阶段快不快。但真到本地推理里,另一个很影响体验的环节其实是 Prefill。

所谓 Prefill,你可以把它理解成模型第一次“吃提示词”的阶段。比如你塞进去一大段 Prompt、一堆代码上下文,或者一整段 Agent 历史,模型要先把这些内容全部处理一遍,后面才能开始连续生成。

如果模型很大,这个阶段会非常慢。

FreeToken 在这里做了一个挺漂亮的优化,叫 full-layer double buffering。它的思路也不复杂:GPU 在计算当前这一层的时候,PCIe 不要闲着,而是提前去搬下一层需要的数据。这样“搬运”和“计算”就能尽量重叠起来,而不是一段一段串行执行。

如果不用这个机制,流程通常像这样:

先搬这一层,再算这一层;算完以后,再去搬下一层;搬完以后,再算下一层。

而用了 double buffering 以后,事情就变成了:GPU 正在算当前层时,下一层的数据已经在路上了。

这类优化听起来有点工程味,但它对应的是非常实际的体验。因为很多人本地跑模型,不是只问一句话就结束,而是要喂很长的上下文,尤其是代码、Agent 和记忆类任务。如果 Prefill 太慢,前面几十秒一直卡着不出字,你就算 Decode 再快,整体体验也还是不好。

这也是为什么作者在帖子里会特别强调,FreeToken 不只是 Decode 更快,Prefill 相比一些传统方案也快很多。



五、它为什么特别适合 Codex、Claude Code 这类 Agent

我觉得 FreeToken 最值得你写给普通用户看的,不是“模型参数有多大”,而是它已经明显开始针对 Agent 工作流做优化了。

普通聊天的流程很简单,就是你问一句,模型答一句。可是一旦进入 Codex、Claude Code、DeepSeek Harness、Hermes 这种 Agent 场景,整个工作方式就彻底变了。

它经常不是单轮问答,而是:

先思考,再调工具;工具返回以后,再继续思考;接着改文件、跑命令、再调一次工具;过程中还会不断压缩历史、修改上下文、裁剪旧输出。

换句话说,Agent 的上下文不是静止的,而是会不断变化。

传统 KV Cache 在这种场景里有个大问题:只要中间某一段内容发生变化,后面一大截缓存就可能失效,于是模型只能从前面重新算起。对于长会话来说,这个代价会非常高。

FreeToken 在这里专门做了 semantic-aware caching,也就是语义感知缓存。你可以把它理解成:它不会傻傻地只按位置缓存,而是会在一些更有语义意义的地方保存状态,比如 thinking 边界、tool call、tool output、会话轮次等。这样当 Agent 后面修改了上下文时,它可以尽量保留前面还有效的部分,只重算真正变化之后的那一段。

这件事为什么重要?因为本地模型如果想变成“本地 Agent 后端”,就不能只会聊天,还得扛得住长会话、多轮工具调用和不断变化的上下文。FreeToken 在这件事上明显是有准备的。

所以它其实不是一个单纯的“本地聊天引擎”,更像是在朝“本地 Agent 服务器”这个方向走。



六、它不是自己单玩,Codex、Claude Code、DSH、Hermes 都能接

这也是 FreeToken 很讨巧的一点。

很多本地模型工具喜欢把用户圈在自己的界面里,只让你用它自己的聊天框、它自己的控制台、它自己的交互方式。FreeToken 没走这条路,它做得更像一个后端。

它对外暴露的是 OpenAI-Compatible API 和 Anthropic-Compatible API,也就是说,很多你已经熟悉的工具,其实都能把它当成本地模型服务来接。

这就带来一个很大的想象空间。

如果你平时在用 Codex、Claude Code、DeepSeek Harness、Hermes、OpenCode 这些 Agent 工具,那 FreeToken 理论上就可以成为它们背后的本地模型引擎。作者在文档里甚至已经给出了对应的启动方式,支持把这些 Agent 指向本地服务。

这也是作者那句“现在只需 $0 即可用前沿模型运行您的 Claude 代码或 Codex”真正想表达的意思。

它不是说 Anthropic 或 OpenAI 的官方模型突然免费了,而是说:你可以继续保留 Claude Code、Codex 这套 Agent 工作流,但把后端模型换成本地部署的开源模型。这样一来,你用的还是那套熟悉的工具方式,但不再需要按 API Token 一次次付费。

当然,硬件的钱、电费和内存还是你自己出,这一点要讲清楚。但从使用体验上看,它确实是在尝试把“本地模型”和“现成 Agent 工具”打通。



七、另一个很大的产品点:不用先转 GGUF,官方 checkpoint 就能跑

对很多喜欢折腾本地模型的人来说,FreeToken 还有一个挺有吸引力的地方,就是它不强迫你先走一大圈模型格式转换。

很多本地工具的常规路线是:先找到一个合适的模型,再去找相应的量化版或者 GGUF 版本,再考虑兼容性、精度和速度,整个过程对普通用户其实不太友好。

FreeToken 当前更强调的是直接读取 Hugging Face 的 safetensors checkpoint。也就是说,模型本身如果已经有官方或半官方可用的 checkpoint,你就可以直接拿来跑,而不一定要先自己转换成 GGUF。

不过这里有个概念必须说清楚:不需要极端量化,不等于完全不量化。

比如作者展示的 8GB RTX 4060 Laptop 跑 Qwen3.6 35B,依赖的是官方 NVFP4 checkpoint;GLM-5.2 那条路线,也用的是 NVIDIA 官方 NVFP4 版本。DeepSeek-V4-Flash 本身也有适合这种推理路径的低精度格式。

所以正确的说法应该是:

FreeToken 不要求你自己去做那种很激进的极端量化,也不要求你先折腾一大堆转换流程,而是尽量直接利用已经存在的官方 checkpoint 体系。

这件事的价值在于,它把“试一试”这件事的门槛降下来了。你不用先在模型格式上折腾半天,再来判断能不能跑。



八、适合哪些人上手,现阶段又该怎么理解它

如果你只是看热闹,容易觉得 FreeToken 已经是一个谁都能闭眼装的成熟大众产品了。其实还没有。

它现在更像一个非常新、但方向很值得关注的项目。适合的人群,首先还是喜欢折腾本地模型、显卡和 Agent 的这批朋友。如果你手上本来就有 RTX 40 或 RTX 50 系显卡,又不排斥折腾系统内存、驱动、模型下载和本地部署,那它很值得一试。

而且有一点必须反复提醒:别只盯着显卡,也要看内存。

作者给出的几组漂亮数据背后,都有一整套硬件条件支撑。4060 Laptop 那组配置有 32GB 内存;5090 跑 DeepSeek-V4-Flash,背后是 192GB 内存;更夸张的 GLM-5.2 753B,则用了 512GB 内存。也就是说,如果你的机器只是“5090 + 32GB RAM”,那和作者那台“5090 + 192GB RAM”根本不是一个级别。

所以 FreeToken 打破的是“显存决定一切”这个旧观念,但并没有打破物理内存的边界。它只是把“系统内存也能认真参与推理”这条路线走通了。

从使用方式上看,普通用户现在更适合先看桌面版。作者已经展示了 FreeToken Desktop,有模型管理、运行状态、速度、缓存配置这些可视化界面,Windows 和 Linux 也都有一键安装路线。对不想一上来就编译源码的人来说,这条路显然更友好。

所以现阶段我对它的评价会更接近一句话:

它已经足够让喜欢折腾的人玩起来了,但还没到“什么都不懂也能无脑上”的程度。



九、最后:FreeToken 真正值得关注的,不只是 5090 跑 284B

如果只把 FreeToken 写成一篇“单卡 RTX 5090 跑 DeepSeek V4 284B”的硬件新闻,其实有点可惜。

因为这个项目真正有意思的地方,不是又冒出来一个更快的本地推理工具,而是它在试图改写一个大家习惯了很久的思路:本地模型的上限,不该只看显存。

在 MoE 模型时代,这个变化尤其重要。因为 MoE 的总参数可以非常夸张,但每个 Token 实际激活的参数又没有你想象得那么多。既然如此,为什么不能把系统内存当成大仓库,把显卡当成高速缓存,把 CPU 当成辅助计算单元,再让 PCIe 负责动态搬运和调度?

FreeToken 本质上就是在认真回答这个问题。

而且它回答的方式,不只是论文里的概念,而是已经落到了真实工程里:它在考虑 GPU Cache、CPU-GPU 协同计算、Prefill 管线优化、Agent 缓存、OpenAI / Anthropic 接口兼容,以及如何直接接到 Codex、Claude Code、DeepSeek Harness 这种实际工作流里。

所以它给人的感觉已经不只是“本地大模型播放器”,而更像是在尝试做一个面向 Agent 时代的本地推理底座。

如果你手上正好有 RTX 40 或 50 系显卡,又有比较宽裕的系统内存,还喜欢折腾 Codex、Claude Code、DeepSeek Harness 这些工具,我觉得这个项目确实值得你下载下来试一试。

特别是那些以前总觉得“284B 这种模型离我电脑太远”的朋友,现在至少可以说一句:

它还不属于大众,但已经有人把路趟出来了。



特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
韦东奕突然卖书,销量已破万件,北京大学与亲属相继确认:是其本人,书是他自己主编的

韦东奕突然卖书,销量已破万件,北京大学与亲属相继确认:是其本人,书是他自己主编的

第一财经资讯
2026-08-22 13:47:24
湖人老大搞团建:18人参加,1人缺席

湖人老大搞团建:18人参加,1人缺席

篮球大视野
2026-08-23 14:14:19
冯远征40岁后悔丁克,48岁妻子检查说能生,他做了一个决定

冯远征40岁后悔丁克,48岁妻子检查说能生,他做了一个决定

乡野小珥
2026-08-23 03:06:30
故意隐瞒伤情!掘金被欺骗1.8亿,现在能签2.3亿,真正的人生赢家

故意隐瞒伤情!掘金被欺骗1.8亿,现在能签2.3亿,真正的人生赢家

小皷拍客在北漂
2026-08-22 12:41:52
英国新首相太狠了!公开回怼普京:我就支持乌克兰,不服你来打我

英国新首相太狠了!公开回怼普京:我就支持乌克兰,不服你来打我

李健政观察
2026-08-22 11:21:21
田立禾去世不到24小时,沉默的郭德纲不再顾及体面 杨议做法太机智

田立禾去世不到24小时,沉默的郭德纲不再顾及体面 杨议做法太机智

寒士之言本尊
2026-08-22 23:04:16
听听恒大前员工心里话:真实的许家印,和你想的完全不一样

听听恒大前员工心里话:真实的许家印,和你想的完全不一样

趣味萌宠的日常
2026-08-23 02:34:12
国民党军官救下9万红军,开国后被判死刑?主席:那是红军的恩人

国民党军官救下9万红军,开国后被判死刑?主席:那是红军的恩人

莫地方
2026-08-22 23:33:09
男人在“性”这件事上最隐秘的瘾:不是欲望本身,不是新鲜感,而是一种他一辈子都开不了口的、借性索要一次无条件触碰的饥渴机制

男人在“性”这件事上最隐秘的瘾:不是欲望本身,不是新鲜感,而是一种他一辈子都开不了口的、借性索要一次无条件触碰的饥渴机制

心理观察局
2026-08-22 06:17:04
我愿意给女儿多买一个座位|成都铁路局通报错误分析

我愿意给女儿多买一个座位|成都铁路局通报错误分析

牛锅巴小钒
2026-08-22 18:44:34
故事:以牙还牙,咱300重装合成营现身巴基斯坦对垒3万俾路支武装

故事:以牙还牙,咱300重装合成营现身巴基斯坦对垒3万俾路支武装

一根香烟的少妇
2025-07-01 17:07:14
相声名家杨议再次喊话郭德纲:你惹不起我,你连还嘴都不敢

相声名家杨议再次喊话郭德纲:你惹不起我,你连还嘴都不敢

陈意小可爱
2026-08-23 02:58:50
双胞胎哥哥顶替弟弟上湘潭大学,弟弟第二年咋高考的?农村母亲20年攒112万北京买房

双胞胎哥哥顶替弟弟上湘潭大学,弟弟第二年咋高考的?农村母亲20年攒112万北京买房

户外阿毽
2026-08-23 06:41:02
许家印传出惊人消息!佛山迎来史上最暴跌最暴跌楼盘

许家印传出惊人消息!佛山迎来史上最暴跌最暴跌楼盘

广佛选房师李秋颜
2026-08-22 11:40:54
外媒:中国台湾第一批2架F-16V Block70战斗机,或于8月23日飞抵台岛

外媒:中国台湾第一批2架F-16V Block70战斗机,或于8月23日飞抵台岛

蓝星杂谈
2026-08-22 18:15:46
周一围:我这辈子最正确的决定,就是在朱丹欠1600万还没结婚的时候,拿出了所有的片酬

周一围:我这辈子最正确的决定,就是在朱丹欠1600万还没结婚的时候,拿出了所有的片酬

飘飘然的娱乐汇
2026-08-22 21:05:03
炸裂!亚航排泄事件后续:阿姨自曝原因,目击乘客发声,厕所就在5米远

炸裂!亚航排泄事件后续:阿姨自曝原因,目击乘客发声,厕所就在5米远

小鋭有话说
2026-08-22 11:45:05
王中磊当着全行业的面,骂了大鹏一顿

王中磊当着全行业的面,骂了大鹏一顿

新浪财经
2026-08-23 07:48:41
8月23日,2026年养老金调整通知公布了吗?"8000以上不涨"靠谱吗?

8月23日,2026年养老金调整通知公布了吗?"8000以上不涨"靠谱吗?

骑驴追光者
2026-08-23 09:10:16
“两女孩买三张火车票占座放零食”引热议,其妈妈最新回应:全程27小时,担心俩孩子旁边坐的是陌生男性,因此没退成人票

“两女孩买三张火车票占座放零食”引热议,其妈妈最新回应:全程27小时,担心俩孩子旁边坐的是陌生男性,因此没退成人票

都市快报橙柿互动
2026-08-22 20:26:49
2026-08-23 14:28:49
时尚的弄潮
时尚的弄潮
快乐学习化学
912文章数 9693关注度
往期回顾 全部

数码要闻

M6+均热板+触控屏,苹果史上贵MacBook Pro要来了!

头条要闻

男子被困电车后备箱5小时一句语音救命:Siri 拨打110

头条要闻

男子被困电车后备箱5小时一句语音救命:Siri 拨打110

体育要闻

字母+汤神,有没有搞头?

娱乐要闻

新加坡媒体挑衅《龙餐馆》,人民网直接下场

财经要闻

加拿大宣布“全额对等报复”美国新关税

科技要闻

“英伟达发通知:涨价15%以上”

汽车要闻

iCAR V25成都车展全球首秀 满配体验15万级SUV新标杆

态度原创

本地
教育
艺术
健康
公开课

本地新闻

《牛来》的一声“妈妈”,到底多少人被精神污染了

教育要闻

水和酒精各1000毫升,混合成溶液,质量和体积各是多少

艺术要闻

前海HOP国际怎么选|宝安办公室参考报价

“矫正神器”真能治好脊柱侧弯吗?

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版