最近本地大模型这条线又冒出来一个挺有意思的项目,叫 FlashML-org/FreeToken。
如果只看项目介绍,你很容易把它当成又一个 Ollama、llama.cpp,或者一个新的本地模型启动器。但我顺着作者 Shuo Yang 的帖子、论文和项目文档研究了一圈以后,发现它真正想解决的问题,其实和大多数本地推理工具不太一样。
以前我们在本地跑大模型,最先考虑的通常都是一个问题:
我的显卡有多少显存?这个模型能不能塞进去?
FreeToken 换了个思路。
既然一个超大的 MoE 模型本来就很难完整塞进显存,那不如别硬塞了,干脆把显卡、CPU、系统内存和 PCIe 一起利用起来,让整台电脑共同完成推理。
于是作者现在展示出了几组很容易吸引眼球的数据:8GB 显存的 RTX 4060 Laptop,可以跑 Qwen3.6 35B,速度大约 39 tok/s;单张 RTX 5090,可以跑 DeepSeek-V4-Flash 284B,速度大约 22~25 tok/s;RTX PRO 6000 甚至可以跑 GLM-5.2 753B,速度大约 15 tok/s。
![]()
如果你喜欢折腾本地模型,这个项目确实值得关注一下。但它最值得看的,不只是“能跑多大模型”,而是它背后那套思路:本地推理的上限,也许真的不该只看显存了。
![]()
一、先把最大的误区说清楚:284B 并没有塞进 RTX 5090
看到“单卡 RTX 5090 跑 DeepSeek V4 284B”,很多人的第一反应一定是:32GB 显存居然能装下一个 284B 模型?
答案当然是否定的。
这里最容易被标题带偏。FreeToken 论文里测试 DeepSeek-V4-Flash 的那台机器,除了 RTX 5090 这张显卡之外,还有 192GB 的 DDR5 系统内存。也就是说,真正支撑这件事成立的,并不只是 5090 的显存,而是显卡加上一大坨系统 RAM 共同参与了推理。
这也是理解 FreeToken 的第一把钥匙。
它不是让显卡“突然变大了”,也不是让 32GB 显存 magically 装下几百 B 参数,而是换了一套问题定义方式:显存不再是模型容量的唯一边界,系统内存也被拉进了战场。
尤其是 DeepSeek-V4-Flash 这种 MoE,也就是 Mixture of Experts,混合专家模型。它虽然总参数高达 284B,但每生成一个 Token,并不会把全部参数都算一遍,而只是激活其中一部分专家。这样一来,你就会发现,真正难的不是“算不动”,而是“这么多专家权重放在哪里,什么时候调出来”。
FreeToken 本质上就是在解决这个问题。
![]()
二、FreeToken 的核心思路:显存不够,系统内存来补
FreeToken 最值得讲的一点,就是它不再把系统内存当成一个无关角色。
以前我们讨论本地大模型,经常会把注意力全部放在显卡上,仿佛电脑里只有 GPU 是干活的,CPU 和 RAM 都只是打下手。FreeToken 完全不是这个逻辑,它把整台电脑拆成了一个异构计算平台。
你可以把它简单理解成两层仓库。
第一层是 GPU 显存,这是一个高速但空间很小的仓库,里面放最常用、最值得提前缓存的 Expert。第二层是系统内存,这是一个大得多但速度慢一些的仓库,里面保存模型更完整的 Expert 权重。
模型开始工作后,Router 会判断这一轮需要调用哪些专家。如果这些专家已经在显存里,那当然最好,直接计算,速度最快。如果没有命中,FreeToken 再从系统内存这边调度。
所以 FreeToken 的本质,并不是“把超大模型完整搬到显卡上”,而是把大模型拆成了“显存缓存 + 内存仓库”的结构。
也正因为这样,8GB 显存的 4060 Laptop 才有机会跑 35B。不是因为 35B 模型突然只需要 8GB,而是因为 FreeToken 让“8GB 显存”这件事,不再等于“模型大小上限”。
这也是它和很多传统本地推理工具最大的区别。它不是只解决“怎么启动”,而是在重新回答“模型到底应该存在哪里,怎么调度最合适”。
![]()
三、最妙的一步:搬不过去的 Expert,干脆让 CPU 直接算
如果只是把 Expert 存在系统内存里,然后每次需要的时候通过 PCIe 搬到显卡,其实还不够。因为 PCIe 带宽再高,也是有限的。
这个时候 FreeToken 又做了一步非常聪明的优化。
假设当前这个 Token 需要 12 个 Expert,其中 8 个已经在 GPU Cache 里,剩下 4 个不在。最直观的做法,就是把那 4 个全部从系统内存搬进显存,然后交给 GPU 计算。但这样一来,GPU 很可能要在那里等数据,PCIe 一旦成为瓶颈,整体速度就上不去。
FreeToken 没这么干。
它会先根据当前这台机器的真实情况,去估算两件事:一是 PCIe 的搬运速度,二是 CPU 加内存这一侧的计算速度。然后动态决定,哪些 Expert 值得搬到 GPU,哪些 Expert 干脆别搬了,直接留在 CPU 这一边算。
结果就变成了这样一种分工:
一部分 Expert 通过 PCIe 传给 GPU,由显卡来算;另一部分 Expert 直接在 CPU 和系统内存这一侧完成计算。两边同时进行,最后再把结果合起来。
这就是 FreeToken 那套 bandwidth-adaptive CPU-GPU execution 的核心精神。大白话就是:不死磕“全部交给 GPU”,而是根据这台电脑的真实硬件能力,动态分配工作。
这一步非常关键,因为它意味着 FreeToken 不是一套死的规则,而是一种面向具体机器的调度系统。你换一台不同带宽、不同内存、不同 CPU 的电脑,它的分工策略也可能完全不一样。
![]()
四、它不只加速生成,还专门优化了 Prefill
很多人平时只盯着 tok/s,默认大模型快不快,就是看生成阶段快不快。但真到本地推理里,另一个很影响体验的环节其实是 Prefill。
所谓 Prefill,你可以把它理解成模型第一次“吃提示词”的阶段。比如你塞进去一大段 Prompt、一堆代码上下文,或者一整段 Agent 历史,模型要先把这些内容全部处理一遍,后面才能开始连续生成。
如果模型很大,这个阶段会非常慢。
FreeToken 在这里做了一个挺漂亮的优化,叫 full-layer double buffering。它的思路也不复杂:GPU 在计算当前这一层的时候,PCIe 不要闲着,而是提前去搬下一层需要的数据。这样“搬运”和“计算”就能尽量重叠起来,而不是一段一段串行执行。
如果不用这个机制,流程通常像这样:
先搬这一层,再算这一层;算完以后,再去搬下一层;搬完以后,再算下一层。
而用了 double buffering 以后,事情就变成了:GPU 正在算当前层时,下一层的数据已经在路上了。
这类优化听起来有点工程味,但它对应的是非常实际的体验。因为很多人本地跑模型,不是只问一句话就结束,而是要喂很长的上下文,尤其是代码、Agent 和记忆类任务。如果 Prefill 太慢,前面几十秒一直卡着不出字,你就算 Decode 再快,整体体验也还是不好。
这也是为什么作者在帖子里会特别强调,FreeToken 不只是 Decode 更快,Prefill 相比一些传统方案也快很多。
![]()
五、它为什么特别适合 Codex、Claude Code 这类 Agent
我觉得 FreeToken 最值得你写给普通用户看的,不是“模型参数有多大”,而是它已经明显开始针对 Agent 工作流做优化了。
普通聊天的流程很简单,就是你问一句,模型答一句。可是一旦进入 Codex、Claude Code、DeepSeek Harness、Hermes 这种 Agent 场景,整个工作方式就彻底变了。
它经常不是单轮问答,而是:
先思考,再调工具;工具返回以后,再继续思考;接着改文件、跑命令、再调一次工具;过程中还会不断压缩历史、修改上下文、裁剪旧输出。
换句话说,Agent 的上下文不是静止的,而是会不断变化。
传统 KV Cache 在这种场景里有个大问题:只要中间某一段内容发生变化,后面一大截缓存就可能失效,于是模型只能从前面重新算起。对于长会话来说,这个代价会非常高。
FreeToken 在这里专门做了 semantic-aware caching,也就是语义感知缓存。你可以把它理解成:它不会傻傻地只按位置缓存,而是会在一些更有语义意义的地方保存状态,比如 thinking 边界、tool call、tool output、会话轮次等。这样当 Agent 后面修改了上下文时,它可以尽量保留前面还有效的部分,只重算真正变化之后的那一段。
这件事为什么重要?因为本地模型如果想变成“本地 Agent 后端”,就不能只会聊天,还得扛得住长会话、多轮工具调用和不断变化的上下文。FreeToken 在这件事上明显是有准备的。
所以它其实不是一个单纯的“本地聊天引擎”,更像是在朝“本地 Agent 服务器”这个方向走。
![]()
六、它不是自己单玩,Codex、Claude Code、DSH、Hermes 都能接
这也是 FreeToken 很讨巧的一点。
很多本地模型工具喜欢把用户圈在自己的界面里,只让你用它自己的聊天框、它自己的控制台、它自己的交互方式。FreeToken 没走这条路,它做得更像一个后端。
它对外暴露的是 OpenAI-Compatible API 和 Anthropic-Compatible API,也就是说,很多你已经熟悉的工具,其实都能把它当成本地模型服务来接。
这就带来一个很大的想象空间。
如果你平时在用 Codex、Claude Code、DeepSeek Harness、Hermes、OpenCode 这些 Agent 工具,那 FreeToken 理论上就可以成为它们背后的本地模型引擎。作者在文档里甚至已经给出了对应的启动方式,支持把这些 Agent 指向本地服务。
这也是作者那句“现在只需 $0 即可用前沿模型运行您的 Claude 代码或 Codex”真正想表达的意思。
它不是说 Anthropic 或 OpenAI 的官方模型突然免费了,而是说:你可以继续保留 Claude Code、Codex 这套 Agent 工作流,但把后端模型换成本地部署的开源模型。这样一来,你用的还是那套熟悉的工具方式,但不再需要按 API Token 一次次付费。
当然,硬件的钱、电费和内存还是你自己出,这一点要讲清楚。但从使用体验上看,它确实是在尝试把“本地模型”和“现成 Agent 工具”打通。
![]()
七、另一个很大的产品点:不用先转 GGUF,官方 checkpoint 就能跑
对很多喜欢折腾本地模型的人来说,FreeToken 还有一个挺有吸引力的地方,就是它不强迫你先走一大圈模型格式转换。
很多本地工具的常规路线是:先找到一个合适的模型,再去找相应的量化版或者 GGUF 版本,再考虑兼容性、精度和速度,整个过程对普通用户其实不太友好。
FreeToken 当前更强调的是直接读取 Hugging Face 的 safetensors checkpoint。也就是说,模型本身如果已经有官方或半官方可用的 checkpoint,你就可以直接拿来跑,而不一定要先自己转换成 GGUF。
不过这里有个概念必须说清楚:不需要极端量化,不等于完全不量化。
比如作者展示的 8GB RTX 4060 Laptop 跑 Qwen3.6 35B,依赖的是官方 NVFP4 checkpoint;GLM-5.2 那条路线,也用的是 NVIDIA 官方 NVFP4 版本。DeepSeek-V4-Flash 本身也有适合这种推理路径的低精度格式。
所以正确的说法应该是:
FreeToken 不要求你自己去做那种很激进的极端量化,也不要求你先折腾一大堆转换流程,而是尽量直接利用已经存在的官方 checkpoint 体系。
这件事的价值在于,它把“试一试”这件事的门槛降下来了。你不用先在模型格式上折腾半天,再来判断能不能跑。
![]()
八、适合哪些人上手,现阶段又该怎么理解它
如果你只是看热闹,容易觉得 FreeToken 已经是一个谁都能闭眼装的成熟大众产品了。其实还没有。
它现在更像一个非常新、但方向很值得关注的项目。适合的人群,首先还是喜欢折腾本地模型、显卡和 Agent 的这批朋友。如果你手上本来就有 RTX 40 或 RTX 50 系显卡,又不排斥折腾系统内存、驱动、模型下载和本地部署,那它很值得一试。
而且有一点必须反复提醒:别只盯着显卡,也要看内存。
作者给出的几组漂亮数据背后,都有一整套硬件条件支撑。4060 Laptop 那组配置有 32GB 内存;5090 跑 DeepSeek-V4-Flash,背后是 192GB 内存;更夸张的 GLM-5.2 753B,则用了 512GB 内存。也就是说,如果你的机器只是“5090 + 32GB RAM”,那和作者那台“5090 + 192GB RAM”根本不是一个级别。
所以 FreeToken 打破的是“显存决定一切”这个旧观念,但并没有打破物理内存的边界。它只是把“系统内存也能认真参与推理”这条路线走通了。
从使用方式上看,普通用户现在更适合先看桌面版。作者已经展示了 FreeToken Desktop,有模型管理、运行状态、速度、缓存配置这些可视化界面,Windows 和 Linux 也都有一键安装路线。对不想一上来就编译源码的人来说,这条路显然更友好。
所以现阶段我对它的评价会更接近一句话:
它已经足够让喜欢折腾的人玩起来了,但还没到“什么都不懂也能无脑上”的程度。
![]()
九、最后:FreeToken 真正值得关注的,不只是 5090 跑 284B
如果只把 FreeToken 写成一篇“单卡 RTX 5090 跑 DeepSeek V4 284B”的硬件新闻,其实有点可惜。
因为这个项目真正有意思的地方,不是又冒出来一个更快的本地推理工具,而是它在试图改写一个大家习惯了很久的思路:本地模型的上限,不该只看显存。
在 MoE 模型时代,这个变化尤其重要。因为 MoE 的总参数可以非常夸张,但每个 Token 实际激活的参数又没有你想象得那么多。既然如此,为什么不能把系统内存当成大仓库,把显卡当成高速缓存,把 CPU 当成辅助计算单元,再让 PCIe 负责动态搬运和调度?
FreeToken 本质上就是在认真回答这个问题。
而且它回答的方式,不只是论文里的概念,而是已经落到了真实工程里:它在考虑 GPU Cache、CPU-GPU 协同计算、Prefill 管线优化、Agent 缓存、OpenAI / Anthropic 接口兼容,以及如何直接接到 Codex、Claude Code、DeepSeek Harness 这种实际工作流里。
所以它给人的感觉已经不只是“本地大模型播放器”,而更像是在尝试做一个面向 Agent 时代的本地推理底座。
如果你手上正好有 RTX 40 或 50 系显卡,又有比较宽裕的系统内存,还喜欢折腾 Codex、Claude Code、DeepSeek Harness 这些工具,我觉得这个项目确实值得你下载下来试一试。
特别是那些以前总觉得“284B 这种模型离我电脑太远”的朋友,现在至少可以说一句:
它还不属于大众,但已经有人把路趟出来了。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.