网易首页 > 网易号 > 正文 申请入驻

DeepSeek塞进苹果本儿,分币不花实现“龙虾自由”

0
分享至



在agent时代最贵的是什么?是token。

一些重度agent使用者,一个月用掉几亿token,账单小几万块钱也是常有的事。

然而现在开始,有这么一个开发者他开源了一个本地方案,一台苹果笔记本就能部署,也就是说,你从此实现了“龙虾自由”,跑再多任务,也不会再为token付出一分钱了。最关键的是,他用的还是DeeSeek V4 Falsh。

几天前,antirez在GitHub上发布了一个项目,叫ds4。

这是一个专门为DeepSeek V4 Flash写的推理引擎。一共几千行C代码,可以让DeepSeek V4 Flash这个模型在128G内存的苹果电脑上跑起来。

开发者antirez,本名Salvatore Sanfilippo,是意大利程序员,同时他也是开源数据库Redis的原作者。Redis后来成为全球互联网基础设施里最常用的内存数据库之一。

往好的方面去想,DeepSeek影响力足够大,吸引到了圈内顶流的程序员,但是坏的方面是,DeepSeek这回真的免费了。

任何开发者都可以用ds4,去把DeepSeek V4 Flash装进自己的MacBook Pro里,本地跑代码、本地读上下文、本地做agent任务,而这一切的一切,不需要给DeepSeek付1分钱。

虽然DeepSeek V4 Flash本身开源,可FP16精度的原始模型要吃掉284G内存,显存需求更是高达160G。

因此,想运行它,你至少得有两张英伟达A100 80GB、一条512GB DDR5 ECC内存,以及一个4TB NVMe SSD。总成本50万人民币。

而现在,一台3万块钱的MacBook Pro就能跑。

那antirez为什么偏偏选中DeepSeek V4 Flash呢?

原因是DeepSeek最适合被“塞进本地电脑”。

它有284B总参数,足够大;但每次推理只激活13B参数,又不像传统大模型那样沉重。

它支持100万token上下文,适合编程助手这种长任务;同时KV cache压缩得足够狠,给本地内存和SSD留下了操作空间。

DeepSeek V4 Flash刚好站在了这样一个神奇的平衡点上,既大到值得折腾,又小到能被塞进苹果笔记本里。



YC的CEO Garry Tan在X上转了这条消息,只打了一行字:正在下载……100万token上下文窗口,可用的编程助手能力,全在一台128GB的MacBook Pro上,太疯狂了。

01

ds4究竟是什么?

先说结论,ds4不是一个模型,它是一台“专用发动机”。DeepSeek V4 Flash是车,苹果电脑是路,ds4负责把这辆原本更适合跑在云端的大车,改到本地机器上能跑、能接API、还能被coding agent调用。



过去大家想在自己电脑上跑大模型,普遍用的都是llama.cpp这个工具。它的好处是什么模型都能跑,Llama、Qwen、DeepSeek全都支持。

可问题就是,什么都能跑,就意味着什么都跑不到最快。为了照顾所有模型,llama.cpp必须做很多妥协,性能上不可能做到极致。

antirez的想法正好相反,他才不管别的模型死活,他就专门伺候DeepSeek V4 Flash这一个,把它优化到极限。

他一共做了3件事。

第一件事,是不对称的2-bit量化。

DeepSeek V4 Flash的架构是MoE(Mixture of Experts),284B总参数里,每次推理只激活13B,这13B是路由挑出来的若干个专家子网络。

就像一个工具箱里有284把工具,每次只拿出13把来用。这284B里面,有一大堆“备选专家”占了90%以上的空间,但它们不是每次都用,只是候补。

antirez的做法是,只对这批routed experts做激进的2-bit量化,up和gate矩阵用IQ2_XXS,down矩阵用Q2_K,而模型里所有关键路径上的组件,包括shared experts、projections、routing网络,全部保持原始精度不动。

也就是说,antirez把这些“候补专家”狠狠压缩,压到只剩原来1/4的大小,但那些每次都要用的核心组件,一点都不动,保持原样。

这是一种不对称的压缩策略,砍掉体积大头,保住质量命脉。

第二件事,是把KV Cache搬到SSD上。

DeepSeek V4 Flash支持100万token的上下文,这相当于你可以把一整本小说扔给它,它能全记住。

但这么长的上下文,意味着AI在工作时要不停地回头翻看前面的内容。为了让这个“回头翻看”的动作不至于慢到卡死,AI需要把这些内容暂存在一个叫“缓存”的地方,方便随时调用。

以前的做法是把这个缓存放在内存里。内存速度快,AI每次生成一个字都要频繁查这个缓存,所以必须放内存。

但问题是,如果让128GB内存的MacBook Pro跑DeepSeek-V4 Flash,光缓存就能把内存吃光,模型本身都没地方放了。

所以antirez的做法是直接把缓存扔到硬盘(SSD)上。ds4把一部分KV状态做成可落盘、可恢复的缓存,让长提示词和agent反复续写时,不必每次从头处理。

这听起来有点离谱,因为硬盘比内存慢多了。

然而现代Mac SSD足够快,适合做KV缓存持久化和恢复。加上DeepSeek V4 Flash本身对缓存做过压缩,读写量不大,所以硬盘完全顶得住。

结果就是内存省出来了,100万token的超长对话真的在一台MacBook上跑起来了。

不过这不等于128GB MacBook可以毫无压力地把100万token全部拉满。

按照ds4自己的说明,2-bit模型本身已经要占掉大约80GB级别的内存,真正日常使用时,100k到300k上下文会更现实一点。

第三件事,是纯Metal原生路径。

antirez把所有优化都押在苹果电脑的GPU上。

因此他专门为苹果芯片写了一套代码,让DeepSeek V4 Flash能在苹果电脑上跑得飞快。

至于CPU,并不是这个项目的重点。README里也写得很直白,CPU模式目前还不稳定,甚至可能触发系统崩溃。antirez进一步表示,如果有人真想走这条路,后续大概还得靠社区来补救。

在M3 Max 128GB的MacBook Pro上,实测速度是每秒能生成26个字左右。M3 Ultra 512GB的Mac Studio上能跑到每秒36个字。

不算快,但写代码、调试这些日常工作完全够用。

更有意思的是,antirez是独自一人通过GPT-5.5完成的整个这个项目。

02

利好DeepSeek

根据外媒报道,DeepSeek目前正在寻求高达73.5亿美元的融资,梁文锋现在就处在这个关键的转折点上,用商业叙事取代DeepSeek过往的技术叙事。

那投资人看什么?不只是看模型跑分,不只是看API调用量,更看生态位和不可替代性。

一个海外知名开发大佬,愿意为你的模型写专用引擎,这本身就说明DeepSeek在海外有着一定的生态地位。

过去一年,中国开源模型的出海叙事里,主流衡量标准是benchmark,MMLU、HumanEval、SWE-bench,一串又一串的数字。

但有人愿意围绕你做二次工程,才代表你的模型被认可了。Anthropic用千问做实验,Cursor蒸馏Kimi,这种认可比分数更值钱。

antirez不是AI圈里那种什么新模型都要试一遍的博主

他选一个模型,然后还要花几周的时间去写专用推理引擎、做特制量化、搭HTTP服务层、做agent集成测试,显然是他认为DeepSeek值得。

这就变相等于,一个有信誉的第三方,在用自己的时间和名声给DeepSeek-V4背书。

说到国产模型出海,目前我能想到的路有两条。

一条是API被调用。你提供服务,别人付费使用,你是service provider,客户是consumer。

这条路很直接,也很现实,别人可以随时切换,你无时无刻都得对抗你的竞品,从性能到价格。

另一条是模型被改造。有人把你的权重拿走,做量化、做蒸馏、做专用runtime、做本地部署、做agent工具链。在这条路里,你的模型成了材料。

材料和服务的区别在于,材料会被嵌入到别人的工具链里,然后就很难被换掉了。

举个例子,某个开发者把ds4集成到自己的coding agent里,写了一堆配置文件、调试脚本、自动化流程。他的团队成员也都习惯了这套工具,公司的代码库里到处都是基于DeepSeek本地推理的调用。

这时候如果要换成别的模型,就不是“改个API key”那么简单了,而是要重新适配引擎、重写脚本、重新培训团队习惯。成本太高,大概率就不换了。

这就是“被嵌入”的性。

ds4把DeepSeek V4 Flash嵌进了Metal原生本地推理这个场景。截至发稿,Hugging Face上antirez那个deepseek-v4-gguf仓库,就已经有25000次下载了。



每一次下载,都意味着有人在自己的机器上跑起了DeepSeek,粘性也就这么一点一点的建立起来了。

更值得注意的是连锁效应。

Hacker News上有这样一条高赞评论,他说如果以后针对精确的GPU加模型组合构建超优化推理引擎会怎样?GPU越来越贵,抽象层去掉得越多,优化空间就越大。

这个方向一旦被验证,意味着每一代有分量的开源模型发布时,都会有人跳出来给它做专属引擎、专属量化、专属agent接入。

相当于是每一代模型都应该有一个自己的“antirez”,开发出一个自己的“ds4”。

DeepSeek V4 Flash正好踩在了这个起点上。

如果这套逻辑成立,那么后续每个V4 Flash的小版本迭代,都会天然地被嵌入到这个“一代模型配一个专用引擎”的循环里。

梁文锋成了第一个吃螃蟹的人。

DeepSeek也从一个模型品牌,变成海外开发者手里的基础设施材料。

对于现阶段的DeepSeek来说,这种“升维”非常重要。

03

焉知非福

讲完了利好,必须讲另一面。

目前来看,DeepSeek的核心商业化路径是API。开发者调用,按token付费,薄利多销。

这是DeepSeek最擅长的打法。

但ds4这种项目,本质上是在“劝退”一部分API用户。

你可以这么来理解,一个独立开发者或者小团队,过去用Claude Code或者DeepSeek的API跑coding agent。coding agent是高token消耗场景,长上下文、多轮对话、频繁工具调用、反复重试。

按token计费的话,一个重度agent的开发者每个月可能要花几千块钱的token费用。

然而现在他面前出现了另一个选项。

花几万块钱买一台128GB的MacBook Pro,然后跑ds4。

前期投入一次,之后推理没有边际成本,数据不出本地,延迟完全可控。

外网论坛上有个开发者分享了他的方法:日常写代码、改bug这些简单任务,全扔给本地的ds4跑,不花钱。只有遇到复杂的架构设计问题,才切换到云端的DeepSeek V4-Pro或者Claude Opus。

高token消耗的部分被本地化了,只有少量高价值调用还留在云端。

相当于一分钱没有给到DeepSeek,却在绝大多数时间都在使用DeepSeek。

同时,antirez采用的量化方法也是有“坑”的。

即使是不对称量化策略,只压MoE专家不压关键路径,也不可能完全没有质量损失。

外网论坛上已经有人发出了测试结果,ds4本地量化版本在超2000行代码的文件里偶尔丢失变量作用域,幻觉略多,MoE路由层对量化噪声尤其敏感。

这就引出了另一个更麻烦的问题,叫做体验解释权。

就像DeepSeek服务器崩了,我不知道是为什么崩的,我只会觉得是DeepSeek不行。

用户调用DeepSeek官方API,如果效果不好,他大概率会认为是DeepSeek自己的问题。但用户在本地跑ds4时,面对的是2-bit量化、Metal runtime、SSD KV cache、上下文截断、agent配置等一整套变量。

这里面任何一个环节出问题,最后往往被归因到“DeepSeek不行”。

别人帮你扩散模型,但他并不会帮你去维护口碑,主要是人家也没这义务。

更深一层看,“成为材料”和“成为平台”是完全不同的两件事,梁文锋更想要的是后者,可是ds4却让DeepSeek成为了前者。

材料只会被嵌入别人的工具链,不能为DeepSeek提供商业闭环,只有平台才掌握分发、计费、账户、数据、开发者关系和升级节奏。

DeepSeek如果只是提供权重,被antirez、Cursor、各种本地agent和第三方runtime拿去改造,它当然获得了名声。不过真正能留住用户的人,可能是那些工具链的开发者。

这就是开源模型的悖论。

模型越成功,越容易成为别人的底层能力;但底层能力如果没有抓住开发者的入口,就有可能被上层产品吃掉大部分商业价值。

所以ds4对DeepSeek不是简单的好消息,也不是坏消息。

可以肯定的是,对于DeepSeek来说,他们又有故事可以讲给投资人听了。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
S妈亲自出面回应两大争议,否认具俊晔和霖玥争遗产,称从不给具俊晔做饭自己只点外卖

S妈亲自出面回应两大争议,否认具俊晔和霖玥争遗产,称从不给具俊晔做饭自己只点外卖

可乐谈情感
2026-08-10 07:57:07
越南输麻了,赚的914亿全送中国,白忙活半年,贸易逆差倒亏百亿

越南输麻了,赚的914亿全送中国,白忙活半年,贸易逆差倒亏百亿

史之韵
2026-08-09 10:40:43
“聊什么推什么”,手机真的在24小时监听我们说话?保密观披露“偷听”真相:一款日活1亿的App若每天监听用户1小时,年运营成本达263亿元

“聊什么推什么”,手机真的在24小时监听我们说话?保密观披露“偷听”真相:一款日活1亿的App若每天监听用户1小时,年运营成本达263亿元

扬子晚报
2026-08-10 07:52:31
中国男足4战全胜夺冠!包揽4大奖,17岁新星获MVP,英超豪门垫底

中国男足4战全胜夺冠!包揽4大奖,17岁新星获MVP,英超豪门垫底

球场没跑道
2026-08-09 13:02:26
假如俄罗斯愿意转让外东北,我国用1600亿美元买回够不够?

假如俄罗斯愿意转让外东北,我国用1600亿美元买回够不够?

混沌录
2026-08-08 23:32:15
100多人靠换脸替考混进公安和政府,明码标价:省30万乡镇岗位8万

100多人靠换脸替考混进公安和政府,明码标价:省30万乡镇岗位8万

朗威谈星座
2026-08-09 01:33:38
企业都这么难了,还要落实劳动法吗?

企业都这么难了,还要落实劳动法吗?

杜千
2026-08-09 15:50:09
游客无视、建筑师膜拜:北马其顿首都的1974年粗野主义莲花大楼

游客无视、建筑师膜拜:北马其顿首都的1974年粗野主义莲花大楼

万物皆可科普啊
2026-08-09 00:49:38
200斤丑女谈2个男友,让1个男友陪她睡觉,另1个男友赚钱供他们吃喝

200斤丑女谈2个男友,让1个男友陪她睡觉,另1个男友赚钱供他们吃喝

汉史趣闻
2026-08-10 08:31:09
震惊!长鑫存储校招线下宣讲名单引热议,网友:有点飘,竟排斥西交大、哈工大等C9院校,北邮、西工大等也旁落

震惊!长鑫存储校招线下宣讲名单引热议,网友:有点飘,竟排斥西交大、哈工大等C9院校,北邮、西工大等也旁落

火山詩话
2026-08-09 07:40:11
曼联将签莱斯特城中场,进一队转会费低于1000万!其愿拒绝阿森纳

曼联将签莱斯特城中场,进一队转会费低于1000万!其愿拒绝阿森纳

罗米的曼联博客
2026-08-10 10:08:07
关键时刻,伊朗最高领袖与总统会谈,释放三重信号

关键时刻,伊朗最高领袖与总统会谈,释放三重信号

极目新闻
2026-08-10 08:25:22
离谱!中国女篮25岁投手,10中0两战怒砍0分,球迷:史上最差投手

离谱!中国女篮25岁投手,10中0两战怒砍0分,球迷:史上最差投手

南海浪花
2026-08-10 07:12:31
王菲没想到,曾被自己“嫌弃”的李亚鹏,如今再让所有人刮目相看

王菲没想到,曾被自己“嫌弃”的李亚鹏,如今再让所有人刮目相看

雅儿姐游世界
2026-08-08 09:36:50
9000万欧!皇马找到罗德里替代人选了,但买这个比罗德里还贵

9000万欧!皇马找到罗德里替代人选了,但买这个比罗德里还贵

体育世界
2026-08-09 17:04:36
复旦留学生被曝0成本约会让多名女生怀孕,社交账号下女生献媚评论看吐了

复旦留学生被曝0成本约会让多名女生怀孕,社交账号下女生献媚评论看吐了

浪花妈妈
2026-08-09 23:39:56
美国对中国三蹦子加征1157%关税,结果却被“反将一军”?

美国对中国三蹦子加征1157%关税,结果却被“反将一军”?

叶葉夜
2026-08-09 12:50:03
长途奔袭6000公里,“白海豚”创远洋台风登陆我国纪录,生命史超过15天是普通台风3倍以上,不确定其是否会达到“杜苏芮”的强度

长途奔袭6000公里,“白海豚”创远洋台风登陆我国纪录,生命史超过15天是普通台风3倍以上,不确定其是否会达到“杜苏芮”的强度

鲁中晨报
2026-08-10 09:06:04
张本智和4-1拿下冠军!赛后直言:就算王楚钦上场,我也毫不畏惧

张本智和4-1拿下冠军!赛后直言:就算王楚钦上场,我也毫不畏惧

星Xin辰大海
2026-08-10 07:57:28
阿森纳2-3多特!爆冷遭2连败 酋长杯4连冠终结 4000万新援独造2球

阿森纳2-3多特!爆冷遭2连败 酋长杯4连冠终结 4000万新援独造2球

我爱英超
2026-08-09 22:58:04
2026-08-10 11:16:49
字母榜 incentive-icons
字母榜
让未来不止于大。
2675文章数 8078关注度
往期回顾 全部

科技要闻

马斯克又放大招:星链要吃掉全球一半流量

头条要闻

媒体:美军高官特别想访华 曾将中国列为美国最大威胁

头条要闻

媒体:美军高官特别想访华 曾将中国列为美国最大威胁

体育要闻

阿森纳的39号球衣,有了最适合的主人

娱乐要闻

贾冰的一场饭局,给娱乐圈上了一课

财经要闻

宇树今申购 具身智能赛道将迎“估值锚”

汽车要闻

实打实的体量感 家越07能否成为20万内家用SUV新爆款?

态度原创

数码
时尚
家居
本地
公开课

数码要闻

三星与LG推迟扫地机器人全球上市 优先深耕韩国市场

入秋一定要拥有的衣服:针织背心,太好看了

家居要闻

2026建博会(广州) 公装联探展交流活动

本地新闻

课本里的童年,绍兴正上演

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版