网易首页 > 网易号 > 正文 申请入驻

横跨大西洋11小时,中国开发者用Mac跑Llama 70 B?评论区吵翻了

0
分享至


新智元报道

编辑:Aeneas

【新智元导读】一位中国开发者,在横跨大西洋的航程中,在飞机上用 MacBook 本地跑 Llama 70B,整整 11 小时没有网络,帖子瞬间在X上爆火!但是随后,越来越多网友发现,这故事不太对啊?

一位中国开发者,在横跨大西洋的 11 小时航程中,拒绝了 25 美元的机上网络,却在万米高空完成了一整套复杂的客户项目交付?

没有 Cloud API,没有 Anthropic,没有 OpenAI,甚至没有一格信号。

只有一台 MacBook Pro M4、一段自己写的编排脚本,以及Llama 70B这个本地AI模型,然后就把项目跑通了?

舷窗外是白云与蓝天,没有 WiFi;小桌板上是一台 MacBook,终端开着两个窗口,本地运行着一个推理服务器

因为太过炸裂,这个帖子一经发出,就在技术社区传开了。

本地推理的时代,真的来了?


在万米高空,

用MacBook跑Llama 70B

据说,故事的主角是一位中国开发者。

在飞往大洋彼岸的靠窗座位上,他打开64GB内存的MacBook Pro,面对的是堆积如山的客户任务队列。

接下来整整11个小时,都没有网络。

换做普通人,此刻已经乖乖掏出信用卡,支付那昂贵且延迟极高的 25 美元机上 Wi-Fi。

但他选择了另一条路:本地推理。

他启动了通过llama.cpp运行的Llama 3.3 70B

生成速度 71 tokens/秒,上下文约 60,000 tokens,内存占用 48.6 GiB / 64 GiB,起飞时电池剩余 3 小时 21 分钟。


为了让这个庞然大物在64GB内存的机器上跑起来,他甚至为自己编写了一个「离线编排器」脚本。

最令人拍案叫绝的,是他给AI下达的系统提示词。

你是一个运行在单台 MacBook 上的离线编排器。没有网络。你唯一的资源是 /Users/dev/work 下的本地文件、localhost:8080 的 Llama 70B 推理服务,以及 3 小时 21 分钟的电池预算。

处理 /Users/dev/work/queue.jsonl 中的任务队列(每行一个客户任务)。对每个任务:起草 → 运行本地评估 → 保存产物到 /Users/dev/work/done/。每 12 个任务保存一次上下文检查点,以便更换电池后恢复。仅在队列为空或电池低于 5% 时停止。

因此,这个系统完全清楚自己所处的困境。

它知道自己未来 11 小时与世隔绝,知道内存和电池是有限的奢侈品,甚至知道在飞机降落前,它必须独自处理所有的逻辑。

系统在一个循环中运行:从任务队列中取出一个任务,进行推理处理,保存生成结果,写入检查点。一个接一个,就这样持续执行。


只有当电量低于 5% 时,调度器才会自动暂停,等待笔记本切换到备用移动电源,然后从上一次的检查点继续运行。

飞行过程中,系统日志里写下了这样的内容:

「已保存上下文检查点 8 / 12(pos_min = 488,pos_max = 50118,大小 = 62.813 MiB)」

「已恢复上下文检查点(pos_min = 488,pos_max = 50118)」

「提示处理进度:n_tokens = 50 / 60,818」

「任务 37016 完成 | 处理速度 = 71 tokens/s → 输出至 /Users/dev/work/done/proposal_westside.md」

有人惊呼:这是我过去一年里见过的最干净利落的离线 AI 工作流程!

11 小时航程,WiFi 花费为 0,当飞机轮子触碰跑道的那一刻,他合上电脑,所有的客户提案已经整整齐齐地躺在done/文件夹里。

系统不再是一个只会复读的复读机,而是一个具备资源意识的管理者

这正是「Self-aware Computing」最迷人的地方。

网友打假:

技术神话,还是「赛博爽文」?

不过,文章在社区疯传后,很快引来了技术极客们的质疑。

资深开发者们纷纷掏出计算器,开始疯狂「对线」。

第一刀:内存与权重的「不可能三角」

Llama 3.3 70B 如果以 BF16(半精度)运行,光模型权重就需要约140GB内存。要在 64GB 的 MacBook 上跑起来,简直就像把大象塞进冰箱。

64GB 内存大概率只能跑 4-bit 量化版本,算上 60k 的上下文 KV Cache,内存占用至少也要 40GB+,BF16 绝无可能。

非要说的话,要在64GB上跑70B,只有一条路——量化。4-bit量化后模型约35GB,加上KV缓存和系统开销,勉强能塞进去。


但量化版本和BF16是两回事,精度、推理质量都会打折扣。

帖子里写的是「bf16」。看起来,这个细节要么是不懂,要么是故意的。





第二刀:71 tokens/s 的「神仙速度」

帖子声称生成速度71 tokens/s。

根据 M4 芯片的实际表现,本地运行 70B 规模的模型,生成速度通常在 5-12 tokens/s 之间。

71 tokens/s 是什么概念?这几乎是顶级 H100 集群的响应速度。

「这个速度可能是 8B 模型或者是某种极致的投机采样,70B 跑出这个速度,MacBook 怕是要起火。」

评论区一位用户直接亮出自己的实测数据:M5 Max 128GB(注意,128GB,是帖子里设备内存的两倍),跑同款模型量化版llama.cpp,实测12.8 tokens/s。



更高端的硬件,跑更轻的量化版本,速度反而只有帖子声称的五分之一,因此,原帖中说的速度几乎不可能实现。

第三刀:11小时续航

帖子中提到的「更换电池」引发了老用户的集体怀旧:现代 MacBook Pro 都是一体化设计,所谓的「换电池」,大概率是切换到了大功率的备用充电宝(如百瓦快充移动电源)。

MacBook Pro M4 Max官方标称续航约18小时,那是轻度使用。持续满载跑70B推理,GPU和内存全程拉满,实际续航会大幅缩水。

虽然帖子里提到「切换到备用充电宝后恢复」——但跨大西洋航班经济舱的USB口功率通常只有7.5W到18W,而M4 Max满载功耗超过40W。

因此,续航11小时这个说法几乎站不住脚。


故事是假的,但范式转向是真的

面对质疑,我们需要剥开数据的水份,看清这件事背后真正令科技圈高潮的原因。

长期以来,我们已经习惯了「云端成瘾」。

没有 GPT-4 的 API,很多开发者甚至不知道该如何写代码;没有网络,AI 就变成了一个哑巴。

现在,本地推理,确实在发生一场静悄悄的革命。

2024年,在笔记本上跑7B模型还需要各种技巧。

2026年,M4 Mac上跑70B量化版已经是日常操作。虽然速度不快,大概10来个tokens/s,但已经能用。

真实的使用场景不是「飞机上交付完整项目」这种听起来很爽的叙事,而是一些更朴素的东西,比如离线环境下的文档问答,隐私敏感场景下不想把数据传上云等等。

这些场景不性感,但实用。

现在,llama.cpp的mlx后端已经针对Apple Silicon做了深度优化,Ollama也把部署门槛压到了一条命令。

即便 71 tokens/s 的速度存疑,BF16 的精度可能有夸张,但这种「在孤岛上建立文明」的技术浪漫主义,才是最牛的。

未来,最顶尖的开发者或许不再是那个最会调优云端 Prompt 的人,而是那个能在资源枯竭、完全离线的极端环境下,手搓出一个「自感知、自循环」AI 系统的人。

下一次坐飞机,你准备好带上你的「数字大脑」了吗?

参考资料:

https://x.com/servasyy_ai/status/2050098091789828376

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
比亚迪新车官宣:纯电续航全球第一!尺寸和奔驰S一样

比亚迪新车官宣:纯电续航全球第一!尺寸和奔驰S一样

米粒说车唯一呀
2026-08-10 19:48:29
57岁王菲携李嫣现身北京机场,母女同框气质惊艳:时尚与温情的碰撞

57岁王菲携李嫣现身北京机场,母女同框气质惊艳:时尚与温情的碰撞

挚爱你的红太狼
2026-08-11 12:45:29
12月25日勒布朗父子圣诞对决 萨凡娜被推上风口浪尖

12月25日勒布朗父子圣诞对决 萨凡娜被推上风口浪尖

日常碎碎念啊
2026-08-12 03:49:27
轮换用了半年,DeepSeek、豆包、kimi、千问我最终留下谁

轮换用了半年,DeepSeek、豆包、kimi、千问我最终留下谁

侃故事的阿庆
2026-08-05 02:52:47
当年亿万鲜血推翻的私有制,如果今天全盘回归,革命还有意义吗?

当年亿万鲜血推翻的私有制,如果今天全盘回归,革命还有意义吗?

网络易不易
2026-08-10 11:33:59
最清醒两位上将:一个归隐南京不顾不问,一个身居京城从不参会

最清醒两位上将:一个归隐南京不顾不问,一个身居京城从不参会

麓谷隐士
2026-08-11 07:25:07
马斯克母子齐夸中国!强烈推荐来华旅游,国外网友彻底炸锅

马斯克母子齐夸中国!强烈推荐来华旅游,国外网友彻底炸锅

雷科技
2026-08-11 18:49:28
国资委唯一亲儿子被买爆?手握88亿订单,社保加仓162%,北向加仓102%,中东土豪加仓37%

国资委唯一亲儿子被买爆?手握88亿订单,社保加仓162%,北向加仓102%,中东土豪加仓37%

财报翻译官
2026-08-11 15:32:07
黄瓜再次成为关注对象!多名院士发现:常吃黄瓜的人,有7个变化

黄瓜再次成为关注对象!多名院士发现:常吃黄瓜的人,有7个变化

任医生聊健康
2026-08-03 08:40:30
1953年9月18日,毛泽东在会场当众怒斥梁漱溟,全场几百人噤若寒蝉

1953年9月18日,毛泽东在会场当众怒斥梁漱溟,全场几百人噤若寒蝉

纪史行者
2026-08-11 22:46:41
名嘴直言:国乒只有一人能压制张本美和,陈幸同王艺迪比赛暂停教练只会说扛一扛

名嘴直言:国乒只有一人能压制张本美和,陈幸同王艺迪比赛暂停教练只会说扛一扛

尘语者
2026-08-11 17:44:25
释永信被女徒弟爆料,凌晨4点去他房间,拿到皈依证就算师徒关系

释永信被女徒弟爆料,凌晨4点去他房间,拿到皈依证就算师徒关系

汉史趣闻
2025-07-30 09:57:38
“铁饭碗”不铁了:全国教师开始“两连降”,裁员潮正在逼近

“铁饭碗”不铁了:全国教师开始“两连降”,裁员潮正在逼近

东亚财评V
2026-08-11 19:38:23
上海被淹的真正原因找到了,评论区炸锅…

上海被淹的真正原因找到了,评论区炸锅…

慧翔百科
2026-08-11 08:32:43
“新型出轨方式”正悄然兴起,不私会不开房,却正在毁掉千万家庭

“新型出轨方式”正悄然兴起,不私会不开房,却正在毁掉千万家庭

流史岁月
2026-08-10 10:46:45
人类史上十大科学家权威排行:以奠基影响力为评判标准

人类史上十大科学家权威排行:以奠基影响力为评判标准

粤语音乐喷泉
2026-08-06 00:31:31
重磅!深圳居民医保新规2027年起正式实施!

重磅!深圳居民医保新规2027年起正式实施!

深圳本地宝
2026-08-11 13:14:51
1942年日军在华北修了上万座炮楼,荒山野岭根本接不上电线,油料也十分紧缺,日军当年想出的这套供电法子,很多人听了都觉得意外

1942年日军在华北修了上万座炮楼,荒山野岭根本接不上电线,油料也十分紧缺,日军当年想出的这套供电法子,很多人听了都觉得意外

磊子讲史
2026-08-11 11:09:43
宇树科技中签号出炉

宇树科技中签号出炉

新京报
2026-08-11 19:35:15
南京千亿国企掌门人突然投案,他从自来水公司起步,曾任城管局、交通局副局长

南京千亿国企掌门人突然投案,他从自来水公司起步,曾任城管局、交通局副局长

湘财Plus
2026-08-11 16:59:12
2026-08-12 06:16:49
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
15917文章数 66998关注度
往期回顾 全部

科技要闻

AI大战变天:扎克伯格突然回头

头条要闻

郭兰英逝世 曾演唱《我的祖国》《南泥湾》

头条要闻

郭兰英逝世 曾演唱《我的祖国》《南泥湾》

体育要闻

NBA老顽童,抽着大麻喝着小酒告别了

娱乐要闻

“雅典娜”确认被害 细节令人发指!

财经要闻

AI泡沫的剧本,是2008年的次贷危机?

汽车要闻

闪充/天神之眼B/云辇-C 2027款海豹06售9.99万元起

态度原创

房产
教育
旅游
家居
军事航空

房产要闻

突发,崖州湾又有大动作!

教育要闻

都是日文惹的祸?11岁女孩要穿女儿服,照片却被家长们骂惨了

旅游要闻

住在拓东路几十年,今天才弄明白家门口这座老城,对昆明有多重要!

家居要闻

2026建博会(广州) 公装联探展交流活动

军事要闻

乌克兰袭击俄罗斯炼油厂 已致13死78伤

无障碍浏览 进入关怀版