我的上一篇文章讲的是各家公司发现AI账单暴涨后纷纷设置支出上限的事。那篇文章发布后,一个合理的反应是本地大模型圈子里喊了一整年的口号:别租Token了,开源模型现在够好了,自己机器上跑就行。 支持这个建议的基准测试有个硬件问题。那些真正跑了测试的文章,用的都是Mac Studio或者128GB内存的M5 Max笔记本。而那些标题党故事更离谱。DeepSeek V4 Flash确实"能跑在MacBook上",前提是那台MacBook是128GB内存、售价约5000美元的顶配。Kimi K3开源权重光是加载就需要八块H100。今年夏天甚至有一篇教程的标题直接就叫《你跑不动的开源权重》。 我的笔记本是2021年的M1 Pro,16GB内存。它已经用了快五年,我怀疑它比那些基准测试里的任何机器都更接近普通开发者的真实配置。所以我决定测一测,16GB内存到底能跑什么。 测试设置 我测了五个模型,全部通过Ollama拉取,全部控制在16GB内存能装下的范围内: - qwen3.5:4b和qwen3.5:9b,阿里巴巴当前的小模型,两个默认都会先思考再回答 - gemma4:e4b-it-qat和gemma4:12b-it-qat,谷歌当前的小模型家族,用的是量化感知训练版本 - qwen2.5:7b,2024年底的旧模型,用来检验这一年里小模型到底有没有进步 大家真正在讨论的那些新模型一个都没进测试列表——这本身就是个发现。glm-4.7-flash和qwen3-coder听起来都很小,但下载包都是19GB。Qwen3.8-27B,在我跑测试那一周刚发布,需要约17GB内存,而且权重当时还没开放下载,要等这篇文章发布的那一周才放出来。在16GB内存的机器上,你能真正跑的模型列表,比网上讨论给人的印象要短得多。 测试任务是数据工程师一周里会遇到的21道题,分六个类别:在预置数据库上写DuckDB SQL、修复带失败测试用例的Python代码、从Airflow日志和账单邮件这类混乱文本里提取JSON、以及预测……
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.