关注 Agent 本地部署的朋友应该已经刷到消息了,Unsloth 把 DeepSeek-V4-Flash-0731 的 GGUF 版本放出来了,这个 284B 参数的模型,可以不走 API,直接在自己的机器上跑。
![]()
我把 Unsloth 的官方指南和 DeepSeek 的文档完整看了一遍,发现能跑和跑得舒服之间还有不少事要说清楚。配置门槛卡在哪、量化版本怎么选、用什么工具部署,这篇一次讲明白,看完你就知道自己的机器行不行。
简介
DeepSeek-V4-Flash 是 DeepSeek V4 系列里的快速版,总参数 284B,每次推理只激活 13B,上下文支持到 1M。0731 这个正式版把 Agent 能力拉高了一大截,官方基准里好几项分数直接翻倍,连参数更大的 V4-Pro 预览版都被它超了。
Unsloth 给它做了全套 GGUF 量化版本,用 Unsloth Studio 或者 llama.cpp 就能在本地跑起来。门槛写在前面:最低 92GB 总内存,想跑得靠谱,128GB 起步。这里说的总内存是系统内存加显存,Mac 用户直接看统一内存就行。
机器够不够格,看这一段就行
量化版本有一堆,但不用都记住,按自己的内存对号入座:
你的机器
推荐版本
64GB 及以下
跑不了
最低的 1-bit 也要 92GB,别折腾
128GB
UD-IQ3_XXS
3-bit,文件约 103GB,比较合适的选择
160GB 以上
UD-Q4_K_XL
约 155GB,接近无损
192GB / 256GB
UD-Q8_K_XL
约 162GB,官方认定的无损版
这里有个容易踩的坑,3-bit 的文件只有 103GB,不代表 103GB 内存就能跑。模型加载完,KV Cache、上下文、系统本身还要继续占内存,官方给的底线是 110GB,实际用的时候建议统一按 128GB 去算,省得跑到一半出问题。
还有个细节值得说一下:
Unsloth 一开始把 4-bit 标成了无损,后来文档改过来了,UD-Q4_K_XL 是接近无损,真正无损的是 UD-Q8_K_XL。两个版本只差 7GB,所以内存够的话没有什么理由选 Q4,直接上 Q8。这个模型本身是什么水平
0731 这个正式版,主要加强的是 Agent 能力。
官方给的 9 项 Agent 基准测试里,它比自己的预览版涨了一大截,也把 V4-Pro 预览版超了。挑两个数字感受下:Terminal Bench 2.1 从 61.8 涨到 82.7,DeepSWE 从 7.3 涨到 54.4。涨成这个样子,基本就是冲着 Agent 场景去的,比如挂在本地当编程助手用。
![]()
速度方面不用太担心,模型总参数是 284B,但每次推理只激活 13B,Unsloth 官方演示里 Q8 版本跑到了 49.7 tok/s,具体速度取决于你的硬件和选的量化版本。
另外它支持三种思考强度,Non-think、Think High 和 Think Max。日常用 Think High 就够了,普通问答切 Non-think 会更快。Think Max 需要至少 384K 上下文,内存和等待时间都得跟着往上涨,真有难题再开。
部署有两条路第一条,图省事,用 Unsloth Studio
Mac、Linux、WSL 打开终端:
Windows 用 PowerShell:
然后浏览器打开 ,第一次启动会让你创建密码。进 Model hub 搜 DeepSeek-V4-Flash-0731-GGUF,按内存选量化版本,点下载就行。下载量在 100GB 到 162GB 之间,硬盘空间提前留出来。
![]()
Studio 的好处是省心,聊天模板和推理参数都自动配好了,界面上可以直接切换思考强度。提醒一句,只在本机用的话,启动命令别加 ,这个参数会让同一个网络里的其他设备访问到你的服务,家里内网还行,公网环境别这么开。
第二条,要接自己的工具,用 llama.cpp
这条路有个必须知道的坑,老版本 llama.cpp 跑这个模型,第二轮对话开始会吐乱码,原因是 prompt caching 和模型的兼容问题。Unsloth 已经定位并修掉了这个问题,修复在 里,所以用之前确认你的 llama.cpp 包含这个修复,拉最新代码自己编译一遍最稳。
128GB 机器从 3-bit 开始:
内存够、想跑无损版的,把模型名换成 就行。
Unsloth 给的推荐参数是 ,上下文先从 32768 开始,确认模型、速度、内存都正常了再往上加。拿它跑 Agent 或者代码任务的话,top_p 改成 0.95。1M 上下文虽然支持,但上下文越长额外占用越大,别一上来就拉满。
想接 Claude Code 这类工具的话,用 llama-server 起一个 OpenAI 兼容的接口就行,剩下的就是改个 endpoint 的事。
最后聊聊
本地跑 DeepSeek-V4-Flash 这件事,现在是真成立了。但门槛也确实不低,128GB 内存起步,说白了就是 Mac Studio 和大内存工作站这个级别的机器。普通 32GB、64GB 的电脑跑不起来,可能需要其他方法才行,1-bit 那种版本就算勉强跑起来,质量损失也摆在那,没什么实用的意义,只能证明一下而已。
还有个问题得想清楚,DeepSeek 官方 API 的价格本来就压得很低,本地跑到底图什么。我自己的答案就两条,一是数据不出机器,二是用起来不心疼。偶尔跑几个脚本验证想法的,直接调 API 更划算;想让编程工具天天挂着本地模型用的,或者手头的数据根本不能出门的,直接上手搭。
Unsloth 说更小的量化版本还在做,128GB 以下的机器可以再等等,按这个模型的迭代速度,门槛往下走是早晚的事。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.