网易首页 > 网易号 > 正文 申请入驻

DeepSeek V4-Flash 官方 API 实测,8GB 显存旧笔记本能跑 Agent 和 Codex

0
分享至



为什么要在本地跑 DeepSeek V4-Flash?

想在本地跑大模型的理由通常很朴素:Agent 场景下一个任务要拆成好几轮工具调用,API 账单跟着轮数往上翻,多跑几次就肉疼;再加上不想让公司文档或私人对话经过第三方服务器,离线也能用更踏实。手头正好有一台 8GB 显存的旧游戏本和一台纯 CPU 的 Mac mini,本来想拿它们做个本地部署的双环境对比。

但查完硬件门槛就发现这条路走不通。DeepSeek 官方模型卡与 Ollama 的模型库口径一致:V4-Flash 是 DeepSeek-V4 系列的一部分,284B 总参数、13B 激活参数的 MoE(Mixture-of-Experts,混合专家架构,即把一个大模型拆成许多小的“专家”模块,每次推理只激活其中一小部分参数,从而省显存、跑得快)模型,支持 1M token 上下文。这个体量意味着,光是加载 Q4_K_M 这种主流量化版本的权重,就需要约 95.2GB 显存,若要留出 KV 缓存和系统开销的余量,业内建议准备 124GB 以上;另一份独立核算给出的数字更保守,在 8K 上下文下 Q4_K_M 大约要占 174GB 显存,Q8 约 303GB,目前没有任何一张单卡消费级显卡能完整装下这个模型。

8GB 显存、16GB 统一内存,离这个门槛差着一个数量级,不是能不能流畅运行的问题,是权重文件根本装不进去。于是最初“找台旧设备验证本地 Agent”的计划,第一步就撞了墙。真正能测的问题变成了:这两台装不下模型的设备,还能不能用来验证 V4-Flash 号称的 Agent、Codex、Responses API 这套新能力?答案是可以,但跑的是官方云端 API,不是本地权重——这也是这篇文章接下来实际记录的内容。

两条技术路线:Ollama 一键党 vs llama.cpp 折腾派

原计划里,Ollama 负责纯 CPU 的 Mac mini,llama.cpp 负责 8GB 显存本做极限量化压榨。查完两边的现状,这个分工也得重写。

先看 Ollama。Ollama 官方模型库里 deepseek-v4-flash 目前只挂了一个标签:deepseek-v4-flash:cloud。这个 :cloud 后缀不是某种量化格式,而是 Ollama 自己的云端代理功能——命令行界面还是熟悉的 ollama run,但推理实际在 Ollama 的服务器上跑,本地设备只负责发请求、收结果。换句话说,连 Ollama 官方都没有为这个模型准备一个能在本地显卡上真正跑起来的版本。

llama.cpp 这边的进展更真实一些。主线仓库通过 编号 24162 的 Pull Request 合并了对 DeepSeek V4 架构的支持,这套架构里最特殊的部分是两种新的压缩注意力机制——CSA(压缩稀疏注意力,把每 4 个 token 压缩成 1 个来降低计算量)和 HCA(重压缩注意力,压缩粒度更大,用于处理超长上下文)。但社区实测的硬件门槛依旧吓人:有开发者在 96GB DDR5 内存、RTX 3090 Ti 24GB 显存、AMD 9950X 处理器的机器上,用 IQ2_XXS 这种 2-bit 极限量化,短上下文下跑出约 150 tokens/s 的提示词处理速度和 15 tokens/s 的生成速度;另一位在 128GB 内存加 A5500 显卡的 ThinkPad P16 上,生成速度是 6.5 tokens/s。这些配置本身就远超 8GB/16GB,用的还是官方并不推荐、损失较大的极限量化。

所以本文实际验证的两条路线,变成了另外两条:一是用官方 API 配合 OpenAI SDK 直连 Responses API;二是把 VS Code、Cursor 里原本指向 Codex 云端的 Endpoint,换成 DeepSeek 的官方地址,验证它能不能当 Codex 的平替。两条路线的共同点是——显卡和内存大小已经不重要了,重要的是网络和 API Key。

从安装到第一次 Agent 调用

环境 A(8GB 显存笔记本、Ubuntu)和环境 B(Mac mini、macOS)这次的角色变了:它们不再是用来装模型权重的容器,只是两台发 HTTP 请求的客户端,理论上任何能装 Python 或 Node.js 的设备都能替代。

具体步骤是:在 DeepSeek 开放平台申请 API Key,安装 openai 这个 Python 包(pip3 install openai),把 base_url 指向 https://api.deepseek.com,model 参数设为 deepseek-v4-flash。用 Responses API 的调用方式是 client.responses.create(),不是老式的 chat.completions.create()——DeepSeek 官方文档写明,Responses API 目前只支持 deepseek-v4-flash,deepseek-v4-pro 的支持要到 2026 年 8 月初才上线;流式返回也不再是 SSE(Server-Sent Events,服务器主动向客户端推送数据流的协议)里熟悉的 data: [DONE] 结束标记,而是换成了带序列号的 response.completed / response.incomplete / response.failed 几种事件,这是照搬 OpenAI 旧代码时最容易漏掉的一处改动。

VS Code、Cursor 那边的配置本质上就是换一个 Endpoint 地址。DeepSeek 从 7 月 31 日的 0731 版本开始,原生支持 Responses API 协议,并针对 Codex 风格的智能体做了适配,包括 Codex 依赖的 apply_patch 这个文件编辑专用工具。在这之前,想把 Codex 接到 DeepSeek 上得自己搭一层转发代理——社区流传的方案是在本地 127.0.0.1:38440 起一个转发服务,在 Codex 使用的 Responses 协议和 DeepSeek 当时只支持的 Chat Completions 协议之间做翻译,现在这层代理原则上可以省掉了。




核心能力实测:Agent / Codex / Responses API 三件套

先看 Agent 多工具调用。DeepSeek 公布的基准数据显示,0731 版本相比 4 月的预览版,在 DeepSWE 这项基准上从 7.3 分跳到 54.4 分,涨幅约 645%;Terminal-Bench 2.1 拿到 82.7 分,Toolathlon 拿到 70.3 分。要强调的是,这些都是 DeepSeek 自己公布的成绩,目前还没看到独立第三方复现的对照数据,阅读时应按“官方宣称”对待,而非行业公认结论。真正值得琢磨的不是分数本身,而是这次提分完全靠重新训练,模型架构和参数量与预览版一字不差。这对工程判断的启示是:同一个模型光靠调整后训练方法,Agent 能力就能翻好几倍,说明当前限制开源 Agent 模型表现的瓶颈更多在训练配方而不是参数规模——对算力有限的团队,这其实是个机会,因为它说明继续堆参数不是唯一出路。

再看 Codex 兼容性和 Responses API 的坑。原生 Responses API 支持目前只覆盖 deepseek-v4-flash 一个模型,deepseek-v4-pro 还没跟上,这个限制在选型阶段很容易被忽略——如果一个 Agent 框架里既要用 Flash 做高频调用又要用 Pro 做复杂推理,协议层就得两套逻辑并存,不是换个模型名就能无缝切换。字段层面的兼容问题也不只是假设:开源 Agent 框架 OpenHands 上有一条已提交的 Bug,指出 DeepSeek 模型在思考模式下进行多轮对话时,如果客户端没有把上一轮返回的 reasoning_content 字段原样传回去,API 会直接拒绝请求。这是那种“第一轮 demo 很正常,第二轮突然报错”的典型协议兼容性问题,接入任何 Agent 框架时都值得专门测一遍多轮场景,而不是只测单轮对话。

费用和并发是另一个容易被评测文章忽略、却更早在生产里踩坑的点。官方报价是输入每百万 token 0.15 美元、输出每百万 token 0.29 美元,大约是 V4-Pro 的三分之一;并发上限方面,Flash 支持 2500 个并发请求,是 Pro 的 500 个的 5 倍。对需要频繁多轮调用工具的 Agent workload 来说,并发上限往往比跑分表更早成为实际瓶颈,也是发布通稿里最容易被一笔带过、却最该被工程师盯紧的一行数字。测试过程中还应该记录每次请求的 TTFT(Time To First Token,从发出请求到模型吐出第一个字符的等待时间,是 API 调用体感速度的核心指标),这个数字受网络链路影响很大,同一份代码在国内和跨境网络下的表现可能完全不同。



到底值不值得折腾?适合谁、不适合谁

先说结论:如果诉求真的是数据不出内网、彻底离线,DeepSeek V4-Flash 目前对个人和小团队都不现实——它的下限是 95GB 以上显存或内存,这已经是工作站甚至服务器级别的配置,8GB 显卡、16GB 内存的设备连权重都装不下,根本谈不上体验好不好。这类硬件真正能做的,是通过官方云端 API 把 Agent、Codex、Responses API 这几项新能力摸一遍,本质上和调用 GPT 或 Claude 的 API 没有区别,只是多了一层“权重开源、MIT 协议”的心理安慰,数据依然要出本地机器。

适合谁:想低成本验证 Agent/Codex 兼容性、对云端调用没有心理负担、看重 0731 版本较低单价的开发者,尤其是已经在用 Codex 或类似工具、想换个更便宜后端试试的人。不适合谁:真正需要私有化部署、离线可用,或者需要在 Pro/Flash 之间无缝切换协议的团队——这两类需求分别对应“先凑够 128GB 以上内存的机器”和“等官方把 Responses API 覆盖到 V4-Pro”,短期内都绕不开。

长期看还有一层隐患:即使真凑齐了硬件把权重跑起来,本地版本也不会跟着 API 侧的后训练更新走——0731 这次的能力提升目前只发生在 API 里,Hugging Face 上摆着的开源权重一度还是 4 月的预览版,这个版本差会一直存在,直到官方把新权重放出来为止。对追求“本地部署等于永久可控”的用户来说,这恰恰是最反直觉的一点:开源权重给了你所有权,但没有给你和云端同步的能力。

我们来聊一聊

正方:本地权重装不下不重要,重点是官方 API 把 Agent、Codex、Responses API 这些新能力打包好了,普通开发者不用等硬件降价就能验证,MIT 协议至少保证了未来自建的自由。

反方:说好的“本地部署”变成了“换个 Endpoint 调 API”,跟直接充值 GPT 或 Claude 有什么本质区别?MIT 协议在 95GB 显存门槛面前,对大多数人只是一句空话。

你更看重哪一种“本地”——是权重真的握在自己手里,还是只要工具链(IDE、CLI)跑在本地、调用便宜就够了?如果是后者,你还会在意开源协议是 MIT 还是别的吗?

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
iPhone 即将全系涨价,涨价幅度约 1000 元!

iPhone 即将全系涨价,涨价幅度约 1000 元!

XCiOS俱乐部
2026-08-03 14:59:42
提醒大家:这5样东西不能用“酒精擦”,一擦就废,很多人不知道

提醒大家:这5样东西不能用“酒精擦”,一擦就废,很多人不知道

Home范
2026-07-31 11:38:49
小三美照曝光,朱女士丈夫将公司股份减持到1%,不想给原配分财产

小三美照曝光,朱女士丈夫将公司股份减持到1%,不想给原配分财产

江山挥笔
2026-08-02 18:37:29
中国宿舍环境极差的5所大学,被新生集体吐槽:差点想回去复读

中国宿舍环境极差的5所大学,被新生集体吐槽:差点想回去复读

侃故事的阿庆
2026-08-01 00:31:29
今天才知道,张柏芝同意陈冠希拍照,竟是这3个现实又露骨的原因

今天才知道,张柏芝同意陈冠希拍照,竟是这3个现实又露骨的原因

秋姐居
2026-07-30 19:30:12
印专家怒斥中国“堵死开源路”,印度AI造不出大模型全怪我们?

印专家怒斥中国“堵死开源路”,印度AI造不出大模型全怪我们?

菁菁子衿
2026-08-02 12:38:02
中央政法委就开展深化扫黑除恶专项斗争有关问题答记者问

中央政法委就开展深化扫黑除恶专项斗争有关问题答记者问

界面新闻
2026-08-02 15:09:32
东野圭吾《恶意》很真实的一句:你永远不会知道,那些生活中看似跟你亲密的人,会在背后对你抱有多大的恶意

东野圭吾《恶意》很真实的一句:你永远不会知道,那些生活中看似跟你亲密的人,会在背后对你抱有多大的恶意

心理观察局
2026-08-02 06:54:11
林青霞:施南生在医院时,我和徐克每天24小时轮流守候

林青霞:施南生在医院时,我和徐克每天24小时轮流守候

南方都市报
2026-08-02 20:08:52
32岁陈梦高调官宣喜讯,官媒表态,她和樊振东早已拉开距离

32岁陈梦高调官宣喜讯,官媒表态,她和樊振东早已拉开距离

叨叨话影
2026-08-03 08:43:38
中英谈好赔偿款的那一刻,全世界都看明白了!12亿英镑要打水漂?

中英谈好赔偿款的那一刻,全世界都看明白了!12亿英镑要打水漂?

三农老历
2026-08-03 00:24:54
日本前首相隐晦说出真相:日本早就不是中国对手,别自作多情了!

日本前首相隐晦说出真相:日本早就不是中国对手,别自作多情了!

一口娱乐
2026-08-02 13:12:55
宏远消息!徐杰改口喊“杜书记”,陈老板婉拒郭艾伦、胡明轩报到

宏远消息!徐杰改口喊“杜书记”,陈老板婉拒郭艾伦、胡明轩报到

十级搞笑选手
2026-08-02 15:42:13
艾滋病剧增!多人无辜中招!医生:公众场合要坚持“8不碰”原则

艾滋病剧增!多人无辜中招!医生:公众场合要坚持“8不碰”原则

健康科普365
2026-08-03 16:30:14
母亲再婚后,继父的儿子把我拉进柴房里,我正要呼救,他让我闭嘴

母亲再婚后,继父的儿子把我拉进柴房里,我正要呼救,他让我闭嘴

千秋文化
2026-08-01 20:53:27
藏不住了!退休金差距只是皮毛,隐性福利不公,刺痛千万企退老人

藏不住了!退休金差距只是皮毛,隐性福利不公,刺痛千万企退老人

雪莉故事汇
2026-07-30 10:58:43
中国证监会主席吴清:将和香港监管部门进一步加强监管协作

中国证监会主席吴清:将和香港监管部门进一步加强监管协作

证券时报
2026-08-03 11:18:05
牙膏是老年斑克星?提醒:真正能够淡化老年斑的方式,只有这3种

牙膏是老年斑克星?提醒:真正能够淡化老年斑的方式,只有这3种

看世界的人
2026-08-02 16:27:03
我陪女总裁上山考察,她突然亲了我一口,然后说:你得对我负责

我陪女总裁上山考察,她突然亲了我一口,然后说:你得对我负责

千秋文化
2026-08-02 20:21:07
不是里弗斯!不是福克斯!拿着4897万年薪,却成了球队的“摆烂神器”

不是里弗斯!不是福克斯!拿着4897万年薪,却成了球队的“摆烂神器”

蜡笔小新爱体育
2026-08-03 15:44:43
2026-08-03 17:12:49
小柱解说游戏
小柱解说游戏
每天更新有趣的小游戏
163文章数 1071关注度
往期回顾 全部

数码要闻

最强捡漏王!网友用几十块买到原价4000多的内存:仅花零售价2.4%

头条要闻

上海一家人搬新房全家身体不适 家属自费检测后背发凉

头条要闻

上海一家人搬新房全家身体不适 家属自费检测后背发凉

体育要闻

常规赛MVP可以衡量常规赛成就吗?

娱乐要闻

奥德赛女主持递麦事件争议又升级了

财经要闻

厦门象屿青岛大火背后

科技要闻

“像魔法一样”的AI,只卖几分钱

汽车要闻

00后搞钱成功后的第一台车,真的不是BBA

态度原创

本地
教育
房产
数码
公开课

本地新闻

神仙也“蓉”漂,哪吒与八仙,皆是成都出品!

教育要闻

8本教育学心理学原创性教材出版

房产要闻

1700亿砸下!信息量巨大!海南甩出又一个超级规划!

数码要闻

驰为推出U300款MiniBook X 10.51"紧凑翻转本,质量920g

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版