![]()
8月13日傍晚,DeepSeek那条熟悉的蓝色鲸鱼旁边,忽然浮出一条黑色鲸鱼。同一天,它把V4 Pro正式版推上App、网页和API,又低调开源了一个叫Harness的"Agent底座"——24小时内,GitHub星标突破4万,插件仓库超过720个。一家以卖模型API著称的公司,为什么突然要重新定义"AI到底怎么干活"?这条黑鲸的真实野心,值得掰开看。
一、黑鲸出水:模型公司为什么要给自己装"身体"
DeepSeek给Harness单独开了个公众号,标识是一条黑鲸,和模型产品的蓝鲸明显区隔。团队负责人崔添翼早就把公式写在招聘里:Model+Harness=Agent。翻译成人话——模型是大脑,Harness是身体,大脑再聪明,没有身体也干不了活。
![]()
过去开发者调用DeepSeek,得把模型塞进Claude Code、Codex这些别人的"身体"里。Agent时代,决定一个任务能不能干成的,早已不只是模型本身。工具怎么调、文件怎么改、失败了重试还是换路、高风险操作谁批准——这些"身体"的判断,往往比模型更决定结果。DeepSeek补上这一环,等于官方下场,把模型之外那套运行系统,重新攥回自己手里。
二、同一个模型,换套外壳像换了个人
有个实验很说明问题。8月上旬,智能体工具公司Composio把同一个DeepSeek V4-Flash,接进8种不同的Harness,让它们完成30项真实多步骤任务——进Gmail、改Calendar、跑GitHub、发Slack。结果差距惊人:完成最多的过了20项,最少的只过14项;240次运行里只有129次成功。成本更夸张,同样完成16项任务,Claude Code、Codex、DeepAgents每成功一次分别约花0.195、0.081、0.045美元,差了四倍多。
![]()
这句话点破了Agent时代的真相:模型划定能力的上限,Harness决定这份上限最终能兑现多少、要花多少钱兑现。一个长任务跑下来,执行系统不停做判断,上下文留什么丢什么、何时调哪个工具、报错了信不信模型说"干完了"——任何一步没处理好,再好的思路也会在最后提交代码时翻车。
三、一切皆插件:把Agent做成乐高
Harness最核心的口号就一句:一切皆插件。模型适配器、工具注册表、会话日志、沙箱、存储、Agent主循环、任务调度、UI,没有一块"特权核心",全是插件。地基是一个叫Cordis的框架,讲究"时空可组合性":插件卸载,它注册过的服务、事件、副作用一并撤销;插件声明依赖,其他组件变了它能重新建协作。开发者不用改一行源码,配置里就能换掉任一能力,连主循环本身都能替换。
![]()
四种模式对应四种玩法:标准模式给完整工具集;PTC模式让模型写段代码来编排多轮调用;极简模式只留shell和文件编辑,专做基准测试;创造模式最激进,允许Agent在内存里试验插件、拼出新运行方式。再加上一份append-only的会话日志——模型看到的一切都留痕,任务跑偏了能回放当时它真正看到的上下文。可观测性,已经从调试工具变成Agent基础设施的标配。
数字经济应用实践专家骆仁童博士指出,插件化思维真正重构的,是AI的底层逻辑。传统AI工具像预制好的成品,功能固定难以调整;而Harness把模型、工具、技能、循环全部拆成可替换插件,等于不再把AI视作一个孤立的模型,而是无数插件协同工作的复杂系统。当"换引擎不用拆车"成为现实,开发者的自由度,就是产业重写的起点。
四、从卖Token到交结果
黑鲸出水的背后,是整个AI行业的一次转向。过去几年,大模型公司拼参数、拼跑分;进入2026年,头部模型基础能力快速收敛,单次问答差距越缩越小,价格战却越打越凶。单纯卖Token的天花板,已经肉眼可见。行业慢慢看清:AI的价值不在模型输出了多少字,而在场景落了地没有——同样烧一堆Token,闲聊问答价值微薄,修好一个Bug、完成一次功能开发,却能创造数倍商业价值。
![]()
DeepSeek这步,等于把付费锚点从"消耗了多少算力"挪到"完成了什么任务"。旧模式下,客户按Token调用量付费,模型有没有真解决问题无所谓;新模式下,谁能让AI在真实环境里把事办成,谁才收得到钱。Harness面对的,是Claude Code和Codex已经验证过的成熟市场,后两者背靠Anthropic和OpenAI,先发优势明显。DeepSeek选了条镜像路:模型开源、框架也开源、接口中立,用MIT协议把基础设施白送给开发者,赌的是"标准在开放侧"。
数字经济应用实践专家骆仁童博士认为,当基础模型能力趋同,单纯的价格战已无法支撑行业持续发展。Harness把价值锚点从算力消耗转向任务完成,背后是AI行业对价值本质的重新思考——只有把AI嵌进真实场景、解决具体问题,才能跳出Token单价的泥潭,创造更大的商业价值。这也是为什么DeepSeek敢让框架"换掉自己的模型",因为它赌的从来不是某一个模型,而是任务交付的入口。
五、黑鲸的赌注,与悬而未决的问号
8月13日这天,太平洋两岸各有一场发布。马斯克为Grok 4.6站台,称其"智能、快速且性价比极高";DeepSeek什么都没说,只是一味丢更新。喧嚣与沉默之间,是两种商业哲学的分野。
但潜力归潜力,问号也实实在在。其一,官方白纸黑字警告"未来将出现破坏兼容性的变更",v0.1的版本号意味着早期接入者要追版本、承担接口变动成本。其二,和打磨两年、生态成熟的Claude Code比,Harness外壳还很早期,开箱即用体验还有距离。其三,append-only日志会把系统提示词、思维链甚至敏感上下文落盘,一旦接云端沙箱或第三方插件,数据边界得自己把关。其四,默认模型、内置适配器、百万上下文都指向自家API,中立能坚持多久,是社区最关心的路线问题。其五,框架免费开源,收入最终仍要靠API——8月16日起V4系列实行峰谷计价,高峰输出价涨到27元/百万Token,为现行的4.5倍。
把这几件事连起来看,Agent战争的下一程已经清晰:上半场拼谁模型更聪明,下半场拼谁的执行层与生态位更稳。谁掌握Harness,谁就更接近真实任务的入口,也更容易影响模型选择、工具分发和开发者工作流。
![]()
六、清单:Agent下半场的三个变量
第一,标准争夺。MIT协议只能降低采用门槛,却自动长不出生态。开发者愿不愿意持续维护插件、企业敢不敢把生产权限交给第三方组件,才决定这套架构能游多远。
第二,插件生意。搜索、存储、沙箱、监控、安全审计,每个环节都能做成插件收费。对云厂商和中间件公司,一个开源、可组合的Agent底座,意味着新的变现层。
第三,可解释权。当Agent的每一层都变得可替换、可回放,用户第一次拥有了对AI"怎么干活"的审视权。这或许才是黑鲸最深远的影响——不是又多了一个编码工具,而是把"AI如何工作"的定义权,交还给了社区。
一条黑鲸刚出水,离畅游还早。但它戳破了一层窗户纸:AI竞争的重心,正从"会思考的模型"滑向"会干活的系统"。当算力不再是稀缺品,能替你把事办成的那套运行层,才是下一座金矿的入口。
模型划定上限,Harness决定你能兑现多少——AI的下半场,拼的不是谁更聪明,是谁把活干成了。
你更看好闭源一体化的Claude Code、Codex,还是开源可拼的DeepSeek黑鲸?或者说,你愿意把自己的生产环境,交给一个v0.1的预览版吗?
DeepSeek相关话题:
商道童言(Innovationcases)欢迎评论、点赞和分享哦!~~
热推新书《AI提问大师》《DeepSeek应用能手》现已上架!
![]()
免费电子书:|||
数字经济应用实践专家 骆仁童主讲课程
企业数智化:||
产业数字化:||
数字化转型:||||||
创新与思维:|||
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.