![]()
编辑:kid
9 月下旬的全球 AI 评测圈,被一个突如其来的神秘“幽灵”彻底打破了平静。
在业界公认最具公信力的盲测平台 LMSYS Chatbot Arena 以及极客内部基准测试网中,一个挂着“gemini-3.8-flash”伪装标签的未公开模型悄然上线。在随后的数百场多轮对抗里,该模型展现出远超现有生产环境模型的推理与代码重构能力,把 9 月初刚刚登顶的各大旗舰模型拉下了王座。
多位顺藤摸瓜排查接口元数据的核心开发者证实,该模型的内部调用代号为“ARGON”(或 argon-d),极大概率是谷歌 DeepMind 尚未正式官宣的次世代王牌 Gemini 4 Pro 早期评估检查点。
泄露出的评测数据让整个开发者社区为之侧目:高达 1000 万(10M)Token 的极端上下文输入、单次 25.6 万 Token 的极限输出,以及在 Terminal-Bench、DeepSWE 等硬核软件工程基准上对 OpenAI 旗舰模型 GPT-6 Astra 的全面超越。在 9 月 29 日 OpenAI 开发者大会(DevDay)召开前夕,这场意料之外的跑分偷跑,提前吹响了大模型终极对决的号角。
![]()
01
LMSYS 盲测惊现幽灵模型,代号“Argon”引爆全网
这场技术风暴发端于竞技场盲测中一系列反常的高分战绩。
作为全球开发者与算法工程师盲测前沿大模型的核心阵地,Chatbot Arena 经常成为各大实验室匿名测试新权重的试验田。从 9 月 19 日开始,许多测试者发现自己匹配到了一个看似普通却异常强悍的测试节点。面对横跨数十个复杂文件、包含大量晦涩隐式依赖的项目重构需求,该节点几乎能在瞬间理清调用关系,给出一次性编译通过的补丁。
最初外界以为这只是谷歌 9 月 2 日发布的 Gemini 3.8 Flash 的优化微调版本。资深开发者通过抓包分析接口响应头、指令吞吐特征与返回指纹,终于捕捉到了关键线索:后台频繁出现未曾公开的系统特征标识“argon-d”。
![]()
伴随测试样本扩大,更多令同行震惊的评测报告在私密极客社区迅速流出。在专门考验自主终端操作能力的 Terminal-Bench 2.1 榜单上,Argon 跑出了惊人的断层第一;在模拟真实工业级软件缺陷修复的 DeepSWE v1.1 基准中,其单次解决率大幅领先行业平均水平。
一时间,“谷歌提前放出了 Gemini 4 预训练底座”的猜测传遍硅谷。各大实验室用代号打掩护、在盲测场提前收集对抗反馈的打法早已屡见不鲜,Argon 所展现出的技术代差依然让围观者感到震撼。
02
1000 万 Token 吞吐极限,整个代码库直接塞进上下文
在所有流出的技术参数中,最让工程界感到窒息的指标,无疑是其高达 1000 万(10M)Token 的有效输入窗口。
回看大模型的发展脉络,长文本处理经历了一场漫长演进。过去的模型受限于注意力机制的二次方计算复杂度,上下文往往被限制在数万到数十万 Token 之间。即便此前宣称支持百万级上下文的方案,在面对“大海捞针”(Needle In A Haystack)的深度交叉检索时,也经常陷入前记后忘、幻觉频出的窘境。
为了规避长文本带来的算力暴增与召回精度衰减,主流 AI 编程助手与企业工具不得不重度依赖检索增强生成(RAG)技术。RAG 的本质是通过向量检索把相关代码片段硬塞给模型,这种切片式喂养天生存在视野盲区,面对跨模块、多层继承与动态调用的复杂架构往往无能为力。
Argon 的 1000 万 Token 窗口彻底打破了这种妥协。1000 万 Token 相当于约 700 万到 800 万个英文单词,足以将 Linux 内核核心源码、Chromium 渲染引擎或者一个大型企业级 Monorepo 单体仓库的所有代码、提交历史与架构文档完整装入单次 Prompt。
泄露日志表明,在长达数百万 Token 的极端注入测试中,Argon 的细粒度事实召回准确率始终稳定在 99.5% 以上。配合高达 25.6 万 Token 的单次生成输出上限,开发者不再需要分章节反复微调,模型能够直接吐出包含完整前后端逻辑、配置文件与单元测试的工业级整套模块。
从依靠切片检索缝缝补补,到全量代码库瞬时加载,这种工程范式的颠覆,正是大模型原生上下文能力的胜利。
03
正面硬刚 GPT-6 Astra,前沿大模型决战系统级 Agent
Argon 此时的突然走漏,让整个 9 月的大模型战局变得极具戏剧张力。
就在 9 月初,OpenAI 携旗舰大模型 GPT-6 Astra 震撼登场,主打深度推理、自主工具调用与关键网络安全防御能力,一度被视作当下无人能撼动的王座捍卫者。Anthropic 也在同月推出了 Claude Fable 5.1,力图通过强化思维链锁定企业级市场。
![]()
Argon 的测试成绩直接给老对手送上了一记精准迎头痛击。对比数据显示:
终端与操作系统交互:在模拟人类工程师日常操作终端的 OSWorld 2.0 评测中,Argon 凭借对底层 Linux Shell 的原生理解,展现出完全自主的 Git 分支排查、环境容器构建以及自动化纠错能力,成功率超越 GPT-6 Astra 达 8 个百分点。
跨会话持久记忆:Argon 在调用过程中支持跨任务的状态快照保持,不需要外部数据库频繁中继,天然具备多 Agent 协作所需的记忆连续性。
算力底座突破:业内分析指出,Argon 能在如此恐怖的上下文尺度下维持高并发吞吐,得益于谷歌自研 TPU 算力集群与新型稀疏注意力机制的高效配合,在工程优化层面展现了深厚的全栈垂直整合优势。
距离 OpenAI 定于 9 月 29 日召开的 DevDay 只有短短几天时间。在山姆·奥特曼准备端出 Astra 的更多商业化生态落地之时,谷歌后院这具悄然点火的“重型武器”,让原本胜券在握的发布会多了一层浓厚的对决硝烟。
— 完 —
科技前沿进展每日见
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.