![]()
近日,由清华大学深圳国际研究生院智能机器人实验室刘厚德教授领衔、王立博博士后担任 AI 首席研究员的大模型团队,正式发布了 VeriLoop Coder-E1—— 一款基于 Qwen3.6-27B 构建、面向仓库级代码修复与智能体式软件工程任务的开源垂类代码模型。
该模型在 Hugging Face 四项软件工程 Benchmark 中分别取得 SWE-bench Verified(85.20)、SWE-bench Pro(62.38)、Terminal-Bench 2.0(76.40)和 DeepSWE(33.63)的成绩。
截止 2026 年 7 月 27 日,在 32B 及以下开源模型的比较范围内,VeriLoop Coder-E1 在 SWE-bench Verified、SWE-bench Pro 和 Terminal-Bench 2.0 中排名第一,在 DeepSWE 中排名第二 。在所有的开源模型中,包含一众知名模型的情况下,分别排名为第二、第一、第一和第五,统计情况如下表。
![]()
![]()
![]()
![]()
说明: 对模型综合能力作出全面评估,需明确基准评测的证据边界。基准评测仅反映模型在特定任务分布、评测协议与运行条件下的相对表现,不能据此推断其在真实软件工程环境中的整体能力。因此,本文不将四项基准评测成绩视为模型能力的最终裁决,仅客观记录相关评测结果与排名事实。
数据来源:Hugging Face 对应 Benchmark 排行榜,见 [5]—[8]
Veriloop Coder- E1 背后的循证螺旋
VeriLoop Coder-E1 的核心优势来自窄域 PEFT 微调与 Self-Harness 的协同。
在冻结 Qwen3.6-27B 基座的前提下,项目以少量可训练参数强化模型面向真实软件工程任务的专门能力,包括工具契约遵循、证据 — 结论绑定、不确定性识别、验证失败解释、局部修复与回滚边界控制;相应微调权重通过可拆卸的 Surface Host Adapter 外挂加载,而不改写原始基座权重。
Self-Harness 则负责将这些能力组织为围绕同一任务持续收敛的多轮执行链:首轮依据问题描述、仓库上下文、接口约束和验收条件生成候选产物,后续轮次再将已生成代码、测试错报、工具回执、接口冲突、反证结论和修复约束重新编译为不同的结构化 Markdown 工作包,使模型在继承已确认结果的基础上,针对被证据否定的局部问题继续分析和修复,而不是对同一提示进行机械重试。官方模型与技术博客见 [1]—[2]。
该团队的方案证实了 Loop 不再只能是同一方法内部的反复试错,而是形成了一条由证据持续约束和推动的闭环:每一轮生成都必须接受反证、探索、修订与复验,只有通过验证的纠正才有资格进入下一轮并影响后续方法选择。
当系统不只是修正当前结果,而是让经验证的纠正进一步改变未来如何发现问题、界定证据、发起探查和实施修复时,这一闭环便上升为 VeriLoop 所强调的循证螺旋(Evidence-Governed Spiral)。这一执行链遵循「证 — 伪 — 探 — 修 — 验 — 化」 的循证逻辑。关于其完整概念界定,详见 VeriLoop 官方技术博客 [2]。
![]()
图 1|VeriLoop 循证螺旋:证 — 伪 — 探 — 修 — 验 — 化的验证门控与方法级递归改进机制
循证不是用信息为既有结论提供装饰或支持,而是要求证据能够挑战并改变系统当前的认识、行动或未来探究方式;循证螺旋则进一步将这种可纠正性组织为跨轮次演化机制,使经验证且边界明确的纠正不仅修复当前结果,还能够改变系统下一轮如何界定问题、选择证据、发起探查、实施修复与决定停止。
在 VeriLoop 中,这一机制被具体化为「证 — 伪 — 探 — 修 — 验 — 化」的连续链条:
- 「证」负责收集并筛选能够实质改变当前判断的代码、接口、测试、执行轨迹与工具回执,同时明确已知、未知、假设及证据边界;
- 「伪」主动检验候选方案的前提、实现与正确性声明,推导可观察的失败条件,定位矛盾、错误与证据缺口;
- 「探」只围绕已经暴露的决定性缺口继续检索代码、追踪调用关系或执行必要工具,避免无目的扩张上下文;
- 「修」依据失配层级,将错报和反证结果转化为边界明确的局部或结构性修复条件,并保留变更依据与回滚路径;
- 「验」要求修订后的产物重新接受同一任务契约、测试体系与执行环境的检验,以确认修复真实有效,并排除随机性、评估偏差与环境偶然性;
- 「化」则只将通过验证门的结果、失败类型、适用条件与有效修复原则压缩为下一轮可调用的证据状态、方法约束与预防规则。
由此, Loop 不只是增加提示词长度、推理轮次或模型调用次数,而是让每次调用都由上一轮产生的新证据改变其判断、探索和修复方式,使一次性代码生成转化为可反证、可回滚、可验证并能够积累有效经验的软件工程闭环。
通向递归式自我改进之路
当系统已经能够反复生成、修订并验证结果,真正的问题便不再是「能否修改自身」,而是:什么使一次纠正有资格进入未来的纠错机制?
Anthropic 所代表的一类前沿愿景,将递归式自我改进理解为人工智能逐步参与乃至承担后继系统的设计、开发与验证,使本轮获得的能力继续增强下一轮研发能力。
但在构建 VeriLoop Coder-E1 的过程中,团队发现,系统即使能够修改 Prompt、工具策略、记忆、评价器、训练流程乃至模型本身,也只能证明自我修改权限扩大,不能证明真实改进已经发生;若目标、证据、评价与继承标准仍受同一组未经检验的假设支配,修改越深,奖励缺口、评价偏差与认知盲点越可能被固化到更高层机制中。
由此,团队重新定义递归式自我改进:它不是系统反复修改自身,而是经证据纠正的方法开始改变系统未来如何发现、判断和纠正错误,并且该方法仍可被新的证据再次证伪。
「一种理论若不可能被任何可设想的事件所反驳,它就不是科学理论。不可反驳性并非理论的优点,尽管人们常常这样认为,恰恰是它的缺陷。」
—— 卡尔・波普尔,《猜想与反驳》
循证螺旋正是将这一可反驳性转化为递归式自我改进的认识与工程门控:系统先界定当前主张、假设及证据边界,再为其提出可观察的失败条件;探究只针对足以改变判断的决定性缺口;修订作用于与失配相对应的层级,既可修复当前结果,也可调整问题分解、证据义务、工具选择、验证策略或停止条件;验证门随后检验修订是否真正解决失配、能否在相关变化下保持成立,并排除随机波动、评价器漏洞与环境偶然。
验证通过仍不等于递归已经发生;只有当纠正揭示出可迁移的方法性缺陷,被纳入未来纠错机制,并在后续任务中实际改变未知如何被发现、证据如何被获取、错误如何被判断以及修复如何被实施时,Loop 才真正跨越递归阈值。
在运行层面,VeriLoop Coder-E1 由 Self-Harness 维护任务锚点、证据义务与版本化状态。每轮首先基于当前假设、行动方案、探究方向和停止条件生成候选,再由反驳阶段把候选转化为可检验主张并提出可观察的失败条件;若仍存在足以改变决策的未知,系统便登记对应的证据义务,调用代码检索、静态分析、测试、运行 Trace 或其他工具获取带来源的观测,并仅允许可采纳且能够改变判断的结果更新系统状态。
![]()
图 2|已验证纠正进入未来方法的运行轨迹及递归阈值判据机制
随后,系统依据失配发生的层级实施修订,并将修订后的产物送入验证门,同时检验原始失败、相关执行路径、回归测试及错误归因。
验证失败时,当前修订被拒绝,流程返回反驳或定向探究;验证通过时,该修订也不会直接成为永久规则,而是被登记为带有证据集合、适用范围、触发条件、失效边界与回滚路径的方法候选。
只有当这一方法候选在后续独立任务中被实际调用,并确实改变证据义务如何生成、工具如何选择、修订如何定位或验证如何组织,且再次获得证据支持时,它才被写入新的纠错方法,完成从当前结果纠正到未来方法更新的跃迁。
此时,纠正不再只解决一次任务,而是开始改变系统未来如何发现、判断和纠正错误,Loop 才真正跨越递归阈值;若后续证据与其冲突,该方法仍可被缩小适用范围、降级、回滚或撤销。
开源边界:开放模型资产,保留 Self-Harness 控制栈
团队已依据 Apache 2.0 许可证开放 VeriLoop Coder-E1 的模型权重、Tokenizer、配置文件、部分软件工程窄域 PEFT 适配器及评测材料。开发者可在许可证范围内下载、部署、修改模型,组合适配器并开展二次研究与应用开发。开放内容覆盖模型侧的代码理解、生成与推理能力,以及由窄域 PEFT 注入的工具规范、不确定性表达、回滚意识和证据绑定等专业行为。
Self-Harness 的完整实现暂不开放。它并非提示词集合或普通 Agent 脚本,而是复杂的运行时控制平面。它将一次软件工程任务编译为多轮、分阶段且相互约束的模型调用,而非对同一 Prompt 机械重试:不同轮次分别承担候选生成、反证、定向探究、修订与验证等职责,并接收由 Harness 动态构造的结构化工作包,其中持续携带任务契约、代码上下文、前轮产物、工具回执、测试错误、证据缺口、失败归因及修复边界。
Self-Harness 同时维护假设、行动、探究方向、证据义务、方法版本与停止条件,将检索、测试、静态分析和运行轨迹组织为可追溯的证据事务,并通过上下文隔离、状态更新、证据采纳、验证门、方法晋升、预算治理、权限控制、失败回退与版本回滚,决定何时继续调用模型、调用哪一阶段、向其提供哪些证据,以及哪些修订可以执行或被后续任务继承。窄域 PEFT 提供专业能力,Self-Harness 则负责将这些能力组织为可验证、可回滚、可递归继承的多轮执行过程。
此外,完整 Self-Harness 还包含任务编排、工具与验证器路由、失败归因、方法继承、安全边界及真实软件工程环境中的运行基础设施,直接决定系统能否从代码生成模型升级为能够理解仓库、执行修改、验证后果并承担回归责任的通用 Code Agent。团队下一阶段将以通用 Code Agent 为主要研发与商业化方向,因此开放其技术原理、系统边界和评测依据,同时保留生产实现,以兼顾学术可验证性、开源使用与核心产品壁垒。
发布首日即获国际社区量化适配
VeriLoop Coder-E1 在 Hugging Face 开源不足 48 小时,即被巴西以及其他第三方开发者主动制作并发布 GGUF 低精度量化版本和二次研究。该工作基于公开权重完成部署侧转换,使模型能够脱离原始高精度运行环境,通过 llama.cpp、Ollama、LM Studio 等本地推理工具运行,并可进一步部署为本地 OpenAI 兼容接口。由此,VeriLoop Coder-E1 的使用边界从服务器级原始权重部署扩展至更低显存、更有限内存和个人设备环境。同时,根据第三方公开纰漏的结果,模型表现出极强的抗「抹除」(abliteration)能力。经过 200 次尝试,其拒绝率仅从约 95% 降至约 82%。
![]()
![]()
![]()
截至 2026 年 7 月 30 日,在模型上线首日的统计窗口内,VeriLoop Coder-E1 原始仓库单日下载量达到 413 次;第三方 GGUF 量化仓库单日下载量达到 955 次。这意味着模型刚完成公开发布,国际开源社区便已开始围绕其进行权重获取、低精度量化、本地部署和工具链接入,社区对模型的关注已迅速转化为实际使用行为。相关第三方衍生仓库见 [3]—[4]。
该 GGUF 版本是对 VeriLoop Coder-E1 公开模型权重的第三方部署扩展,不包含生产级 Self-Harness,也不改变模型的技术归属与原始发布关系。其价值在于,第三方开发者在发布首日便自发投入计算与工程资源,为模型建立更低成本的本地运行路径,表明 VeriLoop Coder-E1 已开始从实验室发布成果进入由国际开源社区实际下载、部署和再开发的应用阶段。
从代码生成到状态后果建模:
以 Self-Harness 推进通用 Code Agent
权重开放只是起点。团队下一阶段将把研发与商业化重心转向通用 Code Agent:底层模型作为可替换的推理内核,生产级 Self-Harness 负责维护任务契约、仓库状态、证据义务与方法版本,编排分工明确的多轮模型调用和工具执行,并将自然语言目标转化为可观察、可反驳、可验证、可回滚的状态变化。系统在执行前预测代码、依赖、接口与运行行为的变化,执行后再以 Git Diff、编译结果、测试日志和运行 Trace 对照预测与现实;一旦出现失配,立即重新探究、回滚或重构计划。通用 Code Agent 因而不只是生成代码,而是能够预测、执行并对行动后果负责。
与以 DeepSeek 持续扩展基础模型能力为中心的 AGI 愿景不同,VeriLoop 不把通用人工智能首先理解为一个参数更多、知识更广的单体模型。真正关键的是,系统能否形成可修正的状态表征,预测行动后果,在不确定条件下规划与执行,并在现实推翻预测时,不仅修改当前答案,还改变未来如何提出问题、获取证据、选择行动和判断完成。知识可以来自预训练,能力可以由模型提供,但智能只有在状态、行动与后果形成闭环时才真正显现;循证则进一步要求,结论、方法乃至验证机制本身都不得获得不可推翻的特权。AGI 不是逼近全知,而是在更广泛的环境中持续缩小对行动后果的预测误差,并始终保留被现实纠正的能力。
软件工程是检验这一观点最严格的起点:代码仓库提供环境状态,修改和工具调用构成真实行动,编译、测试、依赖、性能与运行轨迹则给出无法由语言叙事替代的外部证据。团队将继续推进通用 Code Agent,并在公开评测和真实工程任务中与国内外前沿系统展开良性竞争,但不会只在别人挖好的坑里继续铲土。研究的意义不在于被谁铭记,而在于探索未知,并把经得起证据检验的事情做下去。正如电影《八仙》所说:「只要做对的事,人人都是无心昌。」
数据来源与相关模型仓库:
官方模型与技术博客
[1] Tsinghua SIGS Robot Lab. VeriLoop Coder-E1 [CP/OL]. Hugging Face, 2026 [2026-07-29].
https://huggingface.co/tsinghua-sigs-robot-lab/veriloop-coder-e1
[2] VeriLoop. VeriLoop: When Evidence-Governed Correction Enters the Future, Recursive Self-Evolution Begins [EB/OL]. X, 2026-07-25 [2026-07-29].
https://x.com/free_anyone/status/2080695708357951959
社区衍生版本
[3] Ramos, R. VeriLoop Coder-E1 GGUF [CP/OL]. Hugging Face, 2026 [2026-07-29].
https://huggingface.co/rodrigoramosrs/veriloop-coder-e1-gguf
[4] Asmanov, L. VeriLoop Coder-E1 Heretic [CP/OL]. Hugging Face, 2026 [2026-07-29].
https://huggingface.co/asmanovlev/veriloop-coder-e1-heretic
Benchmark 排行榜数据源
[5] Scale AI. SWE-bench Pro Leaderboard [DB/OL]. Hugging Face, 2026 [2026-07-29].
https://huggingface.co/datasets/ScaleAI/SWE-bench_Pro?leaderboard_base_model=false
[6] DataCurve. DeepSWE Leaderboard [DB/OL]. Hugging Face, 2026 [2026-07-29].
https://huggingface.co/datasets/datacurve/deep-swe?leaderboard_base_model=false
[7] SWE-bench. SWE-bench Verified Leaderboard [DB/OL]. Hugging Face, 2026 [2026-07-29].
https://huggingface.co/datasets/SWE-bench/SWEbench_Verified?leaderboard_base_model=false
[8] Harbor Framework. Terminal-Bench 2.0 Leaderboard [DB/OL]. Hugging Face, 2026 [2026-07-29].
https://huggingface.co/datasets/harborframework/terminal-bench-2.0?leaderboard_base_model=false
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.