![]()
一个 0.6B 的决策小模型 9 月 21 日开源,它不生成一个字,解码 token 为 0,2000 道测试题上答对 1585 道,比 Laya 已发布的权重多 45 道,而且只用了对方八成的训练数据。
候选一多优势更大,64 个选项时靠共享前缀 KV 把冗余主干 token 从 33547 压到 2551,比 Laya 快约一倍,状态容量也是对方的两倍。权重、训练代码、推理服务、客户端全在 Apache-2.0 下开源,一次训练 841 秒,个人可以接着训练。
AgentJev-0.6B 是我这两天最想拆的小模型。它是决策模型,不写句子,一次前向直接吐概率分布,解码出的 token 数是 0。
不写字,连 JSON 都不用修![]()
主干是 Qwen3-0.6B,语言模型头被摘掉。每个候选项读自己最后一个 token 的隐状态,再由一个与排列等变的小头给整组打分,选项的书写顺序不会偷偷变成名次。
没有输出词表这件事,落到工程里就是三笔省下来的账。没有 JSON 要解析,也没有格式坏掉重试那一轮,所以它不会输出一句自信的错话或者一个缺了括号的对象。失败方式从「解析不出来」变成「概率偏低」,而概率偏低是可以设阈值的。
![]()
三种原语都把完整分布交出来,不只给赢家。Boolean问命题真假,回传两个质量。Choice给 2 到 255 个选项,回传选中值、top 概率、前两名差值和整张分布。Score给 2 到 10 级评分表,回传等级和期望分,期望分可以落在两级之间。路由、阈值、回退这三种用法,靠的都是这张分布。
上下文 2048 个 token,超长直接报错拒绝,不做静默截断。这条对闸门场景比对聊天场景重要得多,一段 diff 被悄悄剪掉一半,返回的概率还挺好看,这种错最难查。
生成式模型答选择题像让考生把解题过程写满再交卷,你回头还得从字迹里认答案。AgentJev 直接读答题卡。
分更高,用的数据还少两成
模型
类型
Top-1
参数量
AgentJev-0.6B,本轮
专用
79.25%
· 1585/2000
598M
Laya 已发布权重
专用
77.00% · 1540/2000
421M
meraGPT Decider 1
通用,零样本
76.8%
未公开
TypeSafe Jev 1.13.0
通用,零样本
72.7%
未公开
2000 道题里多答对 45 道。领先不是复跑方式造出来的,77.00% 是 AgentJev 复跑 Laya 已发布权重量出来的,Laya 自己在模型卡上写的是 0.766,复跑的 Brier 0.0615 对 0.062,ECE 0.217 对 0.213,score MAE 0.2423 对 0.242,三组贴着,复跑口径没动手脚,这份领先站得住。
它是在数据更少的情况下赢的。Laya 用了全部 1200 个官方训练案例,AgentJev 留出 120 个开发加 120 个校准案例,按开发集软交叉熵挑出第 600 步才打开测试集。少用两成数据,仍然高 2.25 个百分点,按 400 个案例做 bootstrap,95% 区间是正 0.65 到正 3.90,下界没跨过零。
工作流分项里,两块最大的它都赢了。
工作流
AgentJev
Laya
发票处理
86.20%
81.20%
客服
82.20%
76.40%
安全事件
76.80%
77.60%
agent 轨迹可观测性
71.80%
72.80%
校准这一栏它也是表里最好的。
指标,越低越好
AgentJev
Laya
参照
Brier
0.148,TypeSafe Jev 1.13.0
Score MAE
0.391,TypeSafe Jev 1.13.0
ECE
0.144,Jev;0.088,Prior
Brier 和 score MAE 两项全场最低。它的三个原语各带一个正的温度标量,在校准集上重新拟合过,Boolean 用 180 题,Choice 用 180 题,Score 用 240 题。Laya 的模型卡承认那份温度是从基础权重继承的,没有为这个模型重调,这一栏的差距有一部分来自这层施工量,不是白捡的。
候选一多,差距才真正拉开
这是它最实在的一处优势,而且限制条件是对手自己写在模型卡上的。
负载
Laya,421M
AgentJev,598M
单案 P50,1 段状态 5 道题
41.53 ms
约 60 到 70 ms
宽候选,64 个 Choice 加 1 个 Boolean
约 500 到 600 ms
298.91 ms
上下文上限
1,024 token
2,048 token
Laya 选项共享固定 256 个 token 的额度,官方建议 Choice 保持在 20 个以内,选项一多,每个标签摊不到几个 token,准确率掉得很快。它的主干是双向编码器,没有因果前缀那道接缝,一个问题给 64 个选项,状态文本就要被完整前向 64 次。
![]()
agentJev 这边 Choice 支持 2 到 255 个选项,每个候选项读自己最后一个 token 的隐状态,所有分支挂同一份 KV 前缀上打分,冗余主干 token 计算从 33547 降到 2551,少了 92.4%。同一份负载预热后测的中位数,非共享前缀 609.65 ms,共享前缀 298.91 ms,快约一倍,而两条路的概率最大差 0.000508,选中的选项没变。作者自己标了一句,这是这份负载上的数,不是对所有提示词的承诺。
动作空间越大,它越划算。选项表如果常年超过 30 个,这一条比准确率那 2.25 个点更值钱,反过来,一小段文本配几道题的短输入场景,Laya 快约 20 毫秒,优势只在候选多的时候成立。
全栈开源,841 秒能自己重训![]()
权重在 HuggingFace 的 aimeigaoshou/agent-jev,Apache-2.0,598M 参数全是 bf16,约 1.2GB。仓库里除了权重和主干,还有训练入口、推理服务、客户端和一个现成的钩子,训练种子 20260921 和数据版本号都写在报告里,这一轮训练只花了 841 秒。换成自己的业务数据重训,成本是一杯咖啡的时间,这跟按 token 计费的闭源接口不是一个玩法。
跑起来五步。克隆仓库建 venv,装 requirements.txt 再补 huggingface_hub 和 safetensors;拉 model.safetensors 和 temperatures.json;这个文件是完整模块,主干加候选头,不是因果语言模型,AutoModelForCausalLM 载不动,得用 bf16 载进来包成 state_dict 存成 .pt。
from huggingface_hub import hf_hub_download
from safetensors.torch import load_file
import torchsrc = hf_hub_download("aimeigaoshou/agent-jev", "model.safetensors")
torch.save({"state_dict": load_file(src)}, "agentjev_v1.pt")
hf_hub_download("aimeigaoshou/agent-jev", "temperatures.json", local_dir=".")
然后起服务。
python -m jev_service.server \
--checkpoint agentjev_v1.pt \
--model-path Qwen/Qwen3-0.6B \
--temperatures temperatures.json \
--port 8149服务只绑 127.0.0.1,设备默认cuda:0,8149 端口有本地工作台可以点着试,数据一步都不出机器。HTTP 层一次能吃 32 个状态、128 个问题、1024 条候选路径。
仓库里那个 agentjev_hook.py 是 Claude Code 的 PreToolUse 钩子,盯着 Bash、Write、Edit,问一个 Boolean 和一个四级 Score,只有 Score 落在第 3 级并且 Boolean 说不安全,才拦下来。它是 fail-open 的,服务没响应就退出 0,工具照跑,掉线不阻断你的 agent。
怎么用AgentJev-0.6B和不能吹的地方![]()
先起服务,从自己的 agent 日志里挑 50 条状态,配上 3 到 5 道平时靠正则或者小分类器在挡的判断题,看它给出的分布长什么样。再把正确答案和概率对一遍,找出在错误率容忍度内置信度切在哪一段最划算,放行的那批留下来当校准集。
正在用 27B 以上模型做路由和闸门的,这 1.2GB 值得在 GPU 上占个角落,候选经常超过 30 个的场景尤其划算,想要读懂长上下文、给建议、写文案,它一个字都帮不上。
它只认发票处理、客服、安全事件、agent 轨迹这四类工作流,换个领域要么重训要么别用,隔壁 Laya 那边社区已经做出 GGUF、MLX、ONNX、CoreML 几套转换,AgentJev-0.6B暂时还没有。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.