一个不会聊天的模型,被塞进了国际象棋排行榜,结果排到了第59名,Elo约243,旁边站着的是qwen3.6-27b和o4-mini-medium。
TypeSafe的Jev就是这么个怪东西。它不是聊天模型——你给它一个状态,再加上一组带类型的提问(Choice/Score/Noul),它回给你带概率的标签。像分类器,但输入可以是自由文本,标签每次由你自己定。
![]()
LLM Chess这个评测场子,跑的一直是聊天模型。它们以智能体方式对局,走一套多轮协议:get_current_board、get_legal_moves、make_move 。Jev不干这些。那还能不能把它放上同一张榜?答案是可以——前提是你按它期待的方式跟它说话。
先说清楚:这是一次外部评测
TypeSafe对刷榜这件事是公开反感的。在System One/Jev的发布文章里,他们说现有的LLM基准测试在这里并不真正适用,也跳过了常规的公开评测榜单,没把自家模型和其他模型摆在一起比。他们更愿意用带日期的内部快照。
但作者还是把Jev放上了LLM Chess——同一套测试框架,同一批对手,和那些聊天模型一样。
跟Jev对话的感觉,有点像跟霍金对话:聪明,但没有自由发言权。答案不会以自由形式吐出来。
在国际象棋之外,作者试过一个有点傻的下一字符循环:在a到z加上之间做Choice,每生成一个字母调一次API。让它拼blue,或者补全hel…,它吐出来的是半成品词——bue、helhoh。从pari…开始,它倒是补出了paris。从零开始生成很弱,补全一个不完整的片段反而更好用。
一份固定的合法棋步清单,比一个字母一个字母地拼英文,适配这个模型得多。
怎么把它接进LLM Chess
每一步的接法是这样的:
- 状态:{ fen, side_to_move }
- 一次Choice:把所有合法UCI走法作为选项(SAN写在criteria文本里),上限255
Jev返回一个UCI字符串,转成make_move e7e5——和聊天模型发给评测运行器的是同一个动作。从外面看,几乎就是一次正常的评测交互。
价格是每100万输入token收0.042美元,输出免费。
结果方面,当前榜单上jev-latest大约排在第59位,Elo约243,紧挨着qwen3.6-27b和o4-mini-medium。Elo在这里被当作推理能力的一个代理指标,它落在中游推理模型/强小模型的同一区间里。
对局完成率是100%——完整下完,没有因为非法走法或对话中断而早死,协议遵循得完美,这正是类型安全换来的东西。
每局约36秒,每局约0.0015美元(每步约0.00002美元);80局总共约0.12美元,而Elo相邻的那些对手每局要花一美元以上。又快又便宜,便宜得离谱。
跟Dragon下,和棋率不降
Dragon执白对Jev执黑,每个等级下10局:L1、L2、L3三个等级,和棋率都是50%。平的。
大多数聊天模型不是这样——Dragon越强,和棋通常越少,因为引擎能把更多对局终结掉。但在这里,和棋率横跨三个等级都没有下降。这对Elo是有帮助的。
TypeSafe管这类模型叫System One:决策快,不做深度思考。
国际象棋仍然需要真正的选择——吃什么子、什么时候兑子、什么时候奔着和棋去。Jev没有聊天能力,每局成本只有零点几美分,却依然在Elo上落到了中游推理模型附近。所以这项技能不是“会写关于国际象棋的文字”,而是从一份清单里挑出一个走法。
几个可以带走的东西
TypeSafe并不想要一个公开排行榜来当自己的证明。这只是一次外部评测。
- Jev适合那些你手上已经有一份选项清单的任务——工具、路线、标签、走法。让它一个字母一个字母地写英文是个糟糕的匹配(bue/helhoh)。
- 每局约0.0015美元、约36秒,这是和美元级LLM评测完全不同的成本/速度量级。
- 它有用的地方,是产品需要知道“选哪个选项”,而不是要一段文字——路由、结构化智能体、代码里的决策步骤。
榜单在LLM Chess,测试框架是maxim-saplin/llm_chess(feat/typesafe-jev-player分支/TypeSafe Jev player)。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.