Claude Sonnet 5.5 和 GPT-6.1 Sol 能不能用 Fable、Opus 或 Astra 成本的一小部分,交出强劲的结果?这个问题被摆上了测试台。
测试方式是在多个提示词上做并排对比,追踪每一代模型的实际成本,再把结果与各自实验室的更大模型放在一起看。
![]()
测的是什么
不是单点跑分,而是把成本作为一条主线贯穿始终。同一批提示词,分别喂给 Claude Sonnet 5.5 和 GPT-6.1 Sol,记录实际花销,再对照各自实验室更大模型的表现。
换句话说,比的不是谁更聪明,而是谁在更低的价位上还能保持能打的状态。
结果在哪看
结果来自 @petergostev,完整内容发布在 YouTube 上,视频链接为 youtu.be/r0ymhRtcTeI。
对于关心推理成本的人来说,这组并排数据提供了一个直接的参照:小模型和旗舰模型之间的差距,究竟值不值那个价差。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.