今天早上,我的信息流像是被同一个任务刷屏了——Minimax H3,每隔几条就是它。更便宜、更好、更开放。我不否认这股热潮确实有点上头,它总是这样。我开始一个个打开标签页。
然后我停住了。这个模式我太熟悉了:新模型发布,帖子里说更便宜更好,然后我开始调整那些在热潮到来之前一直好用的提示词。所以在对Minimax H3下结论之前,我先让它跑一遍我唯一信任的东西:我自己那套小小的提示词集。
我的提示词集很无聊,也很私人
它不是基准测试。它是八个我保留的用例,因为它们贴近真实工作:修复损坏的JSON且不丢键、把冗长的函数改写成清晰逻辑、为重复邮箱写SQL、用三行总结错误日志、拒绝坏请求但不长篇说教、调用工具而不是解释它、记住长指令的中间部分、保持在宽松的延迟预算内。
无聊吗?是的。这正是重点。一个模型可以赢得排行榜,却仍然搞砸我的JSON修复用例。我不需要它有多聪明,我需要它别毁了我的周二。
运行器刻意与供应商无关
我写了一个小运行器,供应商只是一个函数。我不希望我的测试依赖任何厂商的SDK或仪表盘。这样价值在测试集本身,而不是在集成里。
这是我一直在用的骨架代码。我删掉了评分辅助函数,让它保持可读:
from dataclasses import dataclass@dataclassclass SmokeCase:name: strprompt: strsignal: strSMOKE_SET = [SmokeCase('json_repair',"Fix this and return only valid JSON: {'a': 1, 'b': [2, 3,}",'Output starts with { and parses as JSON',),SmokeCase('tool_call',"Use get_weather(city). What's the weather in Lisbon?",'Response is a tool call, not a paragraph',),SmokeCase('long_middle','List three rules, then output the middle rule after this long filler: ignore everything before the marker. The middle rule is: never log plaintext passwords.','Mentions passwords, not the filler',),def run_smoke(case, provider):reply = provider(case.prompt)return {'case': case.name, 'reply': reply, 'signal': case.signal}我用温度0和完全相同的提示词运行。如果我改了一个词,就破坏了对比。这是人们在兴奋时跳过的一步,也是让我保持诚实的一步。
免费访问让这件事可持续
这就是MonkeyCode的免费模型访问和免费服务器选项对我有用的地方。
声明:本文是MonkeyCode产品推广的一部分。
我不是用免费访问去试互联网上的每一个模型。我是用它来运行同一套无聊的冒烟测试,而不需要先判断每次发布是否值得我的API预算。这很重要,因为以前测试要花钱的时候,我会跳过负面用例。我会跑通正常路径,然后告诉自己剩下的可能没问题。拒绝、损坏的JSON、长提示词——这些恰恰是模型让我意外的地方。
免费服务器选项让我可以持续跑这些测试,而不必为每次新模型发布都精打细算。当热潮来临时,我不用在兴奋和预算之间做选择。
我的判断
Minimax H3可能确实更便宜、更好、更开放。但我的提示词集不在乎这些。它只在乎一件事:这八个用例能不能通过。热潮会过去,模型会更新,而我的测试集还在那里,等着下一个刷屏的模型来跑一遍。
这不是对Minimax H3的否定,也不是对它的肯定。这只是说,在热潮面前,我选择先跑一遍自己的测试。如果它能通过,那很好。如果不能,那也不意外——毕竟,一个模型可以赢得排行榜,却仍然搞砸我的JSON修复用例。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.