匿名模型Ox Alpha(牛来)此前在OpenRouter上线四天冲至全球第二,但独立开发者WesRoth公布的DeepSWE完整测试显示其准确率约63%,远低于此前10题子集测试的80%。
小样本跑分很容易制造性能神话,只有经过完整测试集的验证才能得到真实性能结果,这也说明当前AI评测体系仍需建立更严格、更全面的标准,避免被碎片化测试结果误导。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.