把大模型脑子里想的过程"掏"出来看,这事听起来像科幻,但斗象科技的AIBeat平台真做了。他们拿全球15个前沿大模型做了一轮CoT思维链提取实验,结果有点反常识:公认的顶流GPT-4和Claude 3.5翻车了,反而是Gemma 4系列表现最稳。
实验怎么做的?
![]()
AIBeat把15个模型分成3组,每组5个,统一跑CoT思维链提取测试。所谓CoT思维链,就是模型在给出答案前内部推理的那一串逻辑步骤。能把这串步骤准确提取出来,意味着你能看清模型"为什么这么答",这对AI安全审计和可解释性研究很关键。
测试结果直接拉开了差距。Gemma 4和它的微调版在提取准确性上表现最好,成功率远高于其他模型,尤其在量子校准实验分析这类复杂推理场景里优势明显。而GPT-4和Claude 3.5这两个业界标杆,反而出现了显著的提取失败。
为什么强模型反而"失手"?
报道里提到一种可能:这跟模型对量子校准实验的理解程度,或者提取算法和模型内部机制的匹配度有关。也就是说,不是GPT-4不会推理,而是它的推理过程"藏"得更深,现有提取手段够不着。
其他模型如Qwen、Llama和Mistral也参与了测试,表现参差不齐——有的能提取出部分数据,有的则完全失败。整体来看,稳定性都不如Gemma系列。
这事对行业意味着什么?
一个直接的启示是:模型能力强不强,和它的推理过程好不好"读",是两码事。你在选型时如果只盯着跑分,可能选了个推理黑盒。反过来,Gemma 4这种开源模型在可解释性上反而更有优势,这对做AI审计、安全合规的团队是个重要参考。
当然,这只是一次实验评测,样本和场景有限,不能直接给模型能力排名下定论。但至少它提醒我们:当你想搞清楚AI到底怎么想的,选对工具和模型,比想象中更重要。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.