宜家家具的组装说明书,大概是很多人装修路上最沉默的对手。现在,有一家研究机构把这件事变成了给AI出的考题。
Epoch AI 发布了名为 Furniture Assembly Benchmark(家具组装基准)的测试,专门考察模型的空间推理能力。题目很直接:给模型看宜家家具组装过程的照片,其中一部分照片里藏着故意做错的步骤,模型要判断这个组装对不对,如果错了,得指出错在第几步。
![]()
为什么挑宜家
这个测试想验证的能力,是"把技术图纸和真实物体对应起来"。看组装错误,需要模型把说明书上的示意图,和照片里真实的木板、螺丝、孔位对上号。Epoch AI 认为,这种能力和修家电、修车之类的任务相关,而现有的视觉推理基准很少测到这一层。
测试用的照片来自三件宜家产品,难度递增:Ställ 鞋柜、Tonstad 床架、Gullaberg 斗柜。三件产品一共拍了 60张照片,分别是14张、25张和21张。有些照片是正确组装,另一些则被故意做出了明显可见的错误,而且很多时候组装还继续往下做了,让错误藏得更深。
Epoch AI 表示,每一张含错误的照片,问题对知道该看哪里的人来说都是清晰可见的。
模型要做什么
每张照片,模型会被告知正在组装哪件产品、刚刚完成的是哪一步,同时拿到照片、官方组装说明书的PDF、一个可以放大查看局部的高分辨率工具,以及一个Python解释器。
模型需要判断当前组装是否正确。如果发现错误,要报出错误发生在哪一步并描述问题;如果发现多处错误,要全部列出。如果组装正确,则要告诉用户下一步该做什么。
每个样本在一个智能体沙盒里运行,预算为 80步。接近上限时模型会收到提醒,到达上限时被要求给出最终答案。实际运行中,不到 5% 的样本触及了这个限制。
评分分多步进行。如果组装没有错误、模型也这么判断,答案记为正确。如果组装有错误,模型答案先和错误步骤的答案键比对;步骤对了,再由一个LLM评分器(GPT-5.6 Sol)检查它对错误的描述,评分器被要求从宽处理——只要模型指出了错误步骤、大致描述了问题,就能得分。最终分数是60张照片上的准确率。
评估时,每个模型都使用其API支持的最高推理强度。开源权重模型使用官方开发者API端点(Moonshot 和阿里巴巴),不过开源模型的速度和质量可能因服务商而有明显差异。有些模型完全不支持图像,无法参与评估。
人类拿了63%
2026年9月,Epoch AI 测量了人类在这套基准上的表现。15名此前没有组装过这些宜家产品经验的志愿者参与,每人回答三件产品中某一件的全部照片,每件产品5人。参与者看到的照片和说明书与模型相同,需要判断每次组装是否正确,如果不对,说出错误发生在哪一步。
他们的任务比模型稍简单:不需要描述错误,因此只按步骤评分,也没有LLM评分器介入。参与者每张照片的中位耗时是 77秒。
平均每位参与者在60张照片上的得分是 63%。没有人答对全部60张,所以最好的个人成绩 84% 是这样算出来的:把每件产品上得分最高的参与者的成绩合并起来。
Epoch AI 在说明中表示,使用宜家产品照片和组装说明书仅用于研究和评论目的,这项工作独立于宜家进行,不分发或出售底层受版权保护材料的访问权限。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.