一篇新论文提出了一个相当直接的想法:与其让模型在脑子里做物理推理,不如让它把世界规则写成代码,然后跑起来看结果。这个框架叫 Code as Worlds,核心是把物理场景转化为可执行的程序表征,让智能体通过运行代码来验证自己的判断。
从“想”到“跑”的转变
![]()
传统物理推理任务里,模型通常被要求直接给出答案,比如判断物体会不会倒、球会滚向哪里。这篇论文的路线不同:模型先根据场景生成一段代码,这段代码描述物体、约束和物理规则,然后执行代码得到结果。推理过程不再停留在隐式的内部表示,而是变成了一串可以检查、可以复现的指令。
论文把这种表征称为“可执行世界表征”。它的好处在于,一旦代码写出来,后续的推理就交给了程序执行,而不是继续依赖模型对物理直觉的猜测。对于需要多步推演的场景,每一步都能在代码里留下痕迹,出错时也更容易定位是哪一步出了问题。
智能体如何发现这些表征
作者强调“发现”而不是“预设”。也就是说,系统不是靠人工把物理公式硬编码进去,而是让智能体在任务中自己寻找合适的代码结构来表达当前场景。这个过程更接近让模型学会一种描述世界的语言,而不是背下一堆固定的解题模板。
从公开信息看,这项工作把物理推理和程序合成两条线接在了一起。一边是模型对场景的理解,另一边是代码执行带来的确定性。两者结合后,模型不需要在每一步都“想清楚”,只需要保证生成的代码能正确运行,剩下的交给执行环境。
为什么值得关注
物理推理一直是评测模型深层理解能力的常见场景。很多模型在简单问题上表现不错,一旦涉及连续变化、碰撞、遮挡或多物体交互,准确率就明显下滑。把推理外化成代码,相当于给模型提供了一个外部“计算器”,让它不必把所有物理量都塞进参数里。
这种思路并不局限于物理题。任何规则明确、可以程序化的领域,理论上都能套用类似的框架。论文目前聚焦在物理推理,但“可执行表征”这个概念本身,指向的是更一般的智能体能力:不是单纯预测答案,而是构建一个能运行、能验证、能修正的中间产物。
当然,代码生成本身也有门槛。模型需要同时理解场景语义和编程语法,任何一环出错都会导致执行失败。论文的价值在于把这个问题摆到了台面上:与其让模型硬算,不如给它一个可以试错的执行环境。至于这条路能走多远,还要看后续在不同任务上的表现。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.