一个机器人学会抓取一个新物体,需要多久?过去答案是几百条数据、数周训练。现在,一批创业公司给出的新答案是:看一遍示范视频就够了。
这就是具身智能领域正在升温的 In-Context Learning(ICL,上下文学习)——让机器人在部署后,利用当前场景中的上下文信息快速适应新任务,而不是回到训练场重新学习。量子位对可可矩阵 CEO 高宇翔的深度访谈,系统梳理了这一技术路线的最新进展。
![]()
从概念到工程验证
具身 ICL 不再是纸上谈兵。Skild AI 的 S1 和 Generalist AI 的 GEN-1.5 已经展示了机器人通过单次示范视频完成新任务的能力。这意味着,机器人不再只是"会多少任务"的静态工具,而是具备了"学一个新任务要多久"的动态能力维度。
高宇翔认为,具身智能的 Scaling(规模化)维度正在发生扩展——从单纯堆数据,转向部署后的快速学习能力。他提到,纯堆数据路线在单一任务上有效,大约 200 条数据就能拟合,但无法涌现通用泛化能力。行业开始关注机器人在新环境、新任务中能否利用当前 Context 快速适应,ICL 由此成为新的 Scaling 方向。
三大技术难点待解
具身 ICL 要落地,绕不开三个硬骨头:
- 视觉表征:需要同时覆盖高层语义与精细空间信息,既要"看懂"物体是什么,也要"看清"物体在哪、怎么抓。
- 多模态对齐:触觉、本体感觉的数据量远落后于视觉和语言,数据规模差异巨大。
- 长时序 Memory:需要流式压缩与筛选机制,而非简单扩展上下文窗口。
高宇翔特别强调,他们理解的 Long Context 更接近一种流式机制——不是把历史数据全部塞进窗口,而是持续压缩、筛选、保留关键信息。
「条件表征」:让视觉跟着任务走
可可矩阵的技术路线是把 ICL 前置到预训练阶段,核心是提出「条件表征」概念。传统视觉 Embedding 是固定提取图像特征,而条件表征会根据任务意图动态调制——抓杯子时关注位置和深度,识别时关注语义。
高宇翔的原话是:"一个适合机器人的视觉表征,不应该只由'我看到了什么'决定,还应该由'我现在想做什么'共同决定。"
这套「强理解、轻生成」架构的效果已经初步显现:实验显示,60M 参数的动作头可以超越 1.1B 参数的对照方案。目前,可可矩阵在简单抓取任务上的 One-Shot 成功率已超过 80%。
衡量标准也在变
成功率之外,行业正在引入新的评估维度。高宇翔提出,未来应以「第一次成功平均耗时」替代单一成功率作为核心指标——简单任务追求看一次就成功,复杂任务期望学习周期接近人类培训周期。
Self-Correction(自我纠正)被视为 ICL 的自然延伸:机器人可以利用失败轨迹进行上下文学习,从错误中迭代。这背后的逻辑是,如果前面的视觉理解足够准确,后面的动作解码其实没有必要设计得特别重。
以后衡量机器人智能,可能不只是看它已经会多少任务,还要看它学会一个新任务到底需要多久。这个维度一旦确立,具身智能的竞争逻辑将彻底改变。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.