本文目錄 · 6 個章節

先限定一个任务

我的起点是一个很直接的问题:既然语言模型已经能理解指令,为什么不能直接用它操控机械臂?我没有马上接受“需要世界模型”作为答案,又追问:语言模型难道做不到吗?人类是不是也在脑中预演动作?后来,我的问题从比较两个模型,转向了它们的能力能否融合。这篇文章沿着这条追问,拆开“理解一句话”与“把一个动作可靠地做出来”之间的距离。

在这样的场景中,一个看似合理但已经过时的计划,可能不再可执行。问题不仅是模型输出对不对,还包括从观察到动作之间,环境有没有发生变化,以及谁负责发现这种变化。

沿着链路寻找失效

  1. 01感知

    当前观察是否可信

  2. 02规划 / 执行

    动作是否仍符合约束

  3. 03停止 / 接管

    解释原因 · 明确恢复条件

说明性任务链 · 非真实机器人运行或安全仿真
不同失效,需要不同处置
位置说明性异常需要设计的响应
感知视野被遮挡,位置不确定标记不确定状态,不以旧观察冒充新观察
规划新障碍使原路径不可行重算或停止,而不是继续追求原目标
执行动作反馈与指令不一致限制继续动作,保留诊断信息
接管人工无法理解发生了什么提供状态、原因与明确恢复条件

NIST 的风险管理框架将场景、测量与责任放在持续管理中。这不能替代具体设备的安全规范,却支持一个基本问题:系统必须在自己的使用环境中被评估,而不是只凭一个理想演示判断它是否可靠。[1]

为什么一定需要更大的模型?

如果任务稳定、输入明确、错误成本很高,简单控制策略或固定流程可能更容易验证。大模型的灵活性只有在确实解决了场景变化,并且新增不确定性可以被控制时,才构成优势。更先进的组件不自动组成更合适的系统。

我更关心的判断是:它在哪些条件下工作,怎样暴露不确定性,谁可以让它停下,以及如何恢复。这样的追问可能不如演示视频直观,却更接近技术进入现实之后需要承担的工作。

为什么不能直接让语言模型操控机械臂

我最初的追问很直接:既然模型能理解指令,为什么不能直接用它操控机械臂?世界模型又多做了什么?这不是两个非此即彼的产品选项,而是对系统功能的不同提问。

语言理解可以帮助解释目标;世界模型通常关注状态如何随动作演化;控制系统还必须把动作落实到设备并及时反馈。RT-2 的研究把视觉语言预训练与机器人动作数据结合,说明两者能够协同。它不意味着只要接上普通聊天接口,就获得了同样的动作能力。[2]

拿杯子时,模型需要的不只是“杯子在桌上”这句描述,还要面对位置误差、遮挡、抓取后的变化。预测有帮助,但显式世界模型不是所有控制方案的必需组件。固定场景里的简单方法可能更适合;是否增加模型,要看它解决了什么具体困难。

预测下一幕,与选择下一步,是两种能力

世界模型这个词容易让人想到一段逼真的未来视频。但对机器人而言,画面是否像真的,只回答了部分问题。假设杯子被遮住了,模型可以生成一幅合理的桌面,却未必知道杯柄的准确方向;这点误差在人眼看图时很轻微,在夹爪落下时却可能决定成功与失败。这里是说明性例子,并非某个模型的实测结果。

可以把两种任务分开理解:预测模型尝试回答“处在这个状态、执行这个动作后,会发生什么”;动作策略回答“为了目标,下一步做什么”。控制器再把选择转换为设备能够执行的命令。一个系统可以把这些功能合并学习,也可以分开实现,因此不能只凭产品名字判断它具备了哪种能力。

RT-2 提供的是一条具体路线:把机器人动作表示为 token,并联合机器人轨迹与视觉语言任务进行训练。它展示了互联网知识进入动作选择的可能,但这个训练设计并不等于给机器人直接连接一个未经动作训练的聊天模型。[3]

如果预测要用于选择动作,还要检查误差会怎样沿多步积累。面对同一只杯子,可以先比较两个候选动作的预期结果,执行一小步,再用新观察更新判断;当观察不足时,先换视角,也可能比继续推理更有效。这个例子让我更关心一种能承认“还没看清”的系统,而不仅是一种总能生成下一幕的系统。

为什么我看好制造网络带来的机会

我看好中国物理 AI 的机会,起点是制造、零部件和实际使用场景能够形成紧密反馈:发现一个问题后,硬件、控制与应用团队可以一起改进。这个判断关注能力之间的连接,而不是认为有机器人外壳就已经有可靠智能。

这条追问里,我曾觉得“距离不远了”。这种期待可以保留,但它需要一个更具体的对象:究竟是理解目标更近了,还是在陌生环境中稳定执行更近了?回看会话,最有用的收获,是把一个笼统的能力判断拆成可以分别检查的问题。技术是否接近现实,最终要看新环境、新物体和失败之后,它还能不能继续工作。

來源與延伸閱讀

  1. NIST · AI Risk Management Framework 1.0 ↗

    依據 · 治理、映射、测量与管理框架;不构成任何产品的认证。

  2. Google DeepMind · RT-2(2023) ↗

    依據 · 视觉语言预训练与机器人动作数据结合的研究实例。

  3. Brohan et al. · RT-2 研究项目与论文(2023) ↗

    依據 · 作者项目页:联合机器人轨迹与视觉语言任务训练,并将动作表示为 token。