为什么我曾经想给革命排时间表

看到模型从回答问题走向生成图片、写程序和操作工具,我很自然地想知道:下一次会轮到什么?我曾把这场变化粗分成语言模型、智能体、物理 AI、更加通用的智能四个阶段。时间表让遥远的变化变得可想象,也容易产生一种错觉:前一站快到了,后一站就会按时发车。

今天更值得保留的是这个顺序背后的问题意识,而不是具体年份。会表达、会完成任务、会在现实中行动,确实需要不同的证据;但它们不会等待彼此结束。机器人研究并非在语言模型之后才开始,多模态、控制和工具使用也会反过来改造语言模型。

四层能力,各自有什么验收条件

能力层次,不是行业统一分期
层次我想看到的变化仍需回答
表达与理解跨任务处理信息,解释复杂输入有没有把流畅回答误当事实
持续执行把目标拆成动作并检查结果中途失败后如何恢复
物理行动根据新观察调整动作误差、时延与环境变化如何约束
广泛迁移在陌生任务中有效学习和适应成功是否依赖隐藏的人类准备

Transformer 原始论文发表于 2017 年,研究的是序列转换架构,并没有给后面几十年的智能发展规定路线。RT-2 则展示了把视觉语言预训练与机器人动作数据结合的具体方法。这两个例子让我更愿意沿着训练目标与反馈方式理解技术,而不是沿产品发布会的名字排列历史。[1][2]

从回答到行动,瓶颈会换位置

让模型写一份采购建议,主要需要核对信息和推理;让它真正提交采购单,还要处理权限、库存状态、重复提交和失败恢复。如果输出改成机械臂动作,错误甚至可能在下一次推理完成之前发生。上层目标看起来相同,系统需要承担的事情已经不同。

因此,更强的模型可能让某一环节突然变容易,也可能把瓶颈推到数据、接口、硬件或组织责任。一个可靠的窄任务系统,完全可能先于更加通用的系统产生价值。通用性也不能用一次漂亮演示来替代验证。

我仍然期待,但用问题追踪进展

我期待未来不断出现过去做不到的事情。不过,期待不必要求每一年都出现同样大小的飞跃。某一年最有价值的工作可能是把失败率降下来,让一个昂贵的演示变成普通人能够持续使用的工具。

现在再看一个新系统,我会先问它跨过了哪道具体门槛:是否减少人工接管,是否处理更陌生的输入,是否能解释失败,是否能以可承担的成本运行。这样的观察方式没有倒计时那么刺激,却能让我持续修正判断,而不必为一个过早写下的年份辩护。

来源与延伸阅读

  1. Vaswani 等 · Attention Is All You Need(2017)

    依据 · 原始 Transformer 论文;不支持固定的未来演进时间表。

  2. Google DeepMind · RT-2(2023)

    依据 · 视觉、语言和机器人动作联合训练的研究实例。