语言里的一步,现实里有很多小步

“把杯子放到桌上”在文字里只有几个字。机器人要先辨认桌面和杯子,再估计抓取位置、运动路径、接触力和释放时机。视觉一帧正确也不够:杯子可能滑动,镜头可能被手遮住,桌面材质可能和训练时不同。动作一旦落到现实里,错误不只是答案难看,还可能碰坏东西。

RT-2 把视觉语言模型的知识与机器人动作数据结合,展示了把语义迁移到控制任务的可能性。它的启发不是“语言模型已经会做所有动作”,而是语义理解和动作数据可以在同一个学习框架中相遇。读这类论文时,我会特别找训练数据来自哪些场景、评估换了哪些物体或指令,以及失败案例是否仍被统计。

动作表示,决定了模型要面对什么难题

直接预测下一时刻动作,决策频繁但容易抖动;一次预测一段动作,执行更连贯,却需要处理环境中途变化。Diffusion Policy 将动作序列作为生成对象,是后者的一种思路。它和“看图说话”最大的不同在于,输出要进入闭环:执行一点、重新观察、再调整。

这也让我重新看 RL 与模仿学习的分工。示范数据告诉系统“通常怎样做”,奖励信号则回答“结果是否值得重复”;二者都可能在数据稀少、奖励设计不当或环境变化时失灵。说“加上强化学习就能泛化”过于轻松;要先说清楚可探索的范围、失败代价和安全约束。

我想盯住的几个问题

第一,语义迁移是否伴随物理迁移?模型知道“易碎”,不一定知道某个具体杯子的摩擦系数。第二,跨机器人数据能共享到什么程度?不同机械臂的自由度、相机位置和动作空间并不相同。第三,现场纠错发生在哪里?是策略自己根据反馈调整,还是人类在失败后重新标注、重新训练?

我目前没有机器人实验平台,所以这篇是论文阅读与问题整理,不是项目报告。以后如果能做可复现的小实验,我会优先设计一种会暴露失败的任务:光照变化、位置偏移和执行中途干扰同时出现。比起只看成功视频,我更想知道系统何时意识到自己做不到。