一句指令不能直接变成稳定动作
语言指令描述目标,视觉提供当前观察,控制则要处理连续时间里的不确定性。机械臂抓住杯子后,杯子的姿态、桌面的摩擦和相机遮挡都会改变下一步决策。这些变化很难靠一次性生成完整动作就全部预见。
阅读 VLA 论文时,我会把“理解了新指令”与“在新物理条件下完成任务”分开看。前者可能来自大规模视觉语言预训练,后者仍要面对动作数据稀缺和现实世界的安全边界。
模仿、探索与纠错
示范轨迹给策略一个起点,强化学习可以根据结果调整行为,但探索在真实机器人上有成本。一个更现实的问题是:系统在执行中途察觉偏差后,能否重新观察并修正,而不是继续跑完原计划。
暂时没有自己的机器人实验,因此这条笔记会保持 Growing。以后若有机会验证,我想优先记录失败条件,例如换光照、换摆放位置、加入执行中干扰;成功演示只是结果的一半。
同一条指令,换一个场景
“拿起杯子”在仿真里可以把杯子、桌面和相机位置都固定,现实里却会遇到杯身反光、把手朝向变化、旁边多了一个相似容器。若模型挑对物体却抓不稳,是感知错、动作表示不合适,还是执行时反馈太慢?把错误分类,比笼统地说“泛化能力不够”更能指导下一步。
我也想留意评估里的安全停止:系统何时应该放弃一次动作,转而请求人帮忙。会暂停不一定是能力差;在物理世界里,及时承认不确定往往比强行完成更可靠。