【财联社】大语言模型可以从互联网获得海量文本,机器人却需要学习如何接触物理世界。一个看似简单的抓取动作,涉及视觉、位置、力度、触觉和关节运动。杯子的形状、材质或摆放位置改变,原有数据就未必适用。不同机器人在结构和传感器配置上的差异,又降低了数据的通用性。