【上观新闻】针对传统机器人“听、看、说、动”思维割裂、交互生硬的痛点,该模型独创了“思考—表达—行动”(Thinker-Talker-Actor)三层端到端架构。在这一架构下,机器人依靠视觉来理解物理世界,不再额外需要语音或文字指令,实现了感知、决策与表达的统一驱动。