【证券时报网】对于人形机器人交互能力来说,以往的全模态模型大多优先适配线上数字内容交互,而机器人身处持续变化的物理空间,不仅需要同步“看见画面、听见声音”,更要实时判断声音归属主体、事件发生顺序,识别交互对象、找准响应时机,传统模块化机器人方案很难完成这类时序耦合的复杂推理任务,也是长久以来人机交互生硬割裂的关键瓶颈