跳到正文
arXiv cs.RO 机器人学· Jin Lou, Zhiyuan Jing, Xupeng Wang, Andong Chen, Xingdong Zhu, Yuexuan Li, Yuan Xu, Zhijie Zhu, Yingwei Ji, Wenpeng Nie, Renxing Feng, Liangliang Chen, Ying Chu, Jingyi Li, Jinyan Liu, Zhiqi Song, Jingxuan Zhu, Jidong Zhang, Yufei Liu, Boyang Xing, Lei Jiang, Yan Cui, Hongming Li, Yuchen Zhu·· 2 小时前AI 评分56

LM-X:通过进度、事件与不确定性预测实现可解释的 VLA 建模

LM-X: Explainable Vision--Language--Action Modeling via Progress, Event, and Uncertainty Prediction

AI 导读

论文提出可解释视觉-语言-动作(VLA)基础模型 LM-X,将任务进度、下一语义事件与局部指令可靠性三类解释信号与控制联合预训练,而非事后补充。LM-X 直接监督 return-to-go(RTG)、event-to-go(ETG)与异方差动作流方差,其中 RTG 调节 ETG、二者共同调节动作生成,不确定性在动作专家内部估计。

来源:arXiv cs.RO 机器人学 · arxiv.org