跳到正文
arXiv cs.RO 机器人学· Zibin Dong, Yicheng Liu, Shiduo Zhang, Baijun Ye, Yifu Yuan, Fei Ni, Jingjing Gong, Xipeng Qiu, Hang Zhao, Yinchuan Li, Jianye Hao·· 4 小时前AI 评分55

ActionCodec:面向VLA优化的动作分词器设计原则与方法

ActionCodec: What Makes for Good Action Tokenizers

AI 导读

论文提出从VLA优化视角设计动作分词器的方法,归纳出最大化时间token重叠、最小词汇表冗余、增强多模态互信息和token独立性等最佳实践,并据此提出高性能动作分词器ActionCodec。在LIBERO上,用ActionCodec微调的SmolVLM2-2.2B在无机器人预训练条件下达到95.5%成功率,配合架构增强后提升至97.4%,创下无机器人预训练VLA模型的新SOTA。

来源:arXiv cs.RO 机器人学 · arxiv.org