arXiv cs.RO 机器人学· Vineet Bhat, Mikaela Angelina Uy, Siyi Chen, Alex Zook, Xuning Yang, Stan Birchfield, Valts Blukis, Jonathan Tremblay·· 2 天前AI 评分56
MG-VQA:基于操作的视觉问答基准揭示 VLM 需通过物理交互获取被遮挡证据
MG-VQA: Manipulation Grounded Visual Question Answering with VLMs
AI 导读
研究者提出 Manipulation-Grounded Visual Question Answering(MG-VQA)任务与 MG-VQA-Bench 基准,包含 600 个人工核验问题、覆盖 4 类空间推理任务,并在杂乱桌面交互环境中评测 8 个 VLM。
来源:arXiv cs.RO 机器人学 · arxiv.org