SpaceCast-Bench 发布:21个模型预测空间推理最高仅58.0%
热点事件观察中
SpaceCast-Bench 发布:21个模型预测空间推理最高仅58.0%
1 篇报道1 个报道来源1 天前更新
先了解这件事
AI 综述
SpaceCast-Bench 论文作者发布预测空间推理评测基准,用 observe-transform-infer 框架评测21个视觉语言模型,最强模型仅得58.0%,而人类表现为87.2%,空间专用模型接近随机水平。该基准含182个真实场景的3,862道题、16类任务,分静态感知、局部预测、全局预测三级。 论文作者称,用其程序生成数据微调 Qwen3-VL-4B,可将成绩从34.0%提升到65.7%,并在六个域外基准上取得宏平均提升。
AI 根据报道生成 · 1 小时前更新
最新进展10月8日 08:00
SpaceCast-Bench:面向视觉语言模型预测性空间推理的评测基准报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- Hugging Face 每日论文SpaceCast-Bench:面向视觉语言模型预测性空间推理的评测基准
论文提出 SpaceCast-Bench,用 observe-transform-infer 框架评测视觉语言模型的预测性空间推理能力,含 182 个真实场景的 3,862 道题、16 类任务,分静态感知、局部预测、全局预测三级。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。