跳到正文
热点事件观察中

SpaceCast-Bench 发布:21个模型预测空间推理最高仅58.0%

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

SpaceCast-Bench 论文作者发布预测空间推理评测基准,用 observe-transform-infer 框架评测21个视觉语言模型,最强模型仅得58.0%,而人类表现为87.2%,空间专用模型接近随机水平。该基准含182个真实场景的3,862道题、16类任务,分静态感知、局部预测、全局预测三级。 论文作者称,用其程序生成数据微调 Qwen3-VL-4B,可将成绩从34.0%提升到65.7%,并在六个域外基准上取得宏平均提升。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. Hugging Face 每日论文
    SpaceCast-Bench:面向视觉语言模型预测性空间推理的评测基准

    论文提出 SpaceCast-Bench,用 observe-transform-infer 框架评测视觉语言模型的预测性空间推理能力,含 182 个真实场景的 3,862 道题、16 类任务,分静态感知、局部预测、全局预测三级。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。