跳到正文
今天10月8日周四5 条
10月7日周三
  1. Hugging Face 每日论文53

    工具使用型 Agent 如何在证据到行动的链条上失败

    研究提出 SafeActBench,包含 6 个操作域、5 类协议下的 656 个案例,用证据溯源台账与确定性轨迹评估器追踪工具使用型 Agent 从静态动作判断到单步、多步工作流的失败点。在 10 种模型-框架配置中,静态动作评估较强与交互执行较弱并存,失败常发生在执行前:调查不完整或证据未确立就动手。证据确立后单步执行通常可靠,多步工作流则暴露未解决的前置条件与执行不完整。

  2. arXiv cs.RO 机器人学55

    自动驾驶汽车行为安全评估(第二部分):评估结果

    第三方评估框架在密歇根大学 Mcity 测试设施的仿真与实车测试中验证了开源 L4 自动驾驶系统(ADS),结果显示其仅具备 14 项行为能力中的 6 项,碰撞率为 3.01x10^-3 次/英里,约为人类驾驶员平均水平的 1,000 倍。测试还发现了该系统此前未知的不安全场景,凸显了在大规模部署前开展行为安全评估的必要性。

  3. arXiv cs.RO 机器人学55

    CLRE:面向学习型驾驶规划器的闭环精修与执行框架

    CLRE 提出一种分层滚动时域控制框架,在冻结上游规划器、不引入新学习模型的前提下,通过有限时域最优控制与预测条件 OBB 可行性测试筛选候选轨迹,下层结合距离速度上限与饱和比例制动律执行。在 Bench2Drive 220 条路线验证集上以 VAD 为上游规划器闭环仿真,驾驶得分从 42.26 提升至 55.89,路线完成率从 55.69 提升至 71.51,碰撞事件从 117 降至 97。

  4. arXiv cs.RO 机器人学57

    Same Pieces, Different Servers:面向"服务化"AI Agent 的 Tetris 基准测试

    研究者提出 Tetris 基准,用同一组方块、以 oracle 评分衡量 AI Agent 从"服务化"模型获得的决策质量。在一家 serverless 供应商上对 9 个开源权重模型做 5 组预设实验,并自托管一个开源决策模型跑在 CPU 上,发现价格与模型规模不预测决策质量;重发历史在缓存输入免费时几乎零成本,若不免费则贵 11-12 倍且让棋局变差。

  5. arXiv cs.RO 机器人学55

    NavSafe-∞:在照片级真实环境中评测闭环驾驶安全的基准

    NavSafe-∞ 提出一个照片级真实的闭环驾驶安全基准,包含 280 个场景、28 类事件,并按交通事故、弱势道路使用者碰撞、交通违规、交通事件四类给出能力评分。在评测 20 个端到端驾驶策略后发现,开环指标提升并不能可靠转化为闭环安全表现。基准与可扩展的事件编排、策略诊断工具箱将开源。

  6. arXiv cs.RO 机器人学51

    CANMOT:面向自动驾驶多目标跟踪的类别感知噪声建模

    CANMOT 提出面向 KF 3D 多目标跟踪的类别感知、目标对齐噪声建模框架,为不同交通参与者引入类别专属的过程与测量协方差矩阵,并可选地在目标坐标系下表达以保留纵横向各向异性。在 nuScenes 上的实验显示该方法提升跟踪性能并显著减少身份切换。基于 ANEES 与 χ² 违规检验的分析揭示标准 KF 基线存在严重过度自信,所提方法改善校准但仍存在明显不一致。代码已开源。

  7. arXiv cs.RO 机器人学51

    ArtifactArena:用物理世界中的构建成果评测模型

    ArtifactArena 是一个开放式平台,让模型在物理接地的软硬件协同设计挑战中工程化构建可运行机器人并在模拟竞技场对战。平台通过文本描述、物理仿真器反馈和游戏数据三种 harness 评测前沿模型的零样本、验证器引导精修与开放式物理设计能力,并用对战 Elo 排名对模型进行基准测试。该框架与赛事基础设施将开放社区持续提交,形成不饱和的开放式智能测试床。

  8. arXiv cs.RO 机器人学52

    Radar2Plan:面向端到端开环自车轨迹规划的 4D 雷达基准

    Radar2Plan 提出首个面向自动驾驶规划、基于真实世界 4D 雷达数据的开环自车轨迹规划基准,通过统一接口连接传感器编码器、场景表示与规划头。基于 DSERT-RoLL 与 MAN TruckScenes,基准在 12 种天气与光照条件下评测了相机、4D 雷达与 LiDAR 的 7 种组合、4 种规划基线。实验显示 4D 雷达单独即可支撑有竞争力的轨迹规划,并在恶劣条件下保持稳健表现。

  9. arXiv cs.RO 机器人学47

    差速移动机器人的紧急避障机动研究

    研究通过 540 次瓷砖地面随机试验(保留 539 次),在 45、55、65 cm/s 指令接近速度下评估差速移动机器人的 5 种制动与转向机动。结果显示,反向旋转机动的编码器航向误差随速度从最低升至最高增加 4.7-5.1 度,而弧线与制动辅助枢转变化小于 0.4 度,陀螺仪误差在反向旋转中约 3 度。编码器误差越大,避障成功率越低,研究据此给出 90% 成功率的估计反应距离。

  10. arXiv cs.RO 机器人学53

    CrashSim:基于真实碰撞先验与人类行为的自动驾驶碰撞场景生成框架

    CrashSim 用真实碰撞先验引导多智能体生成式交通仿真,生成更贴近真实碰撞演化过程与碰撞类型分布的自动驾驶安全评测场景。基于 CrashSim 构建的 nuCrash 数据集包含 4,000 多个碰撞与近碰撞场景,对 5 个自动驾驶规划器的闭环评测显示其比 nuScenes 更能暴露规划器安全能力差异。LLM 辅助评测代理进一步给出能力级诊断与改进指导。

10月6日周二
6月7日周六
  1. Figure AI 新闻71

    Figure AI 披露 Helix 在物流分拣上的扩展结果,包裹处理提速至 4.05 秒

    Figure AI 公布 Helix 在物流分拣场景的最新进展,包裹处理时间降至约 4.05 秒,条码朝向成功率提升到约 95%,并能处理 poly bag、平信封等可变形包裹。

    推荐理由:原文给出 10 到 60 小时演示数据与各模块消融的量化结果,可用来判断数据规模与架构改动各自的收益。