跳到正文
今天10月8日周四20 条
  1. Hugging Face 每日论文47

    RunningTab:为 LLM 智能体的直接工作区交互引入环境侧标签页

    RunningTab 提出一种为直接工作区交互(DWI)配备环境侧标签页的框架,由环境记录任务待办项、已读文件摘录及已列出但未打开的文件候选。在三个基准测试、三种 LLM 上的验证中,RunningTab 持续优于普通 DWI 及将记录保存在模型内的基线方法,其标签页通常已包含交付物所需内容。

  2. arXiv cs.RO 机器人学66

    RoboJEPA:面向多本体机器人世界模型的扩展律研究

    论文提出基于 JEPA 的机器人世界模型 RoboJEPA,在覆盖 12 种机器人本体的大规模真实机器人数据集上训练,其想象误差(latent rollout 误差)随算力呈二阶幂律,可在拟合规模之外预测模型质量。

    推荐理由:论文给出想象误差随算力的二阶幂律,为评估多本体世界模型规模提供了可迁移的预测方法。

  3. arXiv cs.RO 机器人学47

    ActiveLang:语义不确定性引导探索的主动开放词汇 3D 地图构建

    ActiveLang 提出一种主动开放词汇 3D 地图构建系统,通过语义不确定性引导探索,在紧凑的双 Gaussian 表示上在线适配语言特征,联合重建场景几何、外观与开放词汇语义,内存开销较小。其规划器高效选取信息量高的视点,用更少观测和更低计算成本完成建图。在 Replica 和 ScanNet++ 上的实验显示,其 2D 与 3D 开放词汇分割效果相比在线与离线基线均有明显提升。

  4. arXiv cs.RO 机器人学55

    Kuration SDK:用数据策展弥合虚拟到现实差距

    论文提出面向物理 AI 数据策展的通用工具 Kuration SDK,并随论文开源。作者在 CounterStrike 游戏数据上训练和评估扩散世界模型,确认可玩性与 FVD、LPIPS、JEDi 等指标并不对应,将其称为 Virtual2Real gap;Kuration SDK 帮助定位了两个 LPIPS 和 FVD 分数接近、但实际表现差异很大的世界模型的根因。

  5. arXiv cs.RO 机器人学42

    LeCuration:用小型世界模型做数据筛选的多面工具

    LeCuration 是一个以 LeWorldModel(LeWM)为潜在编码器与预测器、并加入 diffusion transformer(DiT)解码器的小型世界模型,用作面向更大下游模型的数据筛选工具。其嵌入可作为异常检测信号和基于内容的聚类启发式,自回归预测游戏状态可定性检查动作-状态一致性。论文给出 CS:GO 游戏数据的概念验证案例,尚未报告定量筛选指标与下游训练结果。

  6. arXiv cs.RO 机器人学53

    研究:更优的视觉表征是否总能带来更好的端到端自动驾驶性能

    论文提出 planner 无关的视觉表征对齐框架 ViRA,在保持规划器架构与推理成本不变的前提下研究视觉基础模型(VFM)何时能提升驾驶性能。研究发现 VFM 引导的表征在多种端到端规划器上均能稳定提升性能并泛化到零样本闭环评测;VFM 目标的选择会影响规划性能,而辅助感知监督可将五个目标间的 EPDMS 差距从 2.7 分缩小到 0.5 分。

  7. arXiv cs.RO 机器人学47

    NAViLoss:面向水下导航的双残差目标函数,用于物理一致的 AUV 速度估计

    论文提出面向 AUV 速度估计的 NAViLoss 目标函数,联合惩罚导航状态域的速度估计残差与 DVL 测量域的波束一致性残差,其有界形式限制大残差影响,自适应机制调节波束几何不确定性。NAViLoss 与 DeepONet 架构结合构成 NAVi-DeepONet 模型,使用多次真实海试采集的约 10,000m 半合成 AUV 实验数据评估,速度估计精度较传统与学习型基线提升 44%。

  8. arXiv cs.RO 机器人学45

    SIGMA:面向决策关键型自动驾驶的仿真在环快慢推理框架

    SIGMA 提出一种仿真在环(simulation-in-the-loop)的快慢协作框架,将规划器嵌入不确定性评估,通过 expected planning gain(EPG)指标决定何时调用云端大模型推理。在 CARLA 实验中,相比固定周期协作,SIGMA 将不必要的云端交互减少 50%,导航成功率提升超过 6%,动态场景下完成时间最多缩短 26.2%。

  9. Hugging Face 每日论文55

    长上下文混合模型机理研究 Part 1.1:从混合注意力到混合位置

    论文提出长上下文混合模型机理系列研究 Part 1.1,聚焦全注意力与 SWA 或 GLA、GDN 等线性注意力变体的混合结构。作者观察到上下文扩展中的跷跷板效应,即线性注意力混合模型更受益于长上下文持续预训练,而 SWA 混合模型在长度外推上表现更好,并将其归因于位置归纳偏置差异;同时指出 SWA 混合模型存在短上下文学习陷阱、短窗口倦怠和长窗口惰性。

  10. Hugging Face 每日论文64

    Long-WAM:扩展世界-动作模型上下文的模型系统框架

    Long-WAM 提出在实时控制约束下扩展因果世界-动作模型上下文的模型系统框架,核心发现是访问历史不等于使用历史,更长历史只有在视频底座经自回归预训练时才显著见效。

    推荐理由:论文用对照实验说明自回归预训练的视频底座才让长历史真正转化为成功率提升,可为世界模型选型提供依据。

  11. Hugging Face 每日论文47

    AdvSim2Real:在冻结的 Web 世界模型中协同进化任务课程、注入对抗样本与 Web Agent,抵御自适应提示注入

    AdvSim2Real 在冻结的 Web 世界模型中协同进化任务课程、注入对抗样本与 Web Agent,使 4B agent 在有无攻击时完成率均提升,且能力增益可迁移到真实浏览器。在 150 个 Web 任务上,面对未训练过的前沿模型对抗者,AdvSim2Real 将完成率相对基础 agent 提升 33.6%。

10月7日周三
  1. Hugging Face 每日论文53

    通过推测执行隐藏端侧级联语音 Agent 的工具调用延迟

    端侧级联语音 Agent 采用推测工具执行方案,通过 Predictor 模块在 ASR 阶段预测工具调用并提前执行、缓存结果注入 LLM prompt,实测 Android 语音助手的中位首音频时间从 5.79s 降至 4.60s,标准差从 3.49s 降至 2.81s。方案用基于规则的校验机制过滤用户自我纠正导致的错误缓存,LLM 仍可直接发起工具调用,最坏情况延迟不高于基线串行流水线。

  2. arXiv cs.RO 机器人学58

    Micro Neural Policies 实现 MCU 上安全实时机器人控制

    论文提出 Micro Neural Policies(MNP)合成方法,结合 Evolution Strategy(ES)搜索与 Statistical Model Checking(SMC)验证,在不牺牲安全与鲁棒性的前提下大幅压缩神经网络规模。

    推荐理由:论文给出策略内存占用与抖动等量化指标,便于评估微型神经策略在 MCU 上的部署可行性。

  3. arXiv cs.RO 机器人学55

    ActTune:面向视觉-语言-动作推理的动作感知精度与 GPU 工作点自适应节能框架

    ActTune 提出动作感知框架,将逐层精度分配与 GPU 频率-功耗上限工作点选择结合,在 LIBERO 基准上将平均任务成功率较现有最优方法提升至多 2.3%。相比原始 BF16 实现,其推理速度最高提升 2.02 倍,配合 GPU 工作点自适应,每成功任务能耗最多降低 76.8%,同时将推理时延增幅控制在 10% 以内。

  4. arXiv cs.RO 机器人学55

    VLA-ACL:面向视觉语言动作模型的动作一致视觉 token 剪枝

    VLA-ACL 通过动作级监督学习轻量视觉 token 剪枝策略,在完全冻结基座 VLA 模型的前提下,最多剪枝 87.5% 的视觉 token,计算量最多降低 75%,推理加速 1.5x。LIBERO 与真实操作任务实验显示其保持了有竞争力的性能,优于现有冻结 VLA 剪枝方法的性能-效率权衡。代码已开源。

  5. arXiv cs.RO 机器人学62

    NTNU 提出可在单核 MCU 上运行的雷达惯性里程计

    NTNU 团队提出面向低算力平台的嵌入式雷达惯性估计器,所有传感器驱动、数据处理与辅助惯性导航均在单核 MCU 上运行。飞行实验显示相对动捕的平移 APE 为 0.51-0.82 m、RPE 低于 3%,并完成基于未修改 PX4 栈的闭环飞行;固件与 PCB 设计已在 GitHub 的 ntnu-arl/embedded_rio 和 ntnu-arl/embedded_rio-pcb 开源。

    推荐理由:论文给出单核 MCU 上的完整实现与实测误差区间,可评估其在算力受限平台替代视觉方案的可行性。

  6. arXiv cs.RO 机器人学51

    VLM 引导的电磁数字孪生在线标定 Demo:Unitree G1 实测 20 m 内电导率误差 1.74×10⁻⁴

    该 Demo 提出用视觉语言模型(VLM)引导电磁数字孪生在线标定的框架,基于 Unitree G1 机器人与 NVIDIA Sionna,包含两次 VLM 调用:材料分类通过 ITU-R P.2040 将可见材料映射为 Sionna 梯度下降的电导率先验,航点规划依据 RSS 残差标定误差与图像覆盖在线选择下一测量位置。

  7. arXiv cs.RO 机器人学60

    Flash-WAM 提出模态感知步蒸馏,将世界动作模型推理压缩到单步

    Flash-WAM 提出模态感知的步蒸馏框架,针对动作流低噪声区间采用线性梯度缩放参数化、视频流高噪声区间采用保方差参数化,把世界动作模型推理压缩到每个模态单步。

    推荐理由:论文给出了动作流与视频流噪声分布不对称的结构性分析,做世界动作模型实时推理的团队可据此选择一致性函数参数化。

  8. arXiv cs.RO 机器人学55

    DyQ-VLA 提出面向运行时误差的 VLA 动态量化框架

    DyQ-VLA 是一个面向运行时误差的 VLA 量化框架,按执行步动态选择激活精度,并通过累积量化残差跟踪和补偿旋转误差。论文对比全精度与量化模型的误差分布发现,量化会放大平移误差分布的方差与离散度,而旋转误差分布中心随执行步逐渐偏移,呈现累积漂移。实验显示 DyQ-VLA 实现 1.88 至 1.93 倍推理加速,平均任务成功率持平或更高,并将平均执行步数减少 17.7% 至 19.8%。

  9. arXiv cs.RO 机器人学57

    Same Pieces, Different Servers:面向"服务化"AI Agent 的 Tetris 基准测试

    研究者提出 Tetris 基准,用同一组方块、以 oracle 评分衡量 AI Agent 从"服务化"模型获得的决策质量。在一家 serverless 供应商上对 9 个开源权重模型做 5 组预设实验,并自托管一个开源决策模型跑在 CPU 上,发现价格与模型规模不预测决策质量;重发历史在缓存输入免费时几乎零成本,若不免费则贵 11-12 倍且让棋局变差。

  10. arXiv cs.RO 机器人学52

    AVS:面向异构自动驾驶数据流的车载计算型数据管理系统

    AVS 是一套分层车载数据管理系统,通过模态与任务感知预处理、分块索引追加式日志和 SSD-HDD 冷热分层,把瞬态多模态流压缩为可查询的长期历史。在真实 L4 平台三天 LiDAR、相机、GPS 并发日志上,存储较原始 rosbag2 减少 8.0-8.7x,SSD 热层查询 TTFB 0.9-9.1 ms、HDD 冷层 25.6-44.0 ms。

  11. arXiv cs.RO 机器人学58

    面向实时 VLA 的两阶段非均匀去噪与系统级评测

    论文针对 VLA 模型低速率推理与机器人高速率执行之间的时间差,测量了模型推理与机器人执行链的端到端时延,并提出两阶段非均匀去噪,将去噪步数从 10 步减到 2 步、模型推理时间从 61.557 ms 降到 21.956 ms。

    推荐理由:论文给出两步去噪把推理时间从 61.557 ms 降到 21.956 ms 的实测数据,可为 VLA 实时化优化提供参考。

  12. arXiv cs.RO 机器人学55

    RoboActualizer 论文提出在冻结世界模型上以 60M 参数生成机器人动作

    论文提出 actualization 任务,在冻结的视频世界模型之上用轻量模型选择并实现任务对应的未来状态,据此输出机器人动作。作者实现的 RoboActualizer 仅 60M 参数,由两个 DiT 专家通过 flow matching 联合预测未来 latents 与动作,可在单张 32 GB 显存 GPU 上训练完成。