RunningTab:为 LLM 智能体的直接工作区交互引入环境侧标签页
RunningTab 提出一种为直接工作区交互(DWI)配备环境侧标签页的框架,由环境记录任务待办项、已读文件摘录及已列出但未打开的文件候选。在三个基准测试、三种 LLM 上的验证中,RunningTab 持续优于普通 DWI 及将记录保存在模型内的基线方法,其标签页通常已包含交付物所需内容。
RunningTab 提出一种为直接工作区交互(DWI)配备环境侧标签页的框架,由环境记录任务待办项、已读文件摘录及已列出但未打开的文件候选。在三个基准测试、三种 LLM 上的验证中,RunningTab 持续优于普通 DWI 及将记录保存在模型内的基线方法,其标签页通常已包含交付物所需内容。
SWE-Game 推出一个由 247 项任务构成的游戏开发基准,覆盖 41 个可执行的 Godot 参考游戏、13 种 2D 与 3D 玩法类别,任务类型涵盖从需求简报生成游戏、按设计文档实现、骨架补全、83 例注入故障修复以及 Godot 到 Unity 移植。
一篇被 ACM Computer Survey 接收的综述系统梳理了生成式 AI 在自动驾驶全栈中的角色,覆盖 VAE、GAN、Diffusion Models 与 LLM 的原理与取舍,以及图像、LiDAR、轨迹、occupancy、视频生成和 LLM 引导的推理决策等前沿应用。
论文提出 OptCar,一种把通才前向运动学动力学(FKD)模型特化为特定车辆高速模型预测控制(MPC)的方法,用 FiLM 将多步预测条件化在单个动力学上下文 token 上,并结合少量真实数据与环境系统辨识的合成 rollout 进行特化。
论文提出 Ledger,一种从第一人称视频构建的持久 3D 物体记忆,结合物体位置、历史与上下文描述,可在物体离开视野后仍保留记录并回答空间问题。
论文提出基于 JEPA 的机器人世界模型 RoboJEPA,在覆盖 12 种机器人本体的大规模真实机器人数据集上训练,其想象误差(latent rollout 误差)随算力呈二阶幂律,可在拟合规模之外预测模型质量。
推荐理由:论文给出想象误差随算力的二阶幂律,为评估多本体世界模型规模提供了可迁移的预测方法。
ActiveLang 提出一种主动开放词汇 3D 地图构建系统,通过语义不确定性引导探索,在紧凑的双 Gaussian 表示上在线适配语言特征,联合重建场景几何、外观与开放词汇语义,内存开销较小。其规划器高效选取信息量高的视点,用更少观测和更低计算成本完成建图。在 Replica 和 ScanNet++ 上的实验显示,其 2D 与 3D 开放词汇分割效果相比在线与离线基线均有明显提升。
论文提出面向物理 AI 数据策展的通用工具 Kuration SDK,并随论文开源。作者在 CounterStrike 游戏数据上训练和评估扩散世界模型,确认可玩性与 FVD、LPIPS、JEDi 等指标并不对应,将其称为 Virtual2Real gap;Kuration SDK 帮助定位了两个 LPIPS 和 FVD 分数接近、但实际表现差异很大的世界模型的根因。
LeCuration 是一个以 LeWorldModel(LeWM)为潜在编码器与预测器、并加入 diffusion transformer(DiT)解码器的小型世界模型,用作面向更大下游模型的数据筛选工具。其嵌入可作为异常检测信号和基于内容的聚类启发式,自回归预测游戏状态可定性检查动作-状态一致性。论文给出 CS:GO 游戏数据的概念验证案例,尚未报告定量筛选指标与下游训练结果。
Long-WAM 提出在实时控制约束下扩展因果世界动作模型上下文的模型系统框架,核心发现是访问历史不等于利用历史,更长历史只有在视频基础模型采用自回归预训练时才显著见效。
同一新闻,精选展示《Long-WAM:扩展世界-动作模型上下文的模型系统框架》
RFPO 是一个面向连续机器人控制的流策略优化框架,用 Reward-aware 在线 Reflow 修正学生策略的传输路径,并以冻结的 Gaussian PPO 控制器在完整与中间积分预算下提供动作空间监督,使部署策略只需单步 Euler 积分即可执行。
RealtimeWAM 提出一个免训练的通用框架,通过并行执行与自适应计算降低世界动作模型(WAM)的推理延迟,可在 FastWAM 和 OpenWAM 等多种架构上复用。
AeroEval 是一个代理辅助中间件,对 LLM 生成的无人机任务做分阶段校验,先验证程序语法、平台 API 用法与任务意图,再结合执行轨迹、任务需求和环境上下文评估实际行为,每阶段返回结构化失败信息用于迭代重生成。
论文提出 planner 无关的视觉表征对齐框架 ViRA,在保持规划器架构与推理成本不变的前提下研究视觉基础模型(VFM)何时能提升驾驶性能。研究发现 VFM 引导的表征在多种端到端规划器上均能稳定提升性能并泛化到零样本闭环评测;VFM 目标的选择会影响规划性能,而辅助感知监督可将五个目标间的 EPDMS 差距从 2.7 分缩小到 0.5 分。
论文提出面向 AUV 速度估计的 NAViLoss 目标函数,联合惩罚导航状态域的速度估计残差与 DVL 测量域的波束一致性残差,其有界形式限制大残差影响,自适应机制调节波束几何不确定性。NAViLoss 与 DeepONet 架构结合构成 NAVi-DeepONet 模型,使用多次真实海试采集的约 10,000m 半合成 AUV 实验数据评估,速度估计精度较传统与学习型基线提升 44%。
SIGMA 提出一种仿真在环(simulation-in-the-loop)的快慢协作框架,将规划器嵌入不确定性评估,通过 expected planning gain(EPG)指标决定何时调用云端大模型推理。在 CARLA 实验中,相比固定周期协作,SIGMA 将不必要的云端交互减少 50%,导航成功率提升超过 6%,动态场景下完成时间最多缩短 26.2%。
论文提出长上下文混合模型机理系列研究 Part 1.1,聚焦全注意力与 SWA 或 GLA、GDN 等线性注意力变体的混合结构。作者观察到上下文扩展中的跷跷板效应,即线性注意力混合模型更受益于长上下文持续预训练,而 SWA 混合模型在长度外推上表现更好,并将其归因于位置归纳偏置差异;同时指出 SWA 混合模型存在短上下文学习陷阱、短窗口倦怠和长窗口惰性。
Long-WAM 提出在实时控制约束下扩展因果世界-动作模型上下文的模型系统框架,核心发现是访问历史不等于使用历史,更长历史只有在视频底座经自回归预训练时才显著见效。
推荐理由:论文用对照实验说明自回归预训练的视频底座才让长历史真正转化为成功率提升,可为世界模型选型提供依据。
GRACE 提出两阶段框架,在压缩预训练视频自编码器的同时保持与预训练 DiT 的兼容:冻结基础潜变量并学习残差潜变量补回强压缩损失的信息,在冻结 DiT 的特征空间中对齐压缩潜变量,再以轻量微调和非对称去噪适配 DiT。
AdvSim2Real 在冻结的 Web 世界模型中协同进化任务课程、注入对抗样本与 Web Agent,使 4B agent 在有无攻击时完成率均提升,且能力增益可迁移到真实浏览器。在 150 个 Web 任务上,面对未训练过的前沿模型对抗者,AdvSim2Real 将完成率相对基础 agent 提升 33.6%。
端侧级联语音 Agent 采用推测工具执行方案,通过 Predictor 模块在 ASR 阶段预测工具调用并提前执行、缓存结果注入 LLM prompt,实测 Android 语音助手的中位首音频时间从 5.79s 降至 4.60s,标准差从 3.49s 降至 2.81s。方案用基于规则的校验机制过滤用户自我纠正导致的错误缓存,LLM 仍可直接发起工具调用,最坏情况延迟不高于基线串行流水线。
GaussianCaR 提出一种端到端 BEV 分割网络,将 Gaussian Splatting 用作通用视角变换器,把图像像素与雷达点映射到统一的 Bird's-Eye View 表示,实现相机-雷达融合。
ACM MobiHoc 2026 接收的 Demo 论文展示了一个通过 ROS 2 耦合 NVIDIA Isaac Sim 与 NVIDIA Sionna 的实时协同仿真框架,闭合感知-动作-通信(PAC)环路。
论文提出 Loss-Conditioned Activation-Moment(LCAM)剪枝方法,一种面向预训练机器人操作策略的免训练非结构化剪枝方案,通过自递归由粗到细流程在剪枝后无需恢复训练与仿真 rollout。
论文提出 Micro Neural Policies(MNP)合成方法,结合 Evolution Strategy(ES)搜索与 Statistical Model Checking(SMC)验证,在不牺牲安全与鲁棒性的前提下大幅压缩神经网络规模。
推荐理由:论文给出策略内存占用与抖动等量化指标,便于评估微型神经策略在 MCU 上的部署可行性。
WareFly-VLA 发布了一套面向智能仓库的无人机 VLA 框架与数据集,包含 507 段人工遥操作飞行片段和 8,504 帧高分辨率 RGB 数据,均采集自 NVIDIA Isaac Sim,并配有目标工人的外观描述与四自由度同步控制指令。
ActTune 提出动作感知框架,将逐层精度分配与 GPU 频率-功耗上限工作点选择结合,在 LIBERO 基准上将平均任务成功率较现有最优方法提升至多 2.3%。相比原始 BF16 实现,其推理速度最高提升 2.02 倍,配合 GPU 工作点自适应,每成功任务能耗最多降低 76.8%,同时将推理时延增幅控制在 10% 以内。
VLA-ACL 通过动作级监督学习轻量视觉 token 剪枝策略,在完全冻结基座 VLA 模型的前提下,最多剪枝 87.5% 的视觉 token,计算量最多降低 75%,推理加速 1.5x。LIBERO 与真实操作任务实验显示其保持了有竞争力的性能,优于现有冻结 VLA 剪枝方法的性能-效率权衡。代码已开源。
NTNU 团队提出面向低算力平台的嵌入式雷达惯性估计器,所有传感器驱动、数据处理与辅助惯性导航均在单核 MCU 上运行。飞行实验显示相对动捕的平移 APE 为 0.51-0.82 m、RPE 低于 3%,并完成基于未修改 PX4 栈的闭环飞行;固件与 PCB 设计已在 GitHub 的 ntnu-arl/embedded_rio 和 ntnu-arl/embedded_rio-pcb 开源。
推荐理由:论文给出单核 MCU 上的完整实现与实测误差区间,可评估其在算力受限平台替代视觉方案的可行性。
该 Demo 提出用视觉语言模型(VLM)引导电磁数字孪生在线标定的框架,基于 Unitree G1 机器人与 NVIDIA Sionna,包含两次 VLM 调用:材料分类通过 ITU-R P.2040 将可见材料映射为 Sionna 梯度下降的电导率先验,航点规划依据 RSS 残差标定误差与图像覆盖在线选择下一测量位置。
TRACE 提出一种面向 MoE 语言模型强化学习训练的 FP4 量化框架,通过 rollout 侧量化结果引导训练侧 FP4 舍入决策,直接缩小训练与 rollout 两条量化执行路径的差异。
提出一种网络自适应的边缘辅助多视图定位框架,结合可扩展 O-VIB 编码(8 至 128 维嵌套潜变量前缀、四种 UAV 视角模式)、VOI 引导请求控制与价值感知边缘调度。
研究在 Transformer 船舶轨迹模型与四旋翼跟踪策略中测量记忆梯度截断的代价:船舶模型中切断 key-value cache 梯度使梯度范数缩至约十分之一,但一步物理信用下几乎不变;AdamW 将 2% 梯度差异放大为最高 31% 的更新差异。
Flash-WAM 提出模态感知的步蒸馏框架,针对动作流低噪声区间采用线性梯度缩放参数化、视频流高噪声区间采用保方差参数化,把世界动作模型推理压缩到每个模态单步。
推荐理由:论文给出了动作流与视频流噪声分布不对称的结构性分析,做世界动作模型实时推理的团队可据此选择一致性函数参数化。
DyQ-VLA 是一个面向运行时误差的 VLA 量化框架,按执行步动态选择激活精度,并通过累积量化残差跟踪和补偿旋转误差。论文对比全精度与量化模型的误差分布发现,量化会放大平移误差分布的方差与离散度,而旋转误差分布中心随执行步逐渐偏移,呈现累积漂移。实验显示 DyQ-VLA 实现 1.88 至 1.93 倍推理加速,平均任务成功率持平或更高,并将平均执行步数减少 17.7% 至 19.8%。
研究者提出 Tetris 基准,用同一组方块、以 oracle 评分衡量 AI Agent 从"服务化"模型获得的决策质量。在一家 serverless 供应商上对 9 个开源权重模型做 5 组预设实验,并自托管一个开源决策模型跑在 CPU 上,发现价格与模型规模不预测决策质量;重发历史在缓存输入免费时几乎零成本,若不免费则贵 11-12 倍且让棋局变差。
AVS 是一套分层车载数据管理系统,通过模态与任务感知预处理、分块索引追加式日志和 SSD-HDD 冷热分层,把瞬态多模态流压缩为可查询的长期历史。在真实 L4 平台三天 LiDAR、相机、GPS 并发日志上,存储较原始 rosbag2 减少 8.0-8.7x,SSD 热层查询 TTFB 0.9-9.1 ms、HDD 冷层 25.6-44.0 ms。
论文针对 VLA 模型低速率推理与机器人高速率执行之间的时间差,测量了模型推理与机器人执行链的端到端时延,并提出两阶段非均匀去噪,将去噪步数从 10 步减到 2 步、模型推理时间从 61.557 ms 降到 21.956 ms。
推荐理由:论文给出两步去噪把推理时间从 61.557 ms 降到 21.956 ms 的实测数据,可为 VLA 实时化优化提供参考。
论文提出 actualization 任务,在冻结的视频世界模型之上用轻量模型选择并实现任务对应的未来状态,据此输出机器人动作。作者实现的 RoboActualizer 仅 60M 参数,由两个 DiT 专家通过 flow matching 联合预测未来 latents 与动作,可在单张 32 GB 显存 GPU 上训练完成。
PredActor 是一种预测式动作扩散策略,仅依赖本体感知历史即可联合预测动作与内部未来状态轨迹,通过 classifier-free guidance 强化文本条件动作、classifier guidance 将未来状态引向测试时目标,无需动作参考跟踪器或特权全身状态。