3D 异构多智能体追逃博弈中的加权匹配:缓解 Geometric Sprawl 失败模式
一项针对 3D 异构多智能体追逃博弈(reach-avoid games)的研究提出基数优先的加权序贯匹配方法,以 Hamilton–Jacobi–Isaacs 拦截值 $z_I(s,j)$ 作为次级分配权重,缓解仅基数匹配在几何结构场景中出现的 "Geometric Sprawl" 失败模式。
一项针对 3D 异构多智能体追逃博弈(reach-avoid games)的研究提出基数优先的加权序贯匹配方法,以 Hamilton–Jacobi–Isaacs 拦截值 $z_I(s,j)$ 作为次级分配权重,缓解仅基数匹配在几何结构场景中出现的 "Geometric Sprawl" 失败模式。
论文提出 RMRRT(Riemannian Barrier Metric RRT),在单一几何框架内统一等式与不等式约束,先由不等式敏感的势垒项构建环境势垒度量,再经与等式约束关联的 (G)-正交投影诱导切空间度量,并一致用于转向与最近邻选择。
一种可解释性引导的多目标进化方法将 DNN 控制的 LeoRover 鲁棒性测试中位成功率从无引导搜索的 53.85% 提升至 70.0%,中位超体积从 0.65 提高到 0.73。
TRACE 提出一种面向 MoE 语言模型强化学习训练的 FP4 量化框架,通过 rollout 侧量化结果引导训练侧 FP4 舍入决策,直接缩小训练与 rollout 两条量化执行路径的差异。
CLRE 提出一种分层滚动时域控制框架,在冻结上游规划器、不引入新学习模型的前提下,通过有限时域最优控制与预测条件 OBB 可行性测试筛选候选轨迹,下层结合距离速度上限与饱和比例制动律执行。在 Bench2Drive 220 条路线验证集上以 VAD 为上游规划器闭环仿真,驾驶得分从 42.26 提升至 55.89,路线完成率从 55.69 提升至 71.51,碰撞事件从 117 降至 97。
CoDimRecon 提出一个智能体框架,从多视角 RGB 观测重建包含刚性、铰接与可变形物体的可编辑仿真就绪 3D 场景。可变形物体按维度重建为带半径的中心线曲线、带厚度的流形壳曲面和用于体网格化的水密实体,智能体引导的行为测试会暴露不匹配并触发针对性修订。在 Replica 与 ScanNet++ 场景上取得有竞争力的组合重建精度,并演示了三类表示下的机器人交互,包括促使塑性弯曲的折纸案例。
提出一种网络自适应的边缘辅助多视图定位框架,结合可扩展 O-VIB 编码(8 至 128 维嵌套潜变量前缀、四种 UAV 视角模式)、VOI 引导请求控制与价值感知边缘调度。
研究在 Transformer 船舶轨迹模型与四旋翼跟踪策略中测量记忆梯度截断的代价:船舶模型中切断 key-value cache 梯度使梯度范数缩至约十分之一,但一步物理信用下几乎不变;AdamW 将 2% 梯度差异放大为最高 31% 的更新差异。
FIRE3D 提出统一框架,将单张 RGB 图像或随手视频在 1 分钟内(含预处理)转换为最多 12 个带纹理实例的可交互 3D 场景资产。其前馈推理管线从 RGB 捕获估计的 posed RGB-D 观测预测组合式场景表示,输出每个检测物体的 6-DoF 位姿、包围盒、mesh 与纹理,无需测试时优化。该框架在评测基准上取得领先的检测精度、强几何重建与有竞争力的渲染质量,并显著快于对比重建系统。
研究者提出 Manipulation-Grounded Visual Question Answering(MG-VQA)任务与 MG-VQA-Bench 基准,包含 600 个人工核验问题、覆盖 4 类空间推理任务,并在杂乱桌面交互环境中评测 8 个 VLM。
该综述提出可信物理智能(T-PAI)理论框架,系统梳理物理智能在物理安全、信息物理安全与制造过程等方面的可信挑战。研究沿五个核心阶段追踪物理智能端到端生命周期,提出可信物理智能操作化方法 T-PAIO,并组织关键可信原则,为治理可信物理智能系统提供理论基础。
IBPA 将 Ball Pivoting Algorithm 改造为增量式实时自由曲面重建方法,从流式点云数据中构建可定向流形网格,无需假设点云重叠或空间分布,并集成孔洞检测机制以高亮不完整网格区域。相比 DTM 等高度场表示,IBPA 支持悬垂与垂直结构等更复杂表面拓扑,适用于 ROV 与 AUV 水下测深数据采集时的实时覆盖可视化。参考实现源码将在预印本上线后公开。
LoopVLA 提出跨子任务事件记忆接口,将刚完成的子任务压缩为记忆供下一子任务的动作专家调用,以支持重复执行与停止决策。可学习事件隐变量查询已闭合片段的 token,动作特征查询历史与联合历史-事件上下文,两路读出经残差融合注入动作头。在记忆基准上,LoopVLA 配合在线子目标预测在重复任务组取得 80.22% 成功率,整体成功率优于强记忆基线。
Flash-WAM 提出模态感知的步蒸馏框架,针对动作流低噪声区间采用线性梯度缩放参数化、视频流高噪声区间采用保方差参数化,把世界动作模型推理压缩到每个模态单步。
推荐理由:论文给出了动作流与视频流噪声分布不对称的结构性分析,做世界动作模型实时推理的团队可据此选择一致性函数参数化。
M²-Occ 提出一种在多相机输入不完整时仍能保持几何结构与语义一致的 3D 语义占据预测框架,包含 Multi-view Masked Reconstruction(MMR)与 Feature Memory Module(FMM)两个模块。
DyQ-VLA 是一个面向运行时误差的 VLA 量化框架,按执行步动态选择激活精度,并通过累积量化残差跟踪和补偿旋转误差。论文对比全精度与量化模型的误差分布发现,量化会放大平移误差分布的方差与离散度,而旋转误差分布中心随执行步逐渐偏移,呈现累积漂移。实验显示 DyQ-VLA 实现 1.88 至 1.93 倍推理加速,平均任务成功率持平或更高,并将平均执行步数减少 17.7% 至 19.8%。
研究者提出 Tetris 基准,用同一组方块、以 oracle 评分衡量 AI Agent 从"服务化"模型获得的决策质量。在一家 serverless 供应商上对 9 个开源权重模型做 5 组预设实验,并自托管一个开源决策模型跑在 CPU 上,发现价格与模型规模不预测决策质量;重发历史在缓存输入免费时几乎零成本,若不免费则贵 11-12 倍且让棋局变差。
AVS 是一套分层车载数据管理系统,通过模态与任务感知预处理、分块索引追加式日志和 SSD-HDD 冷热分层,把瞬态多模态流压缩为可查询的长期历史。在真实 L4 平台三天 LiDAR、相机、GPS 并发日志上,存储较原始 rosbag2 减少 8.0-8.7x,SSD 热层查询 TTFB 0.9-9.1 ms、HDD 冷层 25.6-44.0 ms。
EndoWave 提出统一时空 Gaussian Splatting 框架,在 4D 域直接优化高斯基元,并引入光流几何约束与多分辨率有理正交小波监督,以应对内窥镜场景的光度不一致、非刚性组织运动和视角相关高光。在 EndoNeRF 与 StereoMIS 两个真实手术数据集上,EndoWave 的重建质量与视觉精度相比基线方法达到 state-of-the-art 水平。
RefAtomNet++ 通过整体句子、部分关键词和场景属性三级语义建模,用细粒度语义线索跨时间检索对齐视觉 token 构建轨迹,经 Mamba 状态空间建模聚合与多层级语义对齐跨注意力融合,实现人物定位与多标签原子动作识别。
一篇 arXiv 论文提出基于图的盲楼层分离框架,仅用 Wi-Fi 指纹轨迹实现多楼层垂直定位,无需先验建筑信息或楼层数。
一项研究系统评估了 Vanilla BC、LSTM-GMM、IBC、Diffusion Policy 与 VQ-BET 等模仿学习算法在白盒、灰盒和黑盒对抗扰动下的脆弱性。
推荐理由:论文给出白盒与黑盒迁移攻击下的成功率下降幅度,可作为评估模仿学习策略鲁棒性的对照基准。
提出开放世界全景分割方法 Con2MAV,可在测试时发现新语义类别与新物体实例,并保持增量发现类别间的一致性,在道路到水下多类数据集上展现开放世界分割能力与已知类别竞争力。同时发布自动驾驶异常分割基准 PANIC,含 800 张图像、50 多个未知类别、4,000 多个物体实例及像素级语义与实例标注,并提供隐藏测试集竞赛。实现将在录用后开源,论文已被 IJRR 接收。
预测性肌骨仿真显示,50 Nm 峰值力矩下髋-膝-踝(H+K+A)联合助力使六名受试者的运输成本(COT)平均降低 48.50 +/- 4.55%,个体降幅 42.22% 至 54.65%。
Zhuo Lin 等人提出 InterEvolve,在不重新训练的前提下让控制器通过测试时进化完成未训练过的人形 loco-manipulation 任务。方法包含 object-aware forward-backward 行为基础模型,以及由 LLM 智能体结合执行反馈与技能库修订结构、数值优化器调节常数的奖励程序。
UniWAM 提出一种统一架构,将物理推理器、世界生成器与动作预测器结合,共同学习物理世界的语义理解、视觉生成和动作预测。论文针对人类第一视角数据与机器人数据建立了数据清洗与标注流程,用自然语言表示低层动作,并在后训练中引入未来视觉噪声增强与基于历史条件的 flow matching,以减少去噪步数并保持性能。
FlashDexRetarget 提出一种基于强化学习的多参考灵巧重定向框架,用单一策略联合学习多条演示,将重定向优化成本分摊到各参考上。
推荐理由:论文给出与 CHORD 的对比数据,可帮助评估多参考重定向在数据生成成本上的实际收益。
论文提出 Embodied Agent Arena,用 1,000 个案例评测七个 VLM 智能体在几何、空间推理、可供性、任务规划和操作五类能力上的表现,案例取自 32 个已有来源并新增几何估计基准 GeoProbe,覆盖 Blender 渲染图与真实场景图像。
Samuel Liu 等人构建 real2sim2real 流水线,将世界对齐与行为对齐作为两个独立变量,研究二者对协同训练策略性能的影响。在动态灵巧抓取分拣任务上,完全对齐的协同训练把成功率从 52% 提升到 86%;跨配置平均,世界对齐提升 18 个百分点,行为对齐提升 10 个百分点。
推荐理由:论文把世界对齐与行为对齐拆成两个独立变量,给出各自对成功率的贡献幅度,做仿真协同训练的人可据此分配数据投入。
DITTO-X 是一种与手型无关的灵巧遥操作接口,利用机器人手自带的传感渲染关节力与指尖接触事件,并可直接驱动 Sharpa、Wuji、Inspire 三款商用灵巧手而无需逐手重新设计。
研究者构建同一双臂机器人单元的两套仿真版本,对比自建重建(度量尺度物体几何、人工编写物理参数、自建场景 splat)与开源默认重建(生成式单图 mesh、引擎默认物理、Gaussian-splat 场景)对 sim-to-real 评分一致性的影响。
Token-World 是一种动作条件世界模型,将 VLM 特征压缩为紧凑 token 状态,在降维空间学习未来动态并映射回策略表示,用于机器人操作。在闭环评估中,其模拟策略性能与参考策略的相关性高于 Ctrl-World(r=0.794 vs. 0.583),且仿真时延更低。消融实验显示紧凑表示的设计与维度显著影响未来状态预测,代码将开源。
Magic-W0 提出结构化世界-动作基础模型,将交互建模为由 Current State、Transition、Future State 组成的 Structured World Transition,并以层对齐架构耦合世界转移预测与动作生成。
论文针对 VLA 模型低速率推理与机器人高速率执行之间的时间差,测量了模型推理与机器人执行链的端到端时延,并提出两阶段非均匀去噪,将去噪步数从 10 步减到 2 步、模型推理时间从 61.557 ms 降到 21.956 ms。
推荐理由:论文给出两步去噪把推理时间从 61.557 ms 降到 21.956 ms 的实测数据,可为 VLA 实时化优化提供参考。
EmbodiRSI 是一个面向 real-to-sim-to-real 的递归自我改进(RSI)agentic 系统,从目标部署场景构建任务专属仿真,用策略执行反馈引导经验采集与策略更新,包含 Collaborative Error Correction 与 Adaptive Data Collection 两个互补机制。
DODGER 是一个安全引导强化学习框架,直接执行策略生成的动作驱动训练 rollout,同时用 CBF 过滤参考与约束违例塑造避碰行为,避免仅执行安全过滤动作限制策略探索。该方法经 Dubins-car 安全分析验证,并在全尺寸人形仿真与真实人形机器人实验中基于 LiDAR 感知完成多动态障碍物目标导航,运行时无需安全过滤器。
论文提出 actualization 任务,在冻结的视频世界模型之上用轻量模型选择并实现任务对应的未来状态,据此输出机器人动作。作者实现的 RoboActualizer 仅 60M 参数,由两个 DiT 专家通过 flow matching 联合预测未来 latents 与动作,可在单张 32 GB 显存 GPU 上训练完成。
提出 LQR-ArUco 融合的分层控制框架,解决两轮倒立摆(TWIP)机器人在非对称物体操作中的动态失稳与导航漂移。机外视觉系统跟踪 ArUco 标记提供高时延全局航点导航以绕开里程计漂移,机载低时延控制环用惯性与编码器数据抑制扰动。实测中该双环方案让自制机器人准确导航、抵御减速带冲击、适应动态跷跷板坡道并稳定搬运负载。
CoBrush 提出一种分层规划框架,把多轮人机协同绘画拆解为语义、空间与执行三层协调过程,将高层意图推断与空间定位、笔触级控制分离,支持在真实丙烯画布上渐进式构建复杂场景。真实人机绘画会话、压力测试与用户研究表明,相比单轮基线,CoBrush 在语义对齐、空间推进稳定性与机器人动作合理性上更优。该工作已被 IROS 2026 接收。
斯坦福等机构研究者提出 DexAgent,一个 agentic Human2Sim2Robot 框架,把单段第一视角人类视频和任务提示转成可用于策略训练的物理可落地机器人轨迹。