至简动力冯宗宝:IROS 2026 演讲机器人自主值守双 CNC 机床
至简动力强化学习负责人冯宗宝在 IROS 2026 现场 Tech Talk 分享了机器人自主照看两台 CNC 机床的方案,在工件与卡盘间隙仅 0.5 毫米的场景下完成抓取、上料、取件与放置,且仅用 600 条真实机器人轨迹完成训练。
推荐理由:演讲给出了0.5毫米间隙下的具体方法组合与600条轨迹的训练规模,可参考其从实验室到工厂的落地路径。
至简动力强化学习负责人冯宗宝在 IROS 2026 现场 Tech Talk 分享了机器人自主照看两台 CNC 机床的方案,在工件与卡盘间隙仅 0.5 毫米的场景下完成抓取、上料、取件与放置,且仅用 600 条真实机器人轨迹完成训练。
推荐理由:演讲给出了0.5毫米间隙下的具体方法组合与600条轨迹的训练规模,可参考其从实验室到工厂的落地路径。
CAIR在香港具身智能医疗科技论坛上发布多模态临床智能体系统CARES 4.0,基于Harness智能体框架和自研CT、核磁、超声、内镜、脑电多模态医疗基座构建,已在多家三甲医院完成落地验证,官网已开放、框架与通用工具包已发布。
推荐理由:访谈对比了3.0与4.0的差别并给出幻觉治理思路,可迁移给做垂直领域智能体的团队。
华为全联接大会推出OceanStor M900,英伟达也已推出CMX Context Memory Storage,KV Cache外置存储成为行业共识。业内估算DRAM与企业级SSD同容量成本相差数十倍,替换比例可达1:N甚至一比五、一比十。但面向KV Cache优化的SSD尚无统一标准,耐写要求从3 DWPD到9 DWPD反复变化,业内预计形成产品共识还需6至12个月,产品开发验证再需约1年。
推荐理由:文章梳理了KV Cache外置存储的成本账与标准缺失现状,涉及具体DWPD指标和时间预期,便于评估相关采购决策。
RunningTab 提出一种为直接工作区交互(DWI)配备环境侧标签页的框架,由环境记录任务待办项、已读文件摘录及已列出但未打开的文件候选。在三个基准测试、三种 LLM 上的验证中,RunningTab 持续优于普通 DWI 及将记录保存在模型内的基线方法,其标签页通常已包含交付物所需内容。
SWE-Game 推出一个由 247 项任务构成的游戏开发基准,覆盖 41 个可执行的 Godot 参考游戏、13 种 2D 与 3D 玩法类别,任务类型涵盖从需求简报生成游戏、按设计文档实现、骨架补全、83 例注入故障修复以及 Godot 到 Unity 移植。
一篇被 ACM Computer Survey 接收的综述系统梳理了生成式 AI 在自动驾驶全栈中的角色,覆盖 VAE、GAN、Diffusion Models 与 LLM 的原理与取舍,以及图像、LiDAR、轨迹、occupancy、视频生成和 LLM 引导的推理决策等前沿应用。
论文提出 OptCar,一种把通才前向运动学动力学(FKD)模型特化为特定车辆高速模型预测控制(MPC)的方法,用 FiLM 将多步预测条件化在单个动力学上下文 token 上,并结合少量真实数据与环境系统辨识的合成 rollout 进行特化。
论文提出 Ledger,一种从第一人称视频构建的持久 3D 物体记忆,结合物体位置、历史与上下文描述,可在物体离开视野后仍保留记录并回答空间问题。
论文提出基于 JEPA 的机器人世界模型 RoboJEPA,在覆盖 12 种机器人本体的大规模真实机器人数据集上训练,其想象误差(latent rollout 误差)随算力呈二阶幂律,可在拟合规模之外预测模型质量。
推荐理由:论文给出想象误差随算力的二阶幂律,为评估多本体世界模型规模提供了可迁移的预测方法。
ActiveLang 提出一种主动开放词汇 3D 地图构建系统,通过语义不确定性引导探索,在紧凑的双 Gaussian 表示上在线适配语言特征,联合重建场景几何、外观与开放词汇语义,内存开销较小。其规划器高效选取信息量高的视点,用更少观测和更低计算成本完成建图。在 Replica 和 ScanNet++ 上的实验显示,其 2D 与 3D 开放词汇分割效果相比在线与离线基线均有明显提升。
论文提出面向物理 AI 数据策展的通用工具 Kuration SDK,并随论文开源。作者在 CounterStrike 游戏数据上训练和评估扩散世界模型,确认可玩性与 FVD、LPIPS、JEDi 等指标并不对应,将其称为 Virtual2Real gap;Kuration SDK 帮助定位了两个 LPIPS 和 FVD 分数接近、但实际表现差异很大的世界模型的根因。
LeCuration 是一个以 LeWorldModel(LeWM)为潜在编码器与预测器、并加入 diffusion transformer(DiT)解码器的小型世界模型,用作面向更大下游模型的数据筛选工具。其嵌入可作为异常检测信号和基于内容的聚类启发式,自回归预测游戏状态可定性检查动作-状态一致性。论文给出 CS:GO 游戏数据的概念验证案例,尚未报告定量筛选指标与下游训练结果。
Long-WAM 提出在实时控制约束下扩展因果世界动作模型上下文的模型系统框架,核心发现是访问历史不等于利用历史,更长历史只有在视频基础模型采用自回归预训练时才显著见效。
同一新闻,精选展示《Long-WAM:扩展世界-动作模型上下文的模型系统框架》
RFPO 是一个面向连续机器人控制的流策略优化框架,用 Reward-aware 在线 Reflow 修正学生策略的传输路径,并以冻结的 Gaussian PPO 控制器在完整与中间积分预算下提供动作空间监督,使部署策略只需单步 Euler 积分即可执行。
RealtimeWAM 提出一个免训练的通用框架,通过并行执行与自适应计算降低世界动作模型(WAM)的推理延迟,可在 FastWAM 和 OpenWAM 等多种架构上复用。
AeroEval 是一个代理辅助中间件,对 LLM 生成的无人机任务做分阶段校验,先验证程序语法、平台 API 用法与任务意图,再结合执行轨迹、任务需求和环境上下文评估实际行为,每阶段返回结构化失败信息用于迭代重生成。
论文提出 planner 无关的视觉表征对齐框架 ViRA,在保持规划器架构与推理成本不变的前提下研究视觉基础模型(VFM)何时能提升驾驶性能。研究发现 VFM 引导的表征在多种端到端规划器上均能稳定提升性能并泛化到零样本闭环评测;VFM 目标的选择会影响规划性能,而辅助感知监督可将五个目标间的 EPDMS 差距从 2.7 分缩小到 0.5 分。
论文提出面向 AUV 速度估计的 NAViLoss 目标函数,联合惩罚导航状态域的速度估计残差与 DVL 测量域的波束一致性残差,其有界形式限制大残差影响,自适应机制调节波束几何不确定性。NAViLoss 与 DeepONet 架构结合构成 NAVi-DeepONet 模型,使用多次真实海试采集的约 10,000m 半合成 AUV 实验数据评估,速度估计精度较传统与学习型基线提升 44%。
SIGMA 提出一种仿真在环(simulation-in-the-loop)的快慢协作框架,将规划器嵌入不确定性评估,通过 expected planning gain(EPG)指标决定何时调用云端大模型推理。在 CARLA 实验中,相比固定周期协作,SIGMA 将不必要的云端交互减少 50%,导航成功率提升超过 6%,动态场景下完成时间最多缩短 26.2%。
论文提出长上下文混合模型机理系列研究 Part 1.1,聚焦全注意力与 SWA 或 GLA、GDN 等线性注意力变体的混合结构。作者观察到上下文扩展中的跷跷板效应,即线性注意力混合模型更受益于长上下文持续预训练,而 SWA 混合模型在长度外推上表现更好,并将其归因于位置归纳偏置差异;同时指出 SWA 混合模型存在短上下文学习陷阱、短窗口倦怠和长窗口惰性。
Long-WAM 提出在实时控制约束下扩展因果世界-动作模型上下文的模型系统框架,核心发现是访问历史不等于使用历史,更长历史只有在视频底座经自回归预训练时才显著见效。
推荐理由:论文用对照实验说明自回归预训练的视频底座才让长历史真正转化为成功率提升,可为世界模型选型提供依据。
GRACE 提出两阶段框架,在压缩预训练视频自编码器的同时保持与预训练 DiT 的兼容:冻结基础潜变量并学习残差潜变量补回强压缩损失的信息,在冻结 DiT 的特征空间中对齐压缩潜变量,再以轻量微调和非对称去噪适配 DiT。
阶跃终端将于10月13日在上海举办“Ready Builder One”主题发布会,推出旗下首款大模型原生智能体手机STEPX Neo。STEPX Neo在模型、系统、硬件等方面皆为智能体原生打造,发布会还将公布阶跃终端在生态合作方面的最新进展。
一位创客用 ESP32-S3 制作了一台小型 AM 发射器,接收网络电台流后通过 GPIO 脉冲链生成射频信号,让老式电子管收音机重新发声。发射器采用 3D 打印外壳与支架固定的大间距线圈天线,输出频率为 200kHz 的欧洲长波波段,足以被老式收音机接收。作者指出该发射功率下可能不合规,但认为功率极低不会被察觉。
Efinix 推出 Sapphire RV64 SoC,这是一款面向 Titanium、Topaz 和 Trion(T20 及以上)FPGA 的可配置 64 位 RISC-V 软核,基于 VexiiRiscv,可配置 1 至 4 个核心,主频最高 400 MHz。
推荐理由:原文列出了主频、缓存、内存支持和外设配置,做 FPGA RISC-V 选型的工程师可据此评估是否替换现有 32 位方案。
法国 AI 公司 Mistral 发布新旗舰 Mistral Large 4,总参数 1 万亿、混合专家架构每 token 激活 490 亿参数,权重月底全部开源。
推荐理由:原文汇总了多项第三方评测分数与安全基准数据,便于横向比较其与闭源旗舰的差距。
作者为TinyML课程自研了一款嵌入式AI开发板,原因是现成开发板缺少联网模块(如ESP32),且难以在一块板上运行多个与实际产品相关的AI模型(如电机堵转模型)。设计上刻意拿掉WS2812彩灯、舵机/PWM、功耗测量等非必要功能,以简化维护。目标是让学员用同一块板完成数据采集、在STM32上运行模型并接着做联网实验。
文章对比爱芯元智AX8850与瑞芯微RK3588在端侧AI推理上的实测表现,引用双方官方benchmark数据,AX8850在YOLOv5s、YOLOv8n等模型上FPS达到RK3588单核的7~12倍。
推荐理由:原文用双方官方benchmark的同模型FPS对比,把标称TOPS与实际推理性能的差距讲清楚,可迁移为选型时看实测数据的方法。
AdvSim2Real 在冻结的 Web 世界模型中协同进化任务课程、注入对抗样本与 Web Agent,使 4B agent 在有无攻击时完成率均提升,且能力增益可迁移到真实浏览器。在 150 个 Web 任务上,面对未训练过的前沿模型对抗者,AdvSim2Real 将完成率相对基础 agent 提升 33.6%。
NVIDIA 提出用数字孪生与 AI Agent 验证 AI 工厂的基础设施、软件与策略变更。AI 工厂由 GPU、CPU、交换机、DPU、SuperNIC 以及调度器、编排服务、安全控制和快速变化的软件栈组成,部署与验证其协同工作均具挑战。
DSPi 是面向 Raspberry Pi Pico、Pico 2 及其他 RP2040/RP2350 板卡的音频 DSP 固件,可将其变为带集成 DSP 的 USB 声卡,支持房间校正、有源分频、参数 EQ、时间对齐等功能。
推荐理由:原文列出了 DSPi 在 RP2040 与 RP2350 上的滤波器数量、通道数和数学引擎差异,便于按硬件选型评估。
端侧级联语音 Agent 采用推测工具执行方案,通过 Predictor 模块在 ASR 阶段预测工具调用并提前执行、缓存结果注入 LLM prompt,实测 Android 语音助手的中位首音频时间从 5.79s 降至 4.60s,标准差从 3.49s 降至 2.81s。方案用基于规则的校验机制过滤用户自我纠正导致的错误缓存,LLM 仍可直接发起工具调用,最坏情况延迟不高于基线串行流水线。
GaussianCaR 提出一种端到端 BEV 分割网络,将 Gaussian Splatting 用作通用视角变换器,把图像像素与雷达点映射到统一的 Bird's-Eye View 表示,实现相机-雷达融合。
ACM MobiHoc 2026 接收的 Demo 论文展示了一个通过 ROS 2 耦合 NVIDIA Isaac Sim 与 NVIDIA Sionna 的实时协同仿真框架,闭合感知-动作-通信(PAC)环路。
论文提出 Loss-Conditioned Activation-Moment(LCAM)剪枝方法,一种面向预训练机器人操作策略的免训练非结构化剪枝方案,通过自递归由粗到细流程在剪枝后无需恢复训练与仿真 rollout。
论文提出 Micro Neural Policies(MNP)合成方法,结合 Evolution Strategy(ES)搜索与 Statistical Model Checking(SMC)验证,在不牺牲安全与鲁棒性的前提下大幅压缩神经网络规模。
推荐理由:论文给出策略内存占用与抖动等量化指标,便于评估微型神经策略在 MCU 上的部署可行性。
WareFly-VLA 发布了一套面向智能仓库的无人机 VLA 框架与数据集,包含 507 段人工遥操作飞行片段和 8,504 帧高分辨率 RGB 数据,均采集自 NVIDIA Isaac Sim,并配有目标工人的外观描述与四自由度同步控制指令。
ActTune 提出动作感知框架,将逐层精度分配与 GPU 频率-功耗上限工作点选择结合,在 LIBERO 基准上将平均任务成功率较现有最优方法提升至多 2.3%。相比原始 BF16 实现,其推理速度最高提升 2.02 倍,配合 GPU 工作点自适应,每成功任务能耗最多降低 76.8%,同时将推理时延增幅控制在 10% 以内。
VLA-ACL 通过动作级监督学习轻量视觉 token 剪枝策略,在完全冻结基座 VLA 模型的前提下,最多剪枝 87.5% 的视觉 token,计算量最多降低 75%,推理加速 1.5x。LIBERO 与真实操作任务实验显示其保持了有竞争力的性能,优于现有冻结 VLA 剪枝方法的性能-效率权衡。代码已开源。
NTNU 团队提出面向低算力平台的嵌入式雷达惯性估计器,所有传感器驱动、数据处理与辅助惯性导航均在单核 MCU 上运行。飞行实验显示相对动捕的平移 APE 为 0.51-0.82 m、RPE 低于 3%,并完成基于未修改 PX4 栈的闭环飞行;固件与 PCB 设计已在 GitHub 的 ntnu-arl/embedded_rio 和 ntnu-arl/embedded_rio-pcb 开源。
推荐理由:论文给出单核 MCU 上的完整实现与实测误差区间,可评估其在算力受限平台替代视觉方案的可行性。