跳到正文
10月7日周三
  1. arXiv cs.RO 机器人学62

    NTNU 提出可在单核 MCU 上运行的雷达惯性里程计

    NTNU 团队提出面向低算力平台的嵌入式雷达惯性估计器,所有传感器驱动、数据处理与辅助惯性导航均在单核 MCU 上运行。飞行实验显示相对动捕的平移 APE 为 0.51-0.82 m、RPE 低于 3%,并完成基于未修改 PX4 栈的闭环飞行;固件与 PCB 设计已在 GitHub 的 ntnu-arl/embedded_rio 和 ntnu-arl/embedded_rio-pcb 开源。

    推荐理由:论文给出单核 MCU 上的完整实现与实测误差区间,可评估其在算力受限平台替代视觉方案的可行性。

  2. arXiv cs.RO 机器人学51

    VLM 引导的电磁数字孪生在线标定 Demo:Unitree G1 实测 20 m 内电导率误差 1.74×10⁻⁴

    该 Demo 提出用视觉语言模型(VLM)引导电磁数字孪生在线标定的框架,基于 Unitree G1 机器人与 NVIDIA Sionna,包含两次 VLM 调用:材料分类通过 ITU-R P.2040 将可见材料映射为 Sionna 梯度下降的电导率先验,航点规划依据 RSS 残差标定误差与图像覆盖在线选择下一测量位置。

  3. arXiv cs.RO 机器人学60

    Flash-WAM 提出模态感知步蒸馏,将世界动作模型推理压缩到单步

    Flash-WAM 提出模态感知的步蒸馏框架,针对动作流低噪声区间采用线性梯度缩放参数化、视频流高噪声区间采用保方差参数化,把世界动作模型推理压缩到每个模态单步。

    推荐理由:论文给出了动作流与视频流噪声分布不对称的结构性分析,做世界动作模型实时推理的团队可据此选择一致性函数参数化。

  4. arXiv cs.RO 机器人学55

    DyQ-VLA 提出面向运行时误差的 VLA 动态量化框架

    DyQ-VLA 是一个面向运行时误差的 VLA 量化框架,按执行步动态选择激活精度,并通过累积量化残差跟踪和补偿旋转误差。论文对比全精度与量化模型的误差分布发现,量化会放大平移误差分布的方差与离散度,而旋转误差分布中心随执行步逐渐偏移,呈现累积漂移。实验显示 DyQ-VLA 实现 1.88 至 1.93 倍推理加速,平均任务成功率持平或更高,并将平均执行步数减少 17.7% 至 19.8%。

  5. arXiv cs.RO 机器人学57

    Same Pieces, Different Servers:面向"服务化"AI Agent 的 Tetris 基准测试

    研究者提出 Tetris 基准,用同一组方块、以 oracle 评分衡量 AI Agent 从"服务化"模型获得的决策质量。在一家 serverless 供应商上对 9 个开源权重模型做 5 组预设实验,并自托管一个开源决策模型跑在 CPU 上,发现价格与模型规模不预测决策质量;重发历史在缓存输入免费时几乎零成本,若不免费则贵 11-12 倍且让棋局变差。

  6. arXiv cs.RO 机器人学52

    AVS:面向异构自动驾驶数据流的车载计算型数据管理系统

    AVS 是一套分层车载数据管理系统,通过模态与任务感知预处理、分块索引追加式日志和 SSD-HDD 冷热分层,把瞬态多模态流压缩为可查询的长期历史。在真实 L4 平台三天 LiDAR、相机、GPS 并发日志上,存储较原始 rosbag2 减少 8.0-8.7x,SSD 热层查询 TTFB 0.9-9.1 ms、HDD 冷层 25.6-44.0 ms。

  7. arXiv cs.RO 机器人学58

    面向实时 VLA 的两阶段非均匀去噪与系统级评测

    论文针对 VLA 模型低速率推理与机器人高速率执行之间的时间差,测量了模型推理与机器人执行链的端到端时延,并提出两阶段非均匀去噪,将去噪步数从 10 步减到 2 步、模型推理时间从 61.557 ms 降到 21.956 ms。

    推荐理由:论文给出两步去噪把推理时间从 61.557 ms 降到 21.956 ms 的实测数据,可为 VLA 实时化优化提供参考。

  8. arXiv cs.RO 机器人学55

    RoboActualizer 论文提出在冻结世界模型上以 60M 参数生成机器人动作

    论文提出 actualization 任务,在冻结的视频世界模型之上用轻量模型选择并实现任务对应的未来状态,据此输出机器人动作。作者实现的 RoboActualizer 仅 60M 参数,由两个 DiT 专家通过 flow matching 联合预测未来 latents 与动作,可在单张 32 GB 显存 GPU 上训练完成。

  9. arXiv cs.RO 机器人学58

    FLASH Policy 用稀疏采样与 Legendre 多项式实现高效视觉运动策略

    FLASH Policy 用 Legendre 多项式连续轨迹表示替代离散动作块生成,通过稀疏时间采样拟合专家演示,单次推理即可覆盖更长的动作时域。该方法以历史多项式系数而非高斯噪声初始化流匹配,缩短传输距离并支持单步推理,多项式解析求导还可直接为力矩控制器提供速度前馈信号。

    推荐理由:用 Legendre 多项式连续轨迹替代离散动作块,配合历史系数初始化流匹配,给出了单步推理与速度前馈的完整实现思路。

  10. arXiv cs.RO 机器人学58

    ProbeFlow 提出免训练自适应 Flow Matching 推理框架,加速 VLA 模型动作解码

    Zhou Fang 等提出 ProbeFlow,一种面向 VLA 模型的免训练自适应推理框架,通过初始与前瞻速度向量的余弦相似度评估轨迹复杂度并动态调度积分步数,以剪枝冗余网络评估。

    推荐理由:原文给出用速度向量余弦相似度动态调度积分步数的方法,可迁移到其他 Flow Matching 动作头的推理加速。

  11. arXiv cs.RO 机器人学58

    研究刻画 VLA 工作负载特性,指导具身 AI 系统设计

    一篇将发表于 ASPLOS '27 的论文对 4 个代表性 VLA 模型在边缘 GPU 服务器和两款车载 SoC 上做了单次推理剖析与 43,200 次闭环实验。结果显示动作张量维度决定各阶段是内存受限还是算力受限,平台平衡会改变瓶颈位置,GPU 频率调节存在平台相关的能耗-时延最优区间。闭环运行中推理与动作执行重叠会带来精度-速度-能耗权衡,没有一种配置在各类部署 SLO 下都占优。

    推荐理由:论文给出 VLA 模型在 batch-1 控制场景下的内存与算力瓶颈判定依据,可为模型、硬件与运行时联合设计提供参考。

  12. arXiv cs.RO 机器人学53

    VLA-ZO:面向视觉-语言-动作模型的快速零阶适配框架

    VLA-ZO 提出一种快速零阶(ZO)适配框架,通过冻结视觉-语言前缀并复用其条件状态,将适配限制在动作侧,配合调度感知预取隐藏状态传输开销。在 LIBERO 相机视角偏移上,VLA-ZO 在 q=16 和 q=64 时端到端适配时间分别较基线 ZO 缩短 25.59× 和 32.54×,平均任务成功率从不适配的 48.27% 提升至 58.17% 和 63.58%。

  13. arXiv cs.RO 机器人学55

    RiskFly:面向动态杂乱环境单阶段敏捷飞行的视锥对齐时空风险场

    RiskFly 提出一种单阶段规划器,用视锥对齐的时空风险场预测危险出现的位置与时间,替代仅输出标量轨迹代价的编码信号。双流观测将短深度序列与倒球面距离图序列配对,辅助头回归由特权最近接近点(CPA)目标监督的风险场,并沿五次轨迹可微查询。仿真与零样本真实飞行显示,在资源受限平台上成功率更高且端到端时延相当。

10月6日周二
  1. IoT物联网技术64

    Meta 开源 Muse Gadgets 硬件开发套件,适配 ESP32 与树莓派

    Meta 开源了 Muse Gadgets 硬件开发套件,包含乐鑫ESP32固件和 Linux SDK,开发者可用几十元的 ESP32 开发板或树莓派为个人桌面 AI Agent Muse 制作物理外设,实现智能家居控制、日程提醒等功能。

    推荐理由:原文给出了硬件BOM成本、固件与Linux SDK分工和刷写绑定流程,想自制Muse外设的开发者可据此评估上手成本。

  2. Hackaday55

    新型 LLM 决策模型 Jev:只输出浮点数、极快极便宜

    新型决策模型 Jev 数周前发布,专注分类与决策任务,无法写出任何句子,但可极快地完成分类与归类。它接受文本输入,仅输出浮点数,作为用户指定的 yes/no 问题、选项列表和评分请求的答案。Simon Willison 总结了 Jev 的做法,Kev 与 Nimble 等同类模型也已出现,Nimble 刚被 Ollama 支持,体积小到可相对轻松地本地运行。

  3. Hackaday55

    SecurePair 让两块 ESP32 用单颗 LED 通过可见光通信

    Luca Soltoggio 让两块 ESP32 用单颗 LED 同时作发射与接收器件,通过可见光完成通信。这套名为 SecurePair 的 Arduino 库用于交换密钥并进行加密通信,也可配合 ESPNow 或 LoRa 使用,典型场景是用光完成配对、用无线传输加密数据。它利用了 LED 同时具备一定光电二极管特性的原理,且参与通信的设备不限于两块 ESP32。

  4. 芯板坊57

    香橙派发布 O1 开发板,基于算能 BM1688,16TOPS 算力并带 SATA 与工业接口

    香橙派发布 O1 开发板,首次采用算能 BM1688,TPU 算力 16TOPS@INT8、32TOPS@INT4,配 8 个 Cortex-A53 核心与 RISC-V C906 协处理器。该板带 SATA3.0、双千兆网口、CAN 与 RS485 等接口,内存可选 8GB 或 16GB,8GB 版 1699 元、16GB 版 2799 元,定位工厂监控等边缘 AI 场景。

    推荐理由:原文给出算力、接口、价格与同类开发板对比,选型时可据此评估边缘AI场景的取舍。

  5. Hugging Face 每日论文55

    WorldSonus:为世界模型实时合成空间立体声的视频到音频框架

    WorldSonus 提出面向世界模型的交互式视频到音频框架,用于实时空间声音合成。其采用流式因果自回归扩散架构,以 0.41 的低实时因子(RTF)生成音频块,并通过音频描述流水线与按块索引的提示调度实现生成中动态控制声音事件,同时用立体声与 ambisonic 数据做空间对齐监督。