跳到正文
今天10月8日周四30 条
  1. 雷锋网62

    至简动力冯宗宝:IROS 2026 演讲机器人自主值守双 CNC 机床

    至简动力强化学习负责人冯宗宝在 IROS 2026 现场 Tech Talk 分享了机器人自主照看两台 CNC 机床的方案,在工件与卡盘间隙仅 0.5 毫米的场景下完成抓取、上料、取件与放置,且仅用 600 条真实机器人轨迹完成训练。

    推荐理由:演讲给出了0.5毫米间隙下的具体方法组合与600条轨迹的训练规模,可参考其从实验室到工厂的落地路径。

  2. 雷锋网58

    CAIR发布多模态临床智能体CARES 4.0,刘宏斌谈其从工具升级为智能体

    CAIR在香港具身智能医疗科技论坛上发布多模态临床智能体系统CARES 4.0,基于Harness智能体框架和自研CT、核磁、超声、内镜、脑电多模态医疗基座构建,已在多家三甲医院完成落地验证,官网已开放、框架与通用工具包已发布。

    推荐理由:访谈对比了3.0与4.0的差别并给出幻觉治理思路,可迁移给做垂直领域智能体的团队。

  3. 雷锋网62

    华为已为KV Cache单独做存储,专用SSD规格却还没定下来

    华为全联接大会推出OceanStor M900,英伟达也已推出CMX Context Memory Storage,KV Cache外置存储成为行业共识。业内估算DRAM与企业级SSD同容量成本相差数十倍,替换比例可达1:N甚至一比五、一比十。但面向KV Cache优化的SSD尚无统一标准,耐写要求从3 DWPD到9 DWPD反复变化,业内预计形成产品共识还需6至12个月,产品开发验证再需约1年。

    推荐理由:文章梳理了KV Cache外置存储的成本账与标准缺失现状,涉及具体DWPD指标和时间预期,便于评估相关采购决策。

  4. Hugging Face 每日论文47

    RunningTab:为 LLM 智能体的直接工作区交互引入环境侧标签页

    RunningTab 提出一种为直接工作区交互(DWI)配备环境侧标签页的框架,由环境记录任务待办项、已读文件摘录及已列出但未打开的文件候选。在三个基准测试、三种 LLM 上的验证中,RunningTab 持续优于普通 DWI 及将记录保存在模型内的基线方法,其标签页通常已包含交付物所需内容。

  5. arXiv cs.RO 机器人学66

    RoboJEPA:面向多本体机器人世界模型的扩展律研究

    论文提出基于 JEPA 的机器人世界模型 RoboJEPA,在覆盖 12 种机器人本体的大规模真实机器人数据集上训练,其想象误差(latent rollout 误差)随算力呈二阶幂律,可在拟合规模之外预测模型质量。

    推荐理由:论文给出想象误差随算力的二阶幂律,为评估多本体世界模型规模提供了可迁移的预测方法。

  6. arXiv cs.RO 机器人学47

    ActiveLang:语义不确定性引导探索的主动开放词汇 3D 地图构建

    ActiveLang 提出一种主动开放词汇 3D 地图构建系统,通过语义不确定性引导探索,在紧凑的双 Gaussian 表示上在线适配语言特征,联合重建场景几何、外观与开放词汇语义,内存开销较小。其规划器高效选取信息量高的视点,用更少观测和更低计算成本完成建图。在 Replica 和 ScanNet++ 上的实验显示,其 2D 与 3D 开放词汇分割效果相比在线与离线基线均有明显提升。

  7. arXiv cs.RO 机器人学55

    Kuration SDK:用数据策展弥合虚拟到现实差距

    论文提出面向物理 AI 数据策展的通用工具 Kuration SDK,并随论文开源。作者在 CounterStrike 游戏数据上训练和评估扩散世界模型,确认可玩性与 FVD、LPIPS、JEDi 等指标并不对应,将其称为 Virtual2Real gap;Kuration SDK 帮助定位了两个 LPIPS 和 FVD 分数接近、但实际表现差异很大的世界模型的根因。

  8. arXiv cs.RO 机器人学42

    LeCuration:用小型世界模型做数据筛选的多面工具

    LeCuration 是一个以 LeWorldModel(LeWM)为潜在编码器与预测器、并加入 diffusion transformer(DiT)解码器的小型世界模型,用作面向更大下游模型的数据筛选工具。其嵌入可作为异常检测信号和基于内容的聚类启发式,自回归预测游戏状态可定性检查动作-状态一致性。论文给出 CS:GO 游戏数据的概念验证案例,尚未报告定量筛选指标与下游训练结果。

  9. arXiv cs.RO 机器人学53

    研究:更优的视觉表征是否总能带来更好的端到端自动驾驶性能

    论文提出 planner 无关的视觉表征对齐框架 ViRA,在保持规划器架构与推理成本不变的前提下研究视觉基础模型(VFM)何时能提升驾驶性能。研究发现 VFM 引导的表征在多种端到端规划器上均能稳定提升性能并泛化到零样本闭环评测;VFM 目标的选择会影响规划性能,而辅助感知监督可将五个目标间的 EPDMS 差距从 2.7 分缩小到 0.5 分。

  10. arXiv cs.RO 机器人学47

    NAViLoss:面向水下导航的双残差目标函数,用于物理一致的 AUV 速度估计

    论文提出面向 AUV 速度估计的 NAViLoss 目标函数,联合惩罚导航状态域的速度估计残差与 DVL 测量域的波束一致性残差,其有界形式限制大残差影响,自适应机制调节波束几何不确定性。NAViLoss 与 DeepONet 架构结合构成 NAVi-DeepONet 模型,使用多次真实海试采集的约 10,000m 半合成 AUV 实验数据评估,速度估计精度较传统与学习型基线提升 44%。

  11. arXiv cs.RO 机器人学45

    SIGMA:面向决策关键型自动驾驶的仿真在环快慢推理框架

    SIGMA 提出一种仿真在环(simulation-in-the-loop)的快慢协作框架,将规划器嵌入不确定性评估,通过 expected planning gain(EPG)指标决定何时调用云端大模型推理。在 CARLA 实验中,相比固定周期协作,SIGMA 将不必要的云端交互减少 50%,导航成功率提升超过 6%,动态场景下完成时间最多缩短 26.2%。

  12. Hugging Face 每日论文55

    长上下文混合模型机理研究 Part 1.1:从混合注意力到混合位置

    论文提出长上下文混合模型机理系列研究 Part 1.1,聚焦全注意力与 SWA 或 GLA、GDN 等线性注意力变体的混合结构。作者观察到上下文扩展中的跷跷板效应,即线性注意力混合模型更受益于长上下文持续预训练,而 SWA 混合模型在长度外推上表现更好,并将其归因于位置归纳偏置差异;同时指出 SWA 混合模型存在短上下文学习陷阱、短窗口倦怠和长窗口惰性。

  13. Hugging Face 每日论文64

    Long-WAM:扩展世界-动作模型上下文的模型系统框架

    Long-WAM 提出在实时控制约束下扩展因果世界-动作模型上下文的模型系统框架,核心发现是访问历史不等于使用历史,更长历史只有在视频底座经自回归预训练时才显著见效。

    推荐理由:论文用对照实验说明自回归预训练的视频底座才让长历史真正转化为成功率提升,可为世界模型选型提供依据。

  14. Hackaday47

    用 ESP32-S3 小型 AM 发射器让老式收音机继续发声

    一位创客用 ESP32-S3 制作了一台小型 AM 发射器,接收网络电台流后通过 GPIO 脉冲链生成射频信号,让老式电子管收音机重新发声。发射器采用 3D 打印外壳与支架固定的大间距线圈天线,输出频率为 200kHz 的欧洲长波波段,足以被老式收音机接收。作者指出该发射功率下可能不合规,但认为功率极低不会被察觉。

  15. CNX Software62

    Efinix 发布 Sapphire RV64 可配置 RISC-V 软核 SoC

    Efinix 推出 Sapphire RV64 SoC,这是一款面向 Titanium、Topaz 和 Trion(T20 及以上)FPGA 的可配置 64 位 RISC-V 软核,基于 VexiiRiscv,可配置 1 至 4 个核心,主频最高 400 MHz。

    推荐理由:原文列出了主频、缓存、内存支持和外设配置,做 FPGA RISC-V 选型的工程师可据此评估是否替换现有 32 位方案。

  16. 玩转单片机与嵌入式44

    为什么为TinyML自研一款嵌入式AI开发板

    作者为TinyML课程自研了一款嵌入式AI开发板,原因是现成开发板缺少联网模块(如ESP32),且难以在一块板上运行多个与实际产品相关的AI模型(如电机堵转模型)。设计上刻意拿掉WS2812彩灯、舵机/PWM、功耗测量等非必要功能,以简化维护。目标是让学员用同一块板完成数据采集、在STM32上运行模型并接着做联网实验。

  17. 嵌入式Linux60

    爱芯元智AX8850与瑞芯微RK3588端侧AI实测对比与选型分析

    文章对比爱芯元智AX8850与瑞芯微RK3588在端侧AI推理上的实测表现,引用双方官方benchmark数据,AX8850在YOLOv5s、YOLOv8n等模型上FPS达到RK3588单核的7~12倍。

    推荐理由:原文用双方官方benchmark的同模型FPS对比,把标称TOPS与实际推理性能的差距讲清楚,可迁移为选型时看实测数据的方法。

  18. Hugging Face 每日论文47

    AdvSim2Real:在冻结的 Web 世界模型中协同进化任务课程、注入对抗样本与 Web Agent,抵御自适应提示注入

    AdvSim2Real 在冻结的 Web 世界模型中协同进化任务课程、注入对抗样本与 Web Agent,使 4B agent 在有无攻击时完成率均提升,且能力增益可迁移到真实浏览器。在 150 个 Web 任务上,面对未训练过的前沿模型对抗者,AdvSim2Real 将完成率相对基础 agent 提升 33.6%。

10月7日周三
  1. CNX Software58

    DSPi 固件让 Raspberry Pi RP2040/RP2350 变身带 DSP 引擎的 USB 声卡

    DSPi 是面向 Raspberry Pi Pico、Pico 2 及其他 RP2040/RP2350 板卡的音频 DSP 固件,可将其变为带集成 DSP 的 USB 声卡,支持房间校正、有源分频、参数 EQ、时间对齐等功能。

    推荐理由:原文列出了 DSPi 在 RP2040 与 RP2350 上的滤波器数量、通道数和数学引擎差异,便于按硬件选型评估。

  2. Hugging Face 每日论文53

    通过推测执行隐藏端侧级联语音 Agent 的工具调用延迟

    端侧级联语音 Agent 采用推测工具执行方案,通过 Predictor 模块在 ASR 阶段预测工具调用并提前执行、缓存结果注入 LLM prompt,实测 Android 语音助手的中位首音频时间从 5.79s 降至 4.60s,标准差从 3.49s 降至 2.81s。方案用基于规则的校验机制过滤用户自我纠正导致的错误缓存,LLM 仍可直接发起工具调用,最坏情况延迟不高于基线串行流水线。

  3. arXiv cs.RO 机器人学58

    Micro Neural Policies 实现 MCU 上安全实时机器人控制

    论文提出 Micro Neural Policies(MNP)合成方法,结合 Evolution Strategy(ES)搜索与 Statistical Model Checking(SMC)验证,在不牺牲安全与鲁棒性的前提下大幅压缩神经网络规模。

    推荐理由:论文给出策略内存占用与抖动等量化指标,便于评估微型神经策略在 MCU 上的部署可行性。

  4. arXiv cs.RO 机器人学55

    ActTune:面向视觉-语言-动作推理的动作感知精度与 GPU 工作点自适应节能框架

    ActTune 提出动作感知框架,将逐层精度分配与 GPU 频率-功耗上限工作点选择结合,在 LIBERO 基准上将平均任务成功率较现有最优方法提升至多 2.3%。相比原始 BF16 实现,其推理速度最高提升 2.02 倍,配合 GPU 工作点自适应,每成功任务能耗最多降低 76.8%,同时将推理时延增幅控制在 10% 以内。

  5. arXiv cs.RO 机器人学55

    VLA-ACL:面向视觉语言动作模型的动作一致视觉 token 剪枝

    VLA-ACL 通过动作级监督学习轻量视觉 token 剪枝策略,在完全冻结基座 VLA 模型的前提下,最多剪枝 87.5% 的视觉 token,计算量最多降低 75%,推理加速 1.5x。LIBERO 与真实操作任务实验显示其保持了有竞争力的性能,优于现有冻结 VLA 剪枝方法的性能-效率权衡。代码已开源。

  6. arXiv cs.RO 机器人学62

    NTNU 提出可在单核 MCU 上运行的雷达惯性里程计

    NTNU 团队提出面向低算力平台的嵌入式雷达惯性估计器,所有传感器驱动、数据处理与辅助惯性导航均在单核 MCU 上运行。飞行实验显示相对动捕的平移 APE 为 0.51-0.82 m、RPE 低于 3%,并完成基于未修改 PX4 栈的闭环飞行;固件与 PCB 设计已在 GitHub 的 ntnu-arl/embedded_rio 和 ntnu-arl/embedded_rio-pcb 开源。

    推荐理由:论文给出单核 MCU 上的完整实现与实测误差区间,可评估其在算力受限平台替代视觉方案的可行性。