跳到正文
今天10月8日周四142 条
  1. CNX Software57

    ZeroWire Robotics 推出开源四足机器人 Q8botOne,众筹价 199 美元起

    ZeroWire Robotics 推出掌心大小的开源四足机器人 Q8botOne,基于 ESP32-C3-MINI-1-N4 模块与 8 个 ROBOTIS DYNAMIXEL XL330-M077-T 智能执行器,采用无缆架构,把所有核心元件集成到兼作底盘的中央 PCB 上,尺寸 120 x 70 x 70 mm、重约 221 至 250 克,可慢跑、跳跃并承载约两倍自重。

    推荐理由:原文列出了主控、执行器、电源架构和两档售价,便于与同类小型四足机器人做选型对比。

  2. 雷锋网62

    至简动力冯宗宝:IROS 2026 演讲机器人自主值守双 CNC 机床

    至简动力强化学习负责人冯宗宝在 IROS 2026 现场 Tech Talk 分享了机器人自主照看两台 CNC 机床的方案,在工件与卡盘间隙仅 0.5 毫米的场景下完成抓取、上料、取件与放置,且仅用 600 条真实机器人轨迹完成训练。

    推荐理由:演讲给出了0.5毫米间隙下的具体方法组合与600条轨迹的训练规模,可参考其从实验室到工厂的落地路径。

  3. 雷锋网58

    北醒李远:给机器造眼睛,与「自讨苦吃」的十一年

    雷峰网左林右狸频道对话北醒(Benewake)CEO 李远,回顾其十一年创业历程与对物理 AI 的判断。今年上半年北醒交付机器人用激光雷达 25 万台,机器人业务收入占公司营收超过一半,2025 年该项收入比 2024 年翻了一倍,海外占比超过 50%。

    推荐理由:访谈披露了北醒机器人激光雷达的出货与收入占比,可据此判断机器人赛道的实际放量节奏。

  4. 雷锋网58

    Naive AI 成立 7 个月三轮融资 4 亿美元,背后是代季峰 8 人团队

    清华背景公司 Naive AI(工商注册名北京智衍慧生科技有限公司)成立 7 个月完成三轮融资共 4 亿美元,投后估值 14.2 亿美元,投资方包括腾讯、博裕、红杉中国、IDG、经纬、君联资本等。

    推荐理由:梳理了团队从 MSRA、商汤到上海 AI Lab 的十年合作脉络,可理解资本押注这支队伍的依据。

  5. 雷锋网58

    CAIR发布多模态临床智能体CARES 4.0,刘宏斌谈其从工具升级为智能体

    CAIR在香港具身智能医疗科技论坛上发布多模态临床智能体系统CARES 4.0,基于Harness智能体框架和自研CT、核磁、超声、内镜、脑电多模态医疗基座构建,已在多家三甲医院完成落地验证,官网已开放、框架与通用工具包已发布。

    推荐理由:访谈对比了3.0与4.0的差别并给出幻觉治理思路,可迁移给做垂直领域智能体的团队。

  6. Hugging Face 每日论文56

    RLHND:用视频基础模型从第一人称视频同时估计手部位姿与触觉

    RLHND 提出一种基于视频基础模型的手部跟踪模型,从单目第一人称视频中联合估计手部位姿与真实触觉信息。它把预训练的 Cosmos 3 视频扩散主干通过 clean-latent 条件化改造成确定性的片段级特征提取器,位姿流预测解剖学上合理的关节角度并支持形状参数条件化,触觉流在位姿流冻结下预测手表面的密集接触与力。

    推荐理由:论文说明了用视频基础模型补上接触与力线索的思路,关注人视频用于机器人策略训练的读者可了解其方法路径。

  7. 雷锋网55

    对话如祺出行COO韩锋:世界模型越强,真实数据才是真壁垒

    雷锋网对话如祺出行COO韩锋,阐述其不做大模型、专注做AI数据基础设施的路线。韩锋认为世界模型越强,真实数据越重要,真实数据负责发现与验证未知问题,合成数据负责对已发现问题做定向扩展,两者形成互补闭环。数据业务2026年上半年收入同比增长274.4%,半年收入已超1亿元;2026年6月还推出了处理Ego-centric第一人称操作视频的具身智能数据平台。

  8. 雷锋网58

    吴佳俊 IROS 2026 演讲:结构化表征是机器人学会推理的脚手架

    斯坦福大学助理教授吴佳俊在 IROS 2026 RoBoWoMo 研讨会发表受邀报告《Building Physical Agents via Structured Representations》,以洗盘子场景说明机器人需应对初始状态的定性差别与新观测。

    推荐理由:演讲把结构化表征定位为可迁移的中间接口而非硬约束,对做机器人学习框架的人有方法论参考。

  9. 雷锋网64

    银河通用与清华 LATENT:用不完美人类数据让 Unitree G1 学会网球对打

    IROS 2026 上,银河通用 GaLbot 团队与清华大学、北京大学、上海启智研究院和上海人工智能实验室提出 LATENT,让 Unitree G1 从 5 名业余球员在 3米×5米区域采集的约 5 小时不完美动作数据中学习网球能力。

    推荐理由:文中给出成功率、消融和真机限定条件,读者可据此判断该方法的真实能力边界。

  10. 雷锋网60

    研究了1933篇 IROS 2026 论文,我们看到了机器人学的六项新变化

    文章对 IROS 2026 进入正式议程的 1933 篇论文做多标签梳理,Robot Learning / Embodied AI 约 809 篇、Navigation / Planning 564 篇、Humanoid / Legged 约 213 篦,指出大模型并没有吃掉机器人学,学习、感知、规划、控制与操作正深度交织。

    推荐理由:对1933篇论文的多标签统计给出了各方向的篇数与交叉数据,可据此判断机器人研究的真实重心分布。

  11. Hugging Face 每日论文49

    Tetris3D:生成彼此契合物体的单图 3D 场景重建框架

    Tetris3D 提出一种单图 3D 场景重建生成框架,显式以周围物体几何及其物理关系为条件生成每个物体,使形状与位姿在场景中保持几何与物理合理。研究同时发布基于物理仿真的数据集 ComOb,包含 1.2M 个场景,提供逐物体网格与成对物理关系标注。在合成与真实场景实验中,Tetris3D 在交互区域被遮挡时仍能恢复连贯的物体形状与位姿,生成质量与物理稳定性达到 state-of-the-art。

  12. arXiv cs.RO 机器人学54

    FAOC:通过可行动作映射衔接强化学习与最优控制

    论文提出 FAOC 框架,将强化学习与最优控制结合,通过基于优化的映射算法把 RL 智能体的抽象动作转换为最优控制问题中依赖状态的可行参数集,保证参数瞬时可行。配合不变终端集,FAOC 保证严格递归可行与安全运行,且抽象动作空间无需专家调参。在机器人乒乓球实时运动规划的仿真实验中,其样本效率与闭环性能优于现有基线,映射算法与运动规划 OCP 实现已开源。

  13. arXiv cs.RO 机器人学38

    WSM-Aware HRI:基于 LLM 引导的 IoT 增强框架,用于人机交互故障的早期检测与规范引导修复

    研究提出 WSM-Aware HRI 框架,将人机交互故障统一为世界状态不匹配(WSM),借助 LLM 把隐含假设显式化并映射到少量不匹配类型,从而在意图形成阶段主动检测故障。系统在 10 个日常场景(涵盖视觉与潜在状态不匹配)上评测,可准确产出预期结果;消融实验表明,可靠识别依赖合适的表征与面向验证的细化。

  14. arXiv cs.RO 机器人学49

    CoRe-WAM:基于对应对齐时序残差的世界动作模型

    CoRe-WAM 提出 TraceDelta 模块,用冻结跟踪模型的对应关系将历史视觉特征搬运到当前位置再计算带符号差值,仅优化 1.59 million 参数、5,000 次更新适配预算下,在 RoboTwin 2.0 的 50 项任务上 clean 成功率达 92.22%,较 Motus 提升 3.56 个百分点,随机化评测下 89.60%、提升 2.58 个百分点。

  15. arXiv cs.RO 机器人学64

    Visible Touch:为视觉运动策略渲染接触信息

    Visible Touch 论文提出把接触信号暴露在策略已关注的同一空间坐标系中,使任何图像条件策略无需架构改动即可直接利用触觉信息,并配套开源一款用现成零件经参数化 CAD-to-mold 流水线制造的低成本磁性接触传感器。

    推荐理由:论文给出把接触信号嵌入策略已有视觉坐标系的做法与开源低成本传感器,读者可据此评估无需改动架构的触觉接入路径。

  16. arXiv cs.RO 机器人学25

    SAIN:面向移动机器人的结构感知交互导航与主动对话接地(已撤稿)

    SAIN 提出一种零样本框架,将主动对话转化为持久导航状态,在 VL-LN IIGN 基准上把 SR 从 20.2 提升到 25.4、SPL 从 13.07 提升到 14.17,超过最强的对话式基线且无需任务特定策略训练。该预印本已由作者 YuHao Cao 撤稿,原因是团队内部对现阶段公开发布存在分歧。

  17. arXiv cs.RO 机器人学44

    ED3R:面向野火检测的能量感知分布式机器人协同框架

    ED3R 提出一种能量感知的分布式野火检测框架,通过机器人与远程控制器的分层协同决策,在满足置信度要求的同时最小化能耗。该框架集成避障、冗余探索规避与基于分布式神经回归模型的前瞻能力,任务成功率最高达 97.18%。在最严苛任务中,相比基线方法能耗降低最多 36.4%,野火检测速度提升最多 41%。

  18. arXiv cs.RO 机器人学57

    论文提出针对机器人学习管线中世界模型的数据投毒攻击

    论文提出针对机器人学习管线中世界模型的新型数据投毒攻击,可在看似安全的遥操作数据集中注入恶意提示或被破坏的转移动力学,仅在经世界模型输入后激活,进而生成危险的合成训练轨迹并导致不安全的机器人策略部署。作者在动作条件和文本条件世界模型上验证了攻击效果,展示了针对下游 DRL 策略的端到端后门以及 VLA 场景的概念验证,呼吁研究更安全的世界模型并重新评估其在机器人学习供应链中的位置。

  19. arXiv cs.RO 机器人学47

    WorldDP:面向多阶段机器人任务的分层世界模型与 Diffusion Policy 框架

    WorldDP 提出一种面向多阶段机器人操作任务的分层世界模型框架,高层世界模型作为转移函数在运行时优化可行子目标,再由低层 Diffusion Policy 执行到达。框架引入以物体为中心的表征,将环境实体解耦以支持逐实体的顺序规划。在多个机器人基准测试上,WorldDP 持续优于现有基线,验证了世界模型的物理规划与 Diffusion Policy 高效执行相结合的多阶段性能优势。

  20. arXiv cs.RO 机器人学58

    arXiv 论文提出 AICON 自适应零空间投影方法,让多目标行为在冲突处即时反应式组合

    论文指出多目标机器人任务的失败多源于静态目标表示而非任务复杂度,为此在 AICON 图结构上扩展自适应零空间投影:低优先级梯度在相遇处进入高优先级梯度的零空间,按当前梯度幅值排序而非固定层级;当两梯度对立且任何加权都无法前进时,系统在较强者的零空间中探索直至冲突消解。

  21. arXiv cs.RO 机器人学55

    NovaPlan:基于闭环视频语言规划的零样本长时域机器人操作框架

    NovaPlan 是一个分层框架,通过系统性地提出、验证和修复视觉计划,实现鲁棒的零样本长时域操作。高层由 VLM 规划器分解任务,并通过验证多个候选视频回滚过滤动力学不一致的未来;执行中采用在物体中心流与人手流之间自适应切换的混合几何表示,并持续监控执行、在失败时合成指尖轻戳等局部非抓取纠正行为。