统一运动学表示实现可复用的生物关节力矩估计
论文提出以关节运动学作为中间表示,将硬件相关传感与下游生物关节力矩估计解耦,估计器仅用开源生物力学数据训练。在髋部外骨骼、膝部外骨骼和IMU传感器套件的平地与坡道行走数据上评估,RMSE分别为0.17 Nm/kg(R2=0.79)、0.19 Nm/kg(R2=0.62)和0.15 Nm/kg(R2=0.85),表明仅用开源数据训练的估计器可跨不同可穿戴平台运行。
论文提出以关节运动学作为中间表示,将硬件相关传感与下游生物关节力矩估计解耦,估计器仅用开源生物力学数据训练。在髋部外骨骼、膝部外骨骼和IMU传感器套件的平地与坡道行走数据上评估,RMSE分别为0.17 Nm/kg(R2=0.79)、0.19 Nm/kg(R2=0.62)和0.15 Nm/kg(R2=0.85),表明仅用开源数据训练的估计器可跨不同可穿戴平台运行。
论文在两个架构族的四个已发布 checkpoint 上观察到世界模型对动作变化敏感度弱、对已验证失败给出成功样预测,并提出 CureWM 方法:从成功演示构造替代动作、在仿真或硬件中执行验证结果,再用得到的失败与存活成功微调已发布模型。
FlashNeRD 通过并行流式架构、可在任意位置接受接触的编码器,以及与解析求解器对象的双向耦合,解决了 Neural Robot Dynamics (NeRD) 加速有限、仅支持预定义接触点、与被操作对象缺乏双向耦合三个局限。
论文提出 Workhorse,让机器人从无人参与的人类演示中学习接触密集的全身操作,视觉规划器预测躯干、双腕和双足五个连杆目标,强化学习全身跟踪器在机器人上跟随,两策略在相同人类姿态数据上分别训练且无需重定向。
MimicX 提出一种 policy-in-the-loop 框架,利用执行反馈精化视频驱动的人形动作跟踪训练监督,定位困难过渡与受影响身体部位,并联合调整跟踪目标与 reset 课程。
PhysEvo 提出围绕单一冻结模型的物理递归自改进(RSI)框架,由任务 agent 执行机器人任务、meta-agent 依据轨迹诊断失败并修订工具与技能,全程不更新模型权重也不训练独立动作策略。
论文提出 HULK 全身控制框架,用 MPC 预测负载动力学引导强化学习,训练两个教师策略(腕力下跟踪手臂动作、抱持大物体行走),再蒸馏为单一策略,并在仿真与 Unitree G1 上评测。仿真中带屏障函数的教师在每臂 10 kg 负载下前向与横向速度跟踪误差最低,DCM 偏移总量较仅用 MPC 引导强化学习降低 35.7%,腕力教师可承受高达 130 N 的躯干推扰。
一篇被 2026 IEEE/RSJ IROS 空间机器人研讨会接收的论文提出了一种证据驱动的人-智能体-机器人协作架构,用于深空任务中脱离地面支持的异常分诊。该架构将 Agentic AI 作为有状态协调器,通过分诊状态管理器维护假设与证据溯源,并由移动机器人获取局部证据,已在基于 Reachy Mini 和 Innate MARS 移动机器人的硬件在环原型上验证。
论文研究了 DexUMI 系列外骨骼的两个版本,二者共享相同的机器人指令定义、映射流程和触觉模块类型,但手侧几何不同。改款接口降低了操作者体力负担,在基线版本被机械阻挡的精密抓握中实现了触觉采集,并带来任务相关的接触变化:拧盖任务主要表现为接触位置改变,打开蛋托主要表现为接触有无变化。
论文提出 Ariadne,通过学习状态空间流形并利用其几何结构进行轨迹规划,训练只需状态观测、无需专家轨迹数据。在 Maze2D 与机器人运动规划基准上,Ariadne 能从仅状态监督构建可行路径并泛化到未见过的起终点组合;在高维双臂规划上,其表现与轨迹监督方法和经典规划器相当。该论文已被 NeurIPS 2026 接收,代码已开源。
论文提出CIRRA(Continual Instruction Reconciliation for Robot Agents)双层框架,让家庭机器人在执行任务过程中接收新指令时,保留正在进行的子任务序列作为执行骨架,仅对被修改的片段做语义推理,插入位置匹配的新子任务,从而减少计划歧义、逻辑不一致和冗余执行。
研究团队提出首个在开放、无约束表面上实现闭环自主液滴导航的机器人平台,采用模型强化学习,仅用 50 至 150 次物理实验(视几何复杂度而定)训练策略,无需仿真或解析模型。
Go2-DrivoR 将端到端自动驾驶轨迹规划框架 DrivoR 改造为面向四足机器人城市导航的目标条件版本,通过 goal token 注入局部坐标系子目标并重定义人行道导向的可行驶区域合规性。
论文提出一种基于 Vision-Language Models 的上下文感知自适应喷药框架,让机器人结合作物类型、农药类型和天气数据进行空间推理与喷洒决策,并用基于 Model Predictive Path Integral 控制的轨迹跟踪控制器保证导航与喷洒精度。
SAFE 是一种低成本通用传感方案,用两个无源 PVDF 声学传感器加电机本体感知,在不依赖视觉和先验材料知识的情况下实时检测抓取中的滑移与断裂。
一篇 arXiv 综述系统梳理了机器人领域基于因子图与场景图的世界模型如何应对动态环境,围绕表示、构建与更新流程、下游任务利用三方面展开,并重点分析融合两类图的混合模型。综述归纳了常见架构模式,并指出从学习感知到表示层的不确定性传播、动态实体运动可观测性、可扩展的终身维护,以及缺乏数据集与评测协议等开放挑战。全文 34 页,含 7 张表、8 幅图。
WebFovea 是一个视觉网页智能体,在 WebRetriever Challenge 2026 中以 57.0/100 的成绩获得第二名,评测基于 WebRetriever 基准的 Protocol III,要求智能体从入口 URL 出发操作真实网站并返回可验证答案。
论文提出长上下文混合模型机理系列研究 Part 1.1,聚焦全注意力与 SWA 或 GLA、GDN 等线性注意力变体的混合结构。作者观察到上下文扩展中的跷跷板效应,即线性注意力混合模型更受益于长上下文持续预训练,而 SWA 混合模型在长度外推上表现更好,并将其归因于位置归纳偏置差异;同时指出 SWA 混合模型存在短上下文学习陷阱、短窗口倦怠和长窗口惰性。
SGF+(Self Gradient Forcing Plus)为自回归视频生成中的上下文写入与去噪分配独立参数,通过因果注意力保留两者交互,并用原始生成目标联合优化。在仅用 5s rollout 训练的条件下,SGF+ 无需长视频微调即可连续生成长达 24 小时的视频,视觉质量与长时一致性优于所评测的基线,且无需额外视频训练数据或更长训练周期。
论文提出从多向量视觉文档检索器存储的索引中反演还原原始页面,把反演建模为条件文档图像生成。在 ViDoRe v3 基准上,从原始索引反演的页面可恢复 47% 的词和 45% 的敏感 token,用作查询时 98.4% 能把源页面排在首位。
推荐理由:论文用实验量化了多向量文档索引的反演风险,并测试了两种低成本防护的实际效果,做文档检索系统安全评估时可参考其方法。
Long-WAM 提出在实时控制约束下扩展因果世界-动作模型上下文的模型系统框架,核心发现是访问历史不等于使用历史,更长历史只有在视频底座经自回归预训练时才显著见效。
推荐理由:论文用对照实验说明自回归预训练的视频底座才让长历史真正转化为成功率提升,可为世界模型选型提供依据。
GRACE 提出两阶段框架,在压缩预训练视频自编码器的同时保持与预训练 DiT 的兼容:冻结基础潜变量并学习残差潜变量补回强压缩损失的信息,在冻结 DiT 的特征空间中对齐压缩潜变量,再以轻量微调和非对称去噪适配 DiT。
Anthropic 发布 Claude Haiku 5.5,官方跑分逐项超过 GPT-6 Luna,并超越 DeepSeek V4.1 Flash 和 GLM-5.3-Flash 成为新的小模型守门员。
同一新闻,精选展示《Anthropic 发布 Claude Haiku 5.5,价格降至 Haiku 4.5 的十分之一》
阶跃终端将于10月13日在上海举办“Ready Builder One”主题发布会,推出旗下首款大模型原生智能体手机STEPX Neo。STEPX Neo在模型、系统、硬件等方面皆为智能体原生打造,发布会还将公布阶跃终端在生态合作方面的最新进展。
一位创客用 ESP32-S3 制作了一台小型 AM 发射器,接收网络电台流后通过 GPIO 脉冲链生成射频信号,让老式电子管收音机重新发声。发射器采用 3D 打印外壳与支架固定的大间距线圈天线,输出频率为 200kHz 的欧洲长波波段,足以被老式收音机接收。作者指出该发射功率下可能不合规,但认为功率极低不会被察觉。
LWN.net 发布 10 月 8 日周刊,头条内容涵盖内核 bug、Gentoo 的 Chromium 软件包、Rust 智能指针、Sashiko、Charon 与 LAVD 调度器、Python 随机数模块。简讯部分收录 OpenSSH 10.6、RustConf 演讲录像、Rust 1.99.0、Picard 3.0、Zig 0.17 等条目,另有新闻邮件、会议、安全更新与补丁等公告。
Efinix 推出 Sapphire RV64 SoC,这是一款面向 Titanium、Topaz 和 Trion(T20 及以上)FPGA 的可配置 64 位 RISC-V 软核,基于 VexiiRiscv,可配置 1 至 4 个核心,主频最高 400 MHz。
推荐理由:原文列出了主频、缓存、内存支持和外设配置,做 FPGA RISC-V 选型的工程师可据此评估是否替换现有 32 位方案。
Mecka AI 宣布完成 6000 万美元 B 轮融资,由红杉领投,Nvidia、微软风投基金 M12 等参投;TechCrunch 此前报道该轮融资估值接近 5 亿美元。这家公司成立于 2024 年,付钱让人们穿戴身体传感器、用手机记录做咖啡、修车等日常任务,为机器人训练采集人体动作数据,对标 Scale AI、Mercor、Surge 等为 LLM 供数的数据标注公司。
玩家 gavff64 通过自制软件 RNDS-Stream 让 2008 年的 Nintendo DSi 串流游玩 PC 上的游戏,以约 15-20FPS 解码来自 Linux 主机的 MJPEG 流,画面延迟较低但暂不支持音频。该项目是 RubyNDS(基于 Ruby 的 DSi 自制框架)的展示作品,已以 MIT 许可证开源在 GitHub 上。
2026高工工业具身智能机器人年会报名启动,主题为“向实 向新 向未来”。高工机器人同步启动2026高工金球奖,具体商务合作详情可通过点击“阅读原文”了解。
GGII预计2030年中国智能焊接机器人销量将达3.75万台,渗透率提升至32%;2025年销量为0.69万台,渗透率8.2%。市场规模方面,2025年全球约22亿元、中国约14亿元,2030年全球与中国年复合增长率分别约34%与38%。
文章认为自动驾驶能迁移给具身智能的是约50%的技术基建和方法论,但那张时间表不该一起搬。光象科技CEO张涛指出迁移部分落在数据采集、清洗、端到端训练、仿真验证和真机测试流程上,而接触类任务是机器人独有的难点;自变量王潜认为自动驾驶难点在导航和运动,机器人难点在操作,视觉只差几像素的两瓶水在动作层面就是两件事。
推荐理由:原文用50%迁移比例、仿真真机成功率落差和出货量对比,拆解了自动驾驶方法论能给具身智能留下什么、带不走什么。
云深处科技在国庆假期将人形机器人DR02部署到杭州西湖区交通路口和景区周边,在雨天环境中进行值守、语音引导游客、识别越线电动车等测试。DR02身高180厘米、31个自由度、IP66防水防尘、搭载275TOPS AI主机,此前已在变电站完成作业测试。
OpenAI 在 GitHub 开源项目库 math,放出 722 篇由内部未发布前沿模型产出的数学手稿,覆盖 372 个此前未解的难题家族,其中 Result 003 证明了准黎曼猜想(所有狄利克雷 L-函数在实部 ℜ s > 7/8 半平面内无零点)并同步给出 Lean 形式化验证。
推荐理由:梳理了成果清单与数学界反应,可快速了解这批手稿覆盖的问题范围和争议焦点。
全国具身智能机器人生态发展暨产教融合创新大会将于10月20日至21日在长三角国家技术创新中心(南京江北新区)举行,作为2026物理AI与世界模型大会主要内容之一。大会将启动全国具身智能机器人产教融合联盟成立仪式,宇树科技、科大讯飞、集萃智造联合数百所高校共建,并启动《具身智能算力国家标准》编制。预计参会规模约260人,涵盖南京大学、河海大学等高校专家与产业链企业代表。
9月15日arXiv出现论文《BRIDGE:An Open-Source Humanoid Platform via Morphology-Control Co-Design for Physical AI》,Skild AI两位创始人参与创作,展示了一台高88厘米、13公斤的开源人形平台,硬件图纸、控制策略、训练脚本全部公开。
推荐理由:文章梳理了Skild AI从卖大脑到开源参考身体的路径,并与宇树、智源的同类做法对比,便于理解接口之争。
法国 AI 公司 Mistral 发布新旗舰 Mistral Large 4,总参数 1 万亿、混合专家架构每 token 激活 490 亿参数,权重月底全部开源。
推荐理由:原文汇总了多项第三方评测分数与安全基准数据,便于横向比较其与闭源旗舰的差距。
Nick Bild 推出手持版 Atari 2600 复刻机 µTari Go(读作 Microtari),3D 打印外壳内嵌一块 Sony 扁平 CRT 显像管模块并带小扬声器,按键布局类似 Game Boy,顶部设卡带插槽。PCB 将原机电路压缩到更小空间,保留原装硬件设计,供电改为外部 12 V 插孔,也可用 USB-C 充电宝驱动。
作者为TinyML课程自研了一款嵌入式AI开发板,原因是现成开发板缺少联网模块(如ESP32),且难以在一块板上运行多个与实际产品相关的AI模型(如电机堵转模型)。设计上刻意拿掉WS2812彩灯、舵机/PWM、功耗测量等非必要功能,以简化维护。目标是让学员用同一块板完成数据采集、在STM32上运行模型并接着做联网实验。
TI 宣布其广泛嵌入式产品组合已全面支持 Zephyr RTOS,覆盖全系列 MCU(从超低功耗 M0 到高性能 M33 内核)、MPU 及无线连接设备,提供统一且可量产的开发平台。
推荐理由:梳理了TI全面支持Zephyr对开发者、生态和行业三层影响,可作为评估厂商中立模式的参考。