FLTA:面向人到机器人视觉适应的帧级时间对齐框架
FLTA 框架通过全局进度先验与局部时序顺序先验,无需帧级对应标注即可学习共享任务进度表示,解决人与机器人演示执行速率和非关键帧比例差异导致的对应学习失败问题。在 ResNet-50 与 ViT 编码器上,平均仿真成功率较最佳基线分别提升 46.93% 与 65.96%,并在真实操作任务上取得更高成功率。结果表明人机适应效果更取决于选择更新哪些参数,而非更新参数数量。
FLTA 框架通过全局进度先验与局部时序顺序先验,无需帧级对应标注即可学习共享任务进度表示,解决人与机器人演示执行速率和非关键帧比例差异导致的对应学习失败问题。在 ResNet-50 与 ViT 编码器上,平均仿真成功率较最佳基线分别提升 46.93% 与 65.96%,并在真实操作任务上取得更高成功率。结果表明人机适应效果更取决于选择更新哪些参数,而非更新参数数量。
CrashSim 用真实碰撞先验引导多智能体生成式交通仿真,生成更贴近真实碰撞演化过程与碰撞类型分布的自动驾驶安全评测场景。基于 CrashSim 构建的 nuCrash 数据集包含 4,000 多个碰撞与近碰撞场景,对 5 个自动驾驶规划器的闭环评测显示其比 nuScenes 更能暴露规划器安全能力差异。LLM 辅助评测代理进一步给出能力级诊断与改进指导。
TacOT 提出触觉引导最优传输框架,用动作-触觉动态时间规整识别人类与机器人演示中交互动力学一致的对应关系,再引导共享策略表示空间中的软最优传输对齐,无需预定义帧级配对。在 4 个真实灵巧操作任务上,闭环成功率较 action-guided OT 在分布内任务最高提升 17 个百分点,在定向人到机器人分布外迁移下提升 20 个百分点。
研究者提出 ATOC(Asynchronous Tracking and Optical Communication)系统,将 LED smart-beacon 调制、事件相机检测、光学跟踪与事件数据解调集成到单一管线,可同时跟踪并解调多个 LED smart beacon,把传统视觉标记变成定向、空间局部化的通信通道。系统在实验室研究、智慧城市演示和 3D 动作捕捉系统中得到验证。
该研究提出一种两阶段混合逆运动学框架,用于求解人形机器人 7-DoF 偏置冗余机械臂的逆运动学:先用近似解析模型枚举候选关节解,再用轻量学习预测器结合 split-conformal prediction 给出校准难度上界排序种子,最后用 Levenberg-Marquardt 在完整运动学模型上精化。
GiT(Grounded in Time)发布了一个面向机器人操作的多源数据集与基准,用于将操作决策定位到过去事件,覆盖生物实验室、家庭与工业场景。数据集包含真实机器人与 Universal Manipulation Interface(UMI)风格演示共 18 个双臂任务,以及基于 ManiSkill 的 9 个任务仿真评测套件,并提供细粒度子任务标注与反事实任务对。
ROOT(Reward Optimization via Observable Trees)框架通过在持久化实验树上做观察引导搜索来发现奖励函数,使学习策略对齐用户指定的具身行为。
该研究提出一种面向地面机器人的表面表示学习方法,通过预测机器人下一时刻状态并引入注意力模块,将新表面类别作为可训练向量加入,实现开放式表面分类。在 Belyaev-Kushnarev 数据集上分类准确率达 98.56%,在 BorealTC 上达 94.8%。
提出 Similarity-guided LoRA-PNN,用渐进式神经网络策略结合轻量 LoRA,在顺序任务流中让人形全身控制器持续学习而不遗忘已掌握技能。基于动态时间规整与最优传输的两级运动相似度决定复用哪个先验技能并分配新容量,在六个顺序学习技能类别上取得最佳前向迁移 0.125 与最高平均准确率,节省最多 94.5% 可训练参数和 40.8% 训练时间。
研究提出一种双臂机器人在翻身操作中稳定颈椎的算法与适配方案,兼顾安全边界内的抓握力最大化与颈部旋转控制。实验显示,该方法使双臂机器人在维持目标旋转对齐上达到人类水平,带预测的轴向对齐与人类新手相差 .21 度以内。该成果面向战场、自然灾害与运动场景中的患者搬运与翻身安全。
Autoware 开源自动驾驶平台正被扩展到建筑工地的大型自卸卡车,但工地的非结构化地形、扬尘和持续变化的现场条件挑战了公共道路自动驾驶系统的多项假设。研究在感知、建图、定位、规划与控制等模块中识别出公共道路与越野建筑应用之间的差距,并重点讨论基于 LiDAR 的感知流水线开发与现场测试发现。论文最后提出面向建筑车辆端到端自动驾驶的路线图。
Boston Dynamics 宣布任命 Rohit Prasad 为新 CEO,次日生效,接替自 Playter 二月离职后担任临时 CEO 的 CFO Amanda McMaster。
Yongha Kim 借助 GeekMagic SmallTV 内置的图片查看功能,在不替换原厂固件、不焊接的情况下让设备显示任意内容:由网络上的主机用 Python Pillow 生成 240×240 图片,通过 HTTP 推送到设备,示例展示 Claude 与 Codex 用量数据。该方法也支持 GIF 动画,内容与生成工具不限。
TwelveLabs 发布 Pegasus 1.6 模型,面向机器人、无人机和自动驾驶等物理 AI 场景,是其首个面向第一人称视频的 AI 模型,不依赖特定相机或专有硬件。
推荐理由:原文列出了五项工作流和第一人称视频定位,做机器人数据管线的团队可据此判断是否接入。
NVIDIA 计划斥资 129 亿美元收购 Hugging Face,为公司史上最大一笔收购,以在物理 AI 竞争中巩固其模型分发层地位。
Anthropic 强化学习技术负责人 Sholto Douglas 在访谈中表示,能力等于甚至超过所有人类的模型很可能在未来几年内出现,AI 将能完成人类在电脑上做的所有工作。他估算今年超大规模云厂商 AI 资本开支合计约 1 万亿美元,2028 年可能达 4 万亿美元,2030 年代初全球 GDP 或翻倍。数学评测 FrontierMath 成绩一年内从 0% 升至 60% 以上。
FireDome 推出自主地面发射系统,通过发射含水或阻燃剂的弹丸(最远 1,000 ft.)在野火到达前铺设阻燃隔离带、覆盖建筑并扑灭飞火引发的点火点。系统采用机械发射柔性智能弹丸,每枚约装 10 gal. 液体,在近地面高度展开形成椭圆覆盖区,三层防御分别对应外围隔离带、建筑覆盖和点火点扑灭,默认自主运行并可远程关停,计划与加州消防指挥体系集成。
推荐理由:文章拆解了发射器与三层防御逻辑,可了解自主灭火系统如何嵌入现有消防指挥体系。
TechCrunch Disrupt 2026 将于 10 月 13-15 日在旧金山 Moscone West 举办,汇聚 10,000+ 创始人、投资人与科技领袖,现已公布完整分论坛议程。
ESP Mini App Platform 0.4.9 Beta 开放发布,面向 ESP-Mosaico 开发板(主控 ESP32-S31),系统与应用分离,支持安装、更新、卸载独立应用。
Meta 开源了 Muse Gadgets 硬件开发套件,包含乐鑫ESP32固件和 Linux SDK,开发者可用几十元的 ESP32 开发板或树莓派为个人桌面 AI Agent Muse 制作物理外设,实现智能家居控制、日程提醒等功能。
推荐理由:原文给出了硬件BOM成本、固件与Linux SDK分工和刷写绑定流程,想自制Muse外设的开发者可据此评估上手成本。
机器人大讲堂分析认为,机器人产业最先跑通的落地场景可能在体育场、主题乐园和城市广场,而非工厂或家庭。据其不完全统计,4 月至 9 月底机器人赛事覆盖五个主要城市、五种赛制,参赛机器人总数超过 2200 台,其中第二届世界人形机器人运动会有 2056 台机器人同场竞技,赛项从 19 个扩到 50 个。
推荐理由:原文梳理了五座城市机器人赛事的规模与出货数据,可用来理解文体旅场景为何先于工厂和家庭形成落地。
高工机器人统计近20家电机相关上市公司2025年年报,步科股份、雷赛智能、鸣志电器、兆威机电等均在机器人领域布局电机产品,短期产业共识集中于无框力矩电机用于大关节、空心杯电机用于灵巧手。
推荐理由:原文按无框力矩电机和空心杯电机两条路线梳理近20家上市公司布局,可用来对照各家量产进度与营收兑现差异。
高工机器人宣布 2026 高工金球奖正式启动,主题为"具身启新章 实干即未来"。同期启动 2026 高工工业具身智能机器人年会报名。商务合作详情可通过"阅读原文"了解。
研究者提出一种利用前庭眼反射(vestibulo-ocular reflex)的新型眼动追踪控制器,用于驱动颈部外骨骼恢复头颈运动,并提供滑块参数供用户个性化调节。相比此前眼动追踪模型,新控制器给出更自然的速度曲线,动作意图识别准确率平均提升 24%,已在人体用户中完成技术设计与验证。
TACET 提出一种上下文自适应声学-社会导航方法,让四足机器人从第一人称视角推断社会场景,同时决定行走位置与移动音量。该方法用单一行为 token 耦合微调视觉-语言推理器与快速反应控制器,同时约束社会代价地图与安静运动策略,并以视野外记忆保留离开相机视野的行人。
SUAVE 提出一种单一词表的统一 Action-Video 模型,用 masked diffusion transformer 在共享序列中以离散 token 表示视频、动作与语言,通过推理时选择掩码位置即可切换为世界模型、机器人策略或视频-动作模型。
该研究提出稀疏标定个性化方法,用可穿戴 IMU 联合估计步态相位与步行速度:在 20 名受试者运动数据集上构建 28 速参考库,结合 3 个标定速度估计的用户基线与主成分(PC)模型生成个性化核。离线验证显示个性化核相比总体核降低相位误差,单人在线试验中相位与速度误差数值更低,且在嵌入式硬件上实时运行。但速度效应不显著,多重比较校正后相位差异不再显著,仍需更大样本验证。
研究者用六足机器人在可倾斜颗粒床上系统测量运动速度与随坡度变化的法向、剪切颗粒阻力,发现法向穿透阻力几乎不随倾角变化,而剪切阻力随坡角增大显著下降。基于测量建立的机器人-地形交互模型可预测锚定时机、步长与机器人速度,指出斜坡性能损失主要源于锚定延迟和后滑增加而非过度下陷。模型进一步扩展出下陷与打滑失效相图,为可变形斜坡上的机器人运动提供定量风险估计。
MOSAIC-SV 是一套可部署的实时自适应动力学辨识与控制系统,仅凭规格书工程先验即可在闭环任务每个控制步重估水动力、扰动与执行器参数,无需专门辨识试验。在 CyberShip II 仿真中,即便惯性或阻尼先验偏差一个数量级,其航渡时间仍保持在未缩放先验的 20% 以内。
Reward-DAgger 提出一种机器人门控交互式模仿学习框架,用通用奖励模型的稠密进度信号判断何时需要人类介入,无需访问策略内部结构,也不用按任务重新调参。在 8 个仿真与真实任务中,其失败检测精度-时延权衡优于现有运行时监控基线,并持续提升下游策略的自主成功率与人力回报。同一门控配置跨任务、环境与策略架构通用,代码与视频已开源。
提出一种拓扑优先的微型飞行器主动重建框架,将高保真 3D Gaussian Splatting(3DGS)地图与轻量 TSDF/occupancy 支撑结构解耦,后者用于保守碰撞检测并在线构建稀疏 3D Voronoi 骨架路标。
REDIRECT 仅用 1% 的全训练样本反向预算,即可修复机器人从少量缺陷遥操作演示中学到的坏习惯,无需帧级标注或额外交互。在三个 ManiSkill 随机化任务上,REDIRECT 将平均成功率从 68.2% 提升至 90.3%,恢复 88.8% 的干净重训练差距,而同算力微调仅恢复 22.1%。在 PiPER 机械臂的杯子插入与毛巾折叠任务上,它恢复 86.7-92.9% 的差距。
GOTT 提出 reach-acquire-move 框架,用单一跨具身接触获取原语把机器人无关的物体轨迹转化为多指手行为:先将手带到任务相关接触区域,再由共享闭环原语建立稳定接触,位姿条件控制器跟踪物体运动。仿真与真实实验显示 GOTT 能在多种物体、臂-手平台及已见与未见手部形态上建立鲁棒接触,并一致提升端到端任务成功率。
PhysEvo 提出围绕单一冻结模型的物理递归自改进(RSI)框架,由任务 agent 执行机器人任务、meta-agent 依据轨迹诊断失败并修订工具与技能,全程不更新模型权重也不训练独立动作策略。
推荐理由:论文给出与 RoboDawn 和直接 Astra 的对照成功率,便于评估冻结模型下递归自改进的实际增益。
波士顿动力 Spot 机器人已成公共安全标准装备,用于灾后搜救、人质处置、毒品实验室调查与排爆。Spot 可爬楼梯、在狭窄空间穿行,配备 Spot Cam、机械臂与热成像,能 360 度观察并放大 25 倍,机械臂可举起 15 磅、拖拽 50 磅物体。2026 年 2 月拉斯维加斯警方用 Spot 首入疑似生物实验室采集空气样本,2023 年 4 月纽约消防用其勘察曼哈顿停车场坍塌现场。
FCC 于 7 月将外国产先进机器人设备列入构成国家安全或安全风险的清单,新设备无法获得进口、在美销售所需的 FCC 认证,涵盖人形与四足等可采集环境信息的移动机器人。
推荐理由:文章梳理了FCC限制如何从采购传导到机器人架构选择,对评估本地推理与供应链策略有参考价值。
卡内基梅隆大学 Safe AI 实验室负责人丁赵与 Kyle Wong、Simo Rachidi 创立 Safeworld,今日走出隐身模式并完成超 $1200 万种子轮,由 Shine Capital 和 a16z Speedrun 领投。
魔芯科技的4D世界模型MoWorld随华为Mate 90系列发布进入消费端,鸿蒙独占应用「摸小宠」可将几张手机拍摄的宠物照片生成可任意视角浏览的4D数字猫。技术上采用端云协同,云端昇腾NPU生成3D高斯模型,约6亿参数的MoWorld-2.0-Flash经量化裁剪后跑在麒麟芯片上完成端侧渲染,推理成本约为进口GPU方案的30%。
Hinton 与 Bengio 等 22 位作者发表论文《What if automating AI R&D triggers an intelligence explosion?
推荐理由:论文用实验室内部数据估算AI研发自动化的反馈周期,给出了研究投入回报率r与进步加速倍数的推算框架。
高工机器人统计,上半年焊接机器人领域超200个公开招投标订单中,船舶领域超40个、累计金额近4亿元。2026年1-6月我国造船完工量3650万载重吨、同比增长51.2%,新接订单量12106万载重吨、同比增长173.1%,沪东中华、江南造船等头部船厂排产已至2030年后。
推荐理由:上半年船舶焊接机器人招投标订单近4亿元,材料梳理了船厂需求形态与两条技术路线的分野,可作赛道判断参考。