跳到正文
10月7日周三
  1. arXiv cs.RO 机器人学53

    FLTA:面向人到机器人视觉适应的帧级时间对齐框架

    FLTA 框架通过全局进度先验与局部时序顺序先验,无需帧级对应标注即可学习共享任务进度表示,解决人与机器人演示执行速率和非关键帧比例差异导致的对应学习失败问题。在 ResNet-50 与 ViT 编码器上,平均仿真成功率较最佳基线分别提升 46.93% 与 65.96%,并在真实操作任务上取得更高成功率。结果表明人机适应效果更取决于选择更新哪些参数,而非更新参数数量。

  2. arXiv cs.RO 机器人学53

    CrashSim:基于真实碰撞先验与人类行为的自动驾驶碰撞场景生成框架

    CrashSim 用真实碰撞先验引导多智能体生成式交通仿真,生成更贴近真实碰撞演化过程与碰撞类型分布的自动驾驶安全评测场景。基于 CrashSim 构建的 nuCrash 数据集包含 4,000 多个碰撞与近碰撞场景,对 5 个自动驾驶规划器的闭环评测显示其比 nuScenes 更能暴露规划器安全能力差异。LLM 辅助评测代理进一步给出能力级诊断与改进指导。

  3. arXiv cs.RO 机器人学52

    TacOT:通过触觉引导最优传输从人类演示中学习接触密集型灵巧操作

    TacOT 提出触觉引导最优传输框架,用动作-触觉动态时间规整识别人类与机器人演示中交互动力学一致的对应关系,再引导共享策略表示空间中的软最优传输对齐,无需预定义帧级配对。在 4 个真实灵巧操作任务上,闭环成功率较 action-guided OT 在分布内任务最高提升 17 个百分点,在定向人到机器人分布外迁移下提升 20 个百分点。

  4. arXiv cs.RO 机器人学47

    基于事件相机的异步跟踪、光通信与 3D 动作捕捉系统 ATOC

    研究者提出 ATOC(Asynchronous Tracking and Optical Communication)系统,将 LED smart-beacon 调制、事件相机检测、光学跟踪与事件数据解调集成到单一管线,可同时跟踪并解调多个 LED smart beacon,把传统视觉标记变成定向、空间局部化的通信通道。系统在实验室研究、智慧城市演示和 3D 动作捕捉系统中得到验证。

  5. arXiv cs.RO 机器人学54

    面向偏置冗余机械臂的实时 Conformal-Seeded 混合逆运动学求解

    该研究提出一种两阶段混合逆运动学框架,用于求解人形机器人 7-DoF 偏置冗余机械臂的逆运动学:先用近似解析模型枚举候选关节解,再用轻量学习预测器结合 split-conformal prediction 给出校准难度上界排序种子,最后用 Levenberg-Marquardt 在完整运动学模型上精化。

  6. arXiv cs.RO 机器人学53

    GiT:面向机器人操作时序定位的多源数据集与基准

    GiT(Grounded in Time)发布了一个面向机器人操作的多源数据集与基准,用于将操作决策定位到过去事件,覆盖生物实验室、家庭与工业场景。数据集包含真实机器人与 Universal Manipulation Interface(UMI)风格演示共 18 个双臂任务,以及基于 ManiSkill 的 9 个任务仿真评测套件,并提供细粒度子任务标注与反事实任务对。

  7. arXiv cs.RO 机器人学57

    人形机器人拉车全身运动控制框架:Unitree G1 实机拖运 115 kg 负载

    论文提出一套人形机器人拉黄包车的全身控制框架,通过特权教师利用车辆状态、交互力和负载属性训练,再蒸馏为仅依赖本体感受历史的学生策略并做强化学习微调。实机上单一策略完成启动、持续拉动、转向与停止,覆盖刚性负载和真人乘客,无需针对负载重新调参即可拖动最高 115 kg 的负载车,且多数负载-速度条件下机器人归一化运输成本低于空载行走。

  8. arXiv cs.RO 机器人学58

    人形机器人全身运动持续学习:Similarity-guided LoRA-PNN 防止灾难性遗忘

    提出 Similarity-guided LoRA-PNN,用渐进式神经网络策略结合轻量 LoRA,在顺序任务流中让人形全身控制器持续学习而不遗忘已掌握技能。基于动态时间规整与最优传输的两级运动相似度决定复用哪个先验技能并分配新容量,在六个顺序学习技能类别上取得最佳前向迁移 0.125 与最高平均准确率,节省最多 94.5% 可训练参数和 40.8% 训练时间。

  9. arXiv cs.RO 机器人学38

    双臂机器人在翻身操作中稳定颈椎以实现安全物理人机交互

    研究提出一种双臂机器人在翻身操作中稳定颈椎的算法与适配方案,兼顾安全边界内的抓握力最大化与颈部旋转控制。实验显示,该方法使双臂机器人在维持目标旋转对齐上达到人类水平,带预测的轴向对齐与人类新手相差 .21 度以内。该成果面向战场、自然灾害与运动场景中的患者搬运与翻身安全。

  10. arXiv cs.RO 机器人学46

    Autoware 在建筑工地的应用:差距分析与面向越野自动驾驶的 LiDAR 感知

    Autoware 开源自动驾驶平台正被扩展到建筑工地的大型自卸卡车,但工地的非结构化地形、扬尘和持续变化的现场条件挑战了公共道路自动驾驶系统的多项假设。研究在感知、建图、定位、规划与控制等模块中识别出公共道路与越野建筑应用之间的差距,并重点讨论基于 LiDAR 的感知流水线开发与现场测试发现。论文最后提出面向建筑车辆端到端自动驾驶的路线图。

10月6日周二
  1. arXiv cs.RO 机器人学38

    仿生凝视控制恢复头颈运动

    研究者提出一种利用前庭眼反射(vestibulo-ocular reflex)的新型眼动追踪控制器,用于驱动颈部外骨骼恢复头颈运动,并提供滑块参数供用户个性化调节。相比此前眼动追踪模型,新控制器给出更自然的速度曲线,动作意图识别准确率平均提升 24%,已在人体用户中完成技术设计与验证。

  2. arXiv cs.RO 机器人学51

    TACET:面向四足机器人的上下文自适应声学-社会导航

    TACET 提出一种上下文自适应声学-社会导航方法,让四足机器人从第一人称视角推断社会场景,同时决定行走位置与移动音量。该方法用单一行为 token 耦合微调视觉-语言推理器与快速反应控制器,同时约束社会代价地图与安静运动策略,并以视野外记忆保留离开相机视野的行人。

  3. arXiv cs.RO 机器人学38

    基于可穿戴 IMU 的稀疏标定个性化核方法步态相位与步行速度联合估计

    该研究提出稀疏标定个性化方法,用可穿戴 IMU 联合估计步态相位与步行速度:在 20 名受试者运动数据集上构建 28 速参考库,结合 3 个标定速度估计的用户基线与主成分(PC)模型生成个性化核。离线验证显示个性化核相比总体核降低相位误差,单人在线试验中相位与速度误差数值更低,且在嵌入式硬件上实时运行。但速度效应不显著,多重比较校正后相位差异不再显著,仍需更大样本验证。

  4. arXiv cs.RO 机器人学47

    面向颗粒斜坡高效运动的地形依赖式腿内周期时序研究

    研究者用六足机器人在可倾斜颗粒床上系统测量运动速度与随坡度变化的法向、剪切颗粒阻力,发现法向穿透阻力几乎不随倾角变化,而剪切阻力随坡角增大显著下降。基于测量建立的机器人-地形交互模型可预测锚定时机、步长与机器人速度,指出斜坡性能损失主要源于锚定延迟和后滑增加而非过度下陷。模型进一步扩展出下陷与打滑失效相图,为可变形斜坡上的机器人运动提供定量风险估计。

  5. arXiv cs.RO 机器人学55

    MOSAIC-SV:面向水下机器人控制与部署的船体动力学实时自适应辨识系统

    MOSAIC-SV 是一套可部署的实时自适应动力学辨识与控制系统,仅凭规格书工程先验即可在闭环任务每个控制步重估水动力、扰动与执行器参数,无需专门辨识试验。在 CyberShip II 仿真中,即便惯性或阻尼先验偏差一个数量级,其航渡时间仍保持在未缩放先验的 20% 以内。

  6. arXiv cs.RO 机器人学54

    Reward-DAgger:基于通用进度奖励模型的机器人门控交互式模仿学习

    Reward-DAgger 提出一种机器人门控交互式模仿学习框架,用通用奖励模型的稠密进度信号判断何时需要人类介入,无需访问策略内部结构,也不用按任务重新调参。在 8 个仿真与真实任务中,其失败检测精度-时延权衡优于现有运行时监控基线,并持续提升下游策略的自主成功率与人力回报。同一门控配置跨任务、环境与策略架构通用,代码与视频已开源。

  7. arXiv cs.RO 机器人学55

    REDIRECT:用 1% 训练预算修复机器人坏习惯

    REDIRECT 仅用 1% 的全训练样本反向预算,即可修复机器人从少量缺陷遥操作演示中学到的坏习惯,无需帧级标注或额外交互。在三个 ManiSkill 随机化任务上,REDIRECT 将平均成功率从 68.2% 提升至 90.3%,恢复 88.8% 的干净重训练差距,而同算力微调仅恢复 22.1%。在 PiPER 机械臂的杯子插入与毛巾折叠任务上,它恢复 86.7-92.9% 的差距。

  8. arXiv cs.RO 机器人学54

    GOTT:基于可复用跨具身原语的物体中心灵巧操作

    GOTT 提出 reach-acquire-move 框架,用单一跨具身接触获取原语把机器人无关的物体轨迹转化为多指手行为:先将手带到任务相关接触区域,再由共享闭环原语建立稳定接触,位姿条件控制器跟踪物体运动。仿真与真实实验显示 GOTT 能在多种物体、臂-手平台及已见与未见手部形态上建立鲁棒接触,并一致提升端到端任务成功率。

  9. Hugging Face 每日论文60

    PhysEvo:围绕冻结模型的物理递归自改进框架在 RoboDojo 与真机上评测

    PhysEvo 提出围绕单一冻结模型的物理递归自改进(RSI)框架,由任务 agent 执行机器人任务、meta-agent 依据轨迹诊断失败并修订工具与技能,全程不更新模型权重也不训练独立动作策略。

    推荐理由:论文给出与 RoboDawn 和直接 Astra 的对照成功率,便于评估冻结模型下递归自改进的实际增益。

  10. Hugging Face 每日论文55

    WorldSonus:为世界模型实时合成空间立体声的视频到音频框架

    WorldSonus 提出面向世界模型的交互式视频到音频框架,用于实时空间声音合成。其采用流式因果自回归扩散架构,以 0.41 的低实时因子(RTF)生成音频块,并通过音频描述流水线与按块索引的提示调度实现生成中动态控制声音事件,同时用立体声与 ambisonic 数据做空间对齐监督。

10月5日周一
  1. 新智元64

    魔芯科技MoWorld 4D世界模型落地华为Mate 90,摸小宠应用上线

    魔芯科技的4D世界模型MoWorld随华为Mate 90系列发布进入消费端,鸿蒙独占应用「摸小宠」可将几张手机拍摄的宠物照片生成可任意视角浏览的4D数字猫。技术上采用端云协同,云端昇腾NPU生成3D高斯模型,约6亿参数的MoWorld-2.0-Flash经量化裁剪后跑在麒麟芯片上完成端侧渲染,推理成本约为进口GPU方案的30%。

  2. Hugging Face 每日论文55

    LoGRA:用低秩梯度草图扩展 LLM 强化学习训练

    LoGRA 通过低秩梯度草图保留有效学习信号,将 LLM 强化学习后训练的平均训练内存最多降低 45.7%,且不损失性能。该方法配合 predicted-KL 步长控制,在单个八 GPU 节点上稳定训练 27B 参数模型超过 1,100 步,而 dense Adam 会显存耗尽,使原本内存不可行的 RL 训练变得可行。代码已在相关库中开源。