AgenticTactileVLA 提出接触引导的执行期监督,无需 VLA 重训练即可提升灵巧操作泛化
AgenticTactileVLA 提出一种执行期监督器,用手指位置和电机力反馈作为本体接触证据,在不使用触觉传感器、不重训练 VLA 的前提下修正抓取实现。
AgenticTactileVLA 提出一种执行期监督器,用手指位置和电机力反馈作为本体接触证据,在不使用触觉传感器、不重训练 VLA 的前提下修正抓取实现。
FLTA 框架通过全局进度先验与局部时序顺序先验,无需帧级对应标注即可学习共享任务进度表示,解决人与机器人演示执行速率和非关键帧比例差异导致的对应学习失败问题。在 ResNet-50 与 ViT 编码器上,平均仿真成功率较最佳基线分别提升 46.93% 与 65.96%,并在真实操作任务上取得更高成功率。结果表明人机适应效果更取决于选择更新哪些参数,而非更新参数数量。
CrashSim 用真实碰撞先验引导多智能体生成式交通仿真,生成更贴近真实碰撞演化过程与碰撞类型分布的自动驾驶安全评测场景。基于 CrashSim 构建的 nuCrash 数据集包含 4,000 多个碰撞与近碰撞场景,对 5 个自动驾驶规划器的闭环评测显示其比 nuScenes 更能暴露规划器安全能力差异。LLM 辅助评测代理进一步给出能力级诊断与改进指导。
TacOT 提出触觉引导最优传输框架,用动作-触觉动态时间规整识别人类与机器人演示中交互动力学一致的对应关系,再引导共享策略表示空间中的软最优传输对齐,无需预定义帧级配对。在 4 个真实灵巧操作任务上,闭环成功率较 action-guided OT 在分布内任务最高提升 17 个百分点,在定向人到机器人分布外迁移下提升 20 个百分点。
研究者提出 ATOC(Asynchronous Tracking and Optical Communication)系统,将 LED smart-beacon 调制、事件相机检测、光学跟踪与事件数据解调集成到单一管线,可同时跟踪并解调多个 LED smart beacon,把传统视觉标记变成定向、空间局部化的通信通道。系统在实验室研究、智慧城市演示和 3D 动作捕捉系统中得到验证。
该研究提出一种两阶段混合逆运动学框架,用于求解人形机器人 7-DoF 偏置冗余机械臂的逆运动学:先用近似解析模型枚举候选关节解,再用轻量学习预测器结合 split-conformal prediction 给出校准难度上界排序种子,最后用 Levenberg-Marquardt 在完整运动学模型上精化。
GiT(Grounded in Time)发布了一个面向机器人操作的多源数据集与基准,用于将操作决策定位到过去事件,覆盖生物实验室、家庭与工业场景。数据集包含真实机器人与 Universal Manipulation Interface(UMI)风格演示共 18 个双臂任务,以及基于 ManiSkill 的 9 个任务仿真评测套件,并提供细粒度子任务标注与反事实任务对。
ROOT(Reward Optimization via Observable Trees)框架通过在持久化实验树上做观察引导搜索来发现奖励函数,使学习策略对齐用户指定的具身行为。
该研究提出一种面向地面机器人的表面表示学习方法,通过预测机器人下一时刻状态并引入注意力模块,将新表面类别作为可训练向量加入,实现开放式表面分类。在 Belyaev-Kushnarev 数据集上分类准确率达 98.56%,在 BorealTC 上达 94.8%。
论文提出一套人形机器人拉黄包车的全身控制框架,通过特权教师利用车辆状态、交互力和负载属性训练,再蒸馏为仅依赖本体感受历史的学生策略并做强化学习微调。实机上单一策略完成启动、持续拉动、转向与停止,覆盖刚性负载和真人乘客,无需针对负载重新调参即可拖动最高 115 kg 的负载车,且多数负载-速度条件下机器人归一化运输成本低于空载行走。
提出 Similarity-guided LoRA-PNN,用渐进式神经网络策略结合轻量 LoRA,在顺序任务流中让人形全身控制器持续学习而不遗忘已掌握技能。基于动态时间规整与最优传输的两级运动相似度决定复用哪个先验技能并分配新容量,在六个顺序学习技能类别上取得最佳前向迁移 0.125 与最高平均准确率,节省最多 94.5% 可训练参数和 40.8% 训练时间。
研究提出一种双臂机器人在翻身操作中稳定颈椎的算法与适配方案,兼顾安全边界内的抓握力最大化与颈部旋转控制。实验显示,该方法使双臂机器人在维持目标旋转对齐上达到人类水平,带预测的轴向对齐与人类新手相差 .21 度以内。该成果面向战场、自然灾害与运动场景中的患者搬运与翻身安全。
Autoware 开源自动驾驶平台正被扩展到建筑工地的大型自卸卡车,但工地的非结构化地形、扬尘和持续变化的现场条件挑战了公共道路自动驾驶系统的多项假设。研究在感知、建图、定位、规划与控制等模块中识别出公共道路与越野建筑应用之间的差距,并重点讨论基于 LiDAR 的感知流水线开发与现场测试发现。论文最后提出面向建筑车辆端到端自动驾驶的路线图。
研究者提出一种利用前庭眼反射(vestibulo-ocular reflex)的新型眼动追踪控制器,用于驱动颈部外骨骼恢复头颈运动,并提供滑块参数供用户个性化调节。相比此前眼动追踪模型,新控制器给出更自然的速度曲线,动作意图识别准确率平均提升 24%,已在人体用户中完成技术设计与验证。
TACET 提出一种上下文自适应声学-社会导航方法,让四足机器人从第一人称视角推断社会场景,同时决定行走位置与移动音量。该方法用单一行为 token 耦合微调视觉-语言推理器与快速反应控制器,同时约束社会代价地图与安静运动策略,并以视野外记忆保留离开相机视野的行人。
SUAVE 提出一种单一词表的统一 Action-Video 模型,用 masked diffusion transformer 在共享序列中以离散 token 表示视频、动作与语言,通过推理时选择掩码位置即可切换为世界模型、机器人策略或视频-动作模型。
该研究提出稀疏标定个性化方法,用可穿戴 IMU 联合估计步态相位与步行速度:在 20 名受试者运动数据集上构建 28 速参考库,结合 3 个标定速度估计的用户基线与主成分(PC)模型生成个性化核。离线验证显示个性化核相比总体核降低相位误差,单人在线试验中相位与速度误差数值更低,且在嵌入式硬件上实时运行。但速度效应不显著,多重比较校正后相位差异不再显著,仍需更大样本验证。
研究者用六足机器人在可倾斜颗粒床上系统测量运动速度与随坡度变化的法向、剪切颗粒阻力,发现法向穿透阻力几乎不随倾角变化,而剪切阻力随坡角增大显著下降。基于测量建立的机器人-地形交互模型可预测锚定时机、步长与机器人速度,指出斜坡性能损失主要源于锚定延迟和后滑增加而非过度下陷。模型进一步扩展出下陷与打滑失效相图,为可变形斜坡上的机器人运动提供定量风险估计。
MOSAIC-SV 是一套可部署的实时自适应动力学辨识与控制系统,仅凭规格书工程先验即可在闭环任务每个控制步重估水动力、扰动与执行器参数,无需专门辨识试验。在 CyberShip II 仿真中,即便惯性或阻尼先验偏差一个数量级,其航渡时间仍保持在未缩放先验的 20% 以内。
Reward-DAgger 提出一种机器人门控交互式模仿学习框架,用通用奖励模型的稠密进度信号判断何时需要人类介入,无需访问策略内部结构,也不用按任务重新调参。在 8 个仿真与真实任务中,其失败检测精度-时延权衡优于现有运行时监控基线,并持续提升下游策略的自主成功率与人力回报。同一门控配置跨任务、环境与策略架构通用,代码与视频已开源。
提出一种拓扑优先的微型飞行器主动重建框架,将高保真 3D Gaussian Splatting(3DGS)地图与轻量 TSDF/occupancy 支撑结构解耦,后者用于保守碰撞检测并在线构建稀疏 3D Voronoi 骨架路标。
REDIRECT 仅用 1% 的全训练样本反向预算,即可修复机器人从少量缺陷遥操作演示中学到的坏习惯,无需帧级标注或额外交互。在三个 ManiSkill 随机化任务上,REDIRECT 将平均成功率从 68.2% 提升至 90.3%,恢复 88.8% 的干净重训练差距,而同算力微调仅恢复 22.1%。在 PiPER 机械臂的杯子插入与毛巾折叠任务上,它恢复 86.7-92.9% 的差距。
GOTT 提出 reach-acquire-move 框架,用单一跨具身接触获取原语把机器人无关的物体轨迹转化为多指手行为:先将手带到任务相关接触区域,再由共享闭环原语建立稳定接触,位姿条件控制器跟踪物体运动。仿真与真实实验显示 GOTT 能在多种物体、臂-手平台及已见与未见手部形态上建立鲁棒接触,并一致提升端到端任务成功率。
PhysEvo 提出围绕单一冻结模型的物理递归自改进(RSI)框架,由任务 agent 执行机器人任务、meta-agent 依据轨迹诊断失败并修订工具与技能,全程不更新模型权重也不训练独立动作策略。
推荐理由:论文给出与 RoboDawn 和直接 Astra 的对照成功率,便于评估冻结模型下递归自改进的实际增益。
Recursive Game Creator 在 GameCraft-Bench 上取得 77.89 的整体最优成绩,在 GameASG-Bench 上严格任务成功率达 53.2%,较同模型基线提升 34.1%,运行时检查通过率 93.4% 为对比方法中最高。
WorldSonus 提出面向世界模型的交互式视频到音频框架,用于实时空间声音合成。其采用流式因果自回归扩散架构,以 0.41 的低实时因子(RTF)生成音频块,并通过音频描述流水线与按块索引的提示调度实现生成中动态控制声音事件,同时用立体声与 ambisonic 数据做空间对齐监督。
报告提出 nanoMuse,一个 GPL-3.0 开源的个人智能体,运行在用户拥有的每台设备上,可操作手机和电脑屏幕,通过任何人可运行的中继共享同一段对话,所有动作经 Sentinel 审核,记忆以用户可读的文件形式保存,模型由用户自选。
DecepEval 发布了一个包含 1,532 个实例、覆盖 3 类任务与 28 个专业场景的 LLM Agent 欺骗行为评测基准,并提出 LLM Deception Diamond 框架,刻画压力、激励、机会、冲突四种可能诱发欺骗的外部条件。
Recurrent Looped Transformer(RLT)将层分为并行因果编码器与循环解码器,每个 token 上解码器融合编码器输出与上一 token 的最终解码状态,使计算路径随序列长度增长而单 token 成本固定。
论文提出 KL-Regularized Policy Optimization(KLPO),将 KL 正则锚定在采样器上,通过最小二乘拟合采样器自身轨迹的 log-ratio 最优性条件,无需重要性权重即可完成策略更新。
Hugging Face 收录论文提出 DLoop,一种循环形式的投机解码方法,在验证前自适应执行多轮草稿阶段,草稿模型保持高置信时持续起草并一次性验证累积的草稿 token。
研究团队提出 ProactiveCoach 套件,包含训练集 ProactiveCoach-Instruct、评测集 ProactiveCoachBench 与自适应引导系统,在阶段、步骤、动作三个层级提供结构化引导数据。
Hinton 与 Bengio 等 22 位作者发表论文《What if automating AI R&D triggers an intelligence explosion?
推荐理由:论文用实验室内部数据估算AI研发自动化的反馈周期,给出了研究投入回报率r与进步加速倍数的推算框架。
PrisMem 提出能力驱动的智能体记忆自进化方法,通过依赖感知的能力选择与历史引导诊断来优化记忆程序,并在 BEAM-1M 和 LongMemEval-M 上分别以 10.54 和 7.83 个百分点的优势超过最强基线。
研究提出激活对齐(activation alignment)方法,通过在合成无标签数据上训练一个轻量线性变换,将使用部分上下文的"学生"模型的中间激活映射向使用全部数据的"教师"模型,训练对齐器无需 GPU,在普通硬件上数秒至数分钟即可收敛。
LoGRA 通过低秩梯度草图保留有效学习信号,将 LLM 强化学习后训练的平均训练内存最多降低 45.7%,且不损失性能。该方法配合 predicted-KL 步长控制,在单个八 GPU 节点上稳定训练 27B 参数模型超过 1,100 步,而 dense Adam 会显存耗尽,使原本内存不可行的 RL 训练变得可行。代码已在相关库中开源。
LLM-as-Jev 框架在 Qwen3.5-4B 和 Qwen3-0.6B 上验证了通用 LLM 无需训练即可直接输出校准的分类决策,4B 模型免训练表现与同底座社区 Jev 式模型持平,且优于 letter-logit 读出方式,支持任意选项数量并原生处理图像多模态决策。
UCLA、MIT和加州大学戴维斯分校团队在《Science Robotics》发表一款185毫克全聚合物微型扑翼飞行机器人,去掉传统传动机构,靠电致伸缩弯曲驱动器直接带动柔性锥形机翼。
推荐理由:论文给出驱动器功率密度、升重比和压缩后升力保留率,可作为柔性抗冲击设计的量化参考。
Sanctuary AI 提出 TIGER(Task-Space Imitation Guidance for Efficient Reinforcement learning),把模仿策略当作稠密奖励信号而非控制器来引导强化学习。
推荐理由:原文给出把模仿策略转为稠密奖励的具体做法与消融结果,可参考其降低真机安全重置次数的思路。
SEER 提出一个自演化事件推理与检索闭环框架,将预测误差转化为反思式检索记忆与持久因果知识库两路解耦反馈,动态优化事件条件化预测。该框架在事件检索与反思中强制严格时序边界,防止前视偏差与数据泄漏。在六个高波动时间序列基准上,SEER 持续优于当前最优的时间序列基础模型与语言模型基线。