RLHND:用视频基础模型从第一人称视频同时估计手部位姿与触觉
RLHND 提出一种基于视频基础模型的手部跟踪模型,从单目第一人称视频中联合估计手部位姿与真实触觉信息。它把预训练的 Cosmos 3 视频扩散主干通过 clean-latent 条件化改造成确定性的片段级特征提取器,位姿流预测解剖学上合理的关节角度并支持形状参数条件化,触觉流在位姿流冻结下预测手表面的密集接触与力。
推荐理由:论文说明了用视频基础模型补上接触与力线索的思路,关注人视频用于机器人策略训练的读者可了解其方法路径。
RLHND 提出一种基于视频基础模型的手部跟踪模型,从单目第一人称视频中联合估计手部位姿与真实触觉信息。它把预训练的 Cosmos 3 视频扩散主干通过 clean-latent 条件化改造成确定性的片段级特征提取器,位姿流预测解剖学上合理的关节角度并支持形状参数条件化,触觉流在位姿流冻结下预测手表面的密集接触与力。
推荐理由:论文说明了用视频基础模型补上接触与力线索的思路,关注人视频用于机器人策略训练的读者可了解其方法路径。
论文提出 UltraText Bench,一个面向 prompt-only 密集视觉文字生成的双语评测基准,含 432 条提示、24 个真实场景类别和三个难度等级,中英文各占一半,每条提示标注 4 至 12 个文字区域的精确字符串及结构化参考。
论文提出 RobotWorld,一个面向机器人操作的仿真测试基准,包含 84 项任务,覆盖操作、移动操作、运动、驾驶与空中控制,设有明确的交互预算与可执行的成功判定。
RunningTab 提出一种为直接工作区交互(DWI)配备环境侧标签页的框架,由环境记录任务待办项、已读文件摘录及已列出但未打开的文件候选。在三个基准测试、三种 LLM 上的验证中,RunningTab 持续优于普通 DWI 及将记录保存在模型内的基线方法,其标签页通常已包含交付物所需内容。
SWE-Game 推出一个由 247 项任务构成的游戏开发基准,覆盖 41 个可执行的 Godot 参考游戏、13 种 2D 与 3D 玩法类别,任务类型涵盖从需求简报生成游戏、按设计文档实现、骨架补全、83 例注入故障修复以及 Godot 到 Unity 移植。
Tetris3D 提出一种单图 3D 场景重建生成框架,显式以周围物体几何及其物理关系为条件生成每个物体,使形状与位姿在场景中保持几何与物理合理。研究同时发布基于物理仿真的数据集 ComOb,包含 1.2M 个场景,提供逐物体网格与成对物理关系标注。在合成与真实场景实验中,Tetris3D 在交互区域被遮挡时仍能恢复连贯的物体形状与位姿,生成质量与物理稳定性达到 state-of-the-art。
WebFovea 是一个视觉网页智能体,在 WebRetriever Challenge 2026 中以 57.0/100 的成绩获得第二名,评测基于 WebRetriever 基准的 Protocol III,要求智能体从入口 URL 出发操作真实网站并返回可验证答案。
论文提出长上下文混合模型机理系列研究 Part 1.1,聚焦全注意力与 SWA 或 GLA、GDN 等线性注意力变体的混合结构。作者观察到上下文扩展中的跷跷板效应,即线性注意力混合模型更受益于长上下文持续预训练,而 SWA 混合模型在长度外推上表现更好,并将其归因于位置归纳偏置差异;同时指出 SWA 混合模型存在短上下文学习陷阱、短窗口倦怠和长窗口惰性。
SGF+(Self Gradient Forcing Plus)为自回归视频生成中的上下文写入与去噪分配独立参数,通过因果注意力保留两者交互,并用原始生成目标联合优化。在仅用 5s rollout 训练的条件下,SGF+ 无需长视频微调即可连续生成长达 24 小时的视频,视觉质量与长时一致性优于所评测的基线,且无需额外视频训练数据或更长训练周期。
论文提出从多向量视觉文档检索器存储的索引中反演还原原始页面,把反演建模为条件文档图像生成。在 ViDoRe v3 基准上,从原始索引反演的页面可恢复 47% 的词和 45% 的敏感 token,用作查询时 98.4% 能把源页面排在首位。
推荐理由:论文用实验量化了多向量文档索引的反演风险,并测试了两种低成本防护的实际效果,做文档检索系统安全评估时可参考其方法。
Long-WAM 提出在实时控制约束下扩展因果世界-动作模型上下文的模型系统框架,核心发现是访问历史不等于使用历史,更长历史只有在视频底座经自回归预训练时才显著见效。
推荐理由:论文用对照实验说明自回归预训练的视频底座才让长历史真正转化为成功率提升,可为世界模型选型提供依据。
GRACE 提出两阶段框架,在压缩预训练视频自编码器的同时保持与预训练 DiT 的兼容:冻结基础潜变量并学习残差潜变量补回强压缩损失的信息,在冻结 DiT 的特征空间中对齐压缩潜变量,再以轻量微调和非对称去噪适配 DiT。
IEEE Spectrum 与 Wiley 联合发布由 Noitom Robotics 赞助的白皮书,介绍 HiPHI 数据集:617.5 小时光学动作捕捉的全身人体动作数据,亚毫米级精度,其中 245.7 小时为人与物体交互数据,含同步物体轨迹与网格,并用 FrameNet 语言框架组织动作覆盖范围。
推荐理由:白皮书给出了数据集规模与人机交互数据的组织方式,关注人形机器人数据来源的读者可据此评估其补充价值。
论文提出CheckerBench,一个包含300个任务的可执行基准,任务源自167个仓库中的297个CVE,覆盖85种CWE和5种语言生态,每个任务提供存在漏洞与修复后的版本、固定的分析环境和检查器脚手架。
AdvSim2Real 在冻结的 Web 世界模型中协同进化任务课程、注入对抗样本与 Web Agent,使 4B agent 在有无攻击时完成率均提升,且能力增益可迁移到真实浏览器。在 150 个 Web 任务上,面对未训练过的前沿模型对抗者,AdvSim2Real 将完成率相对基础 agent 提升 33.6%。
DAEDALUS 通过配对 explorer 与 solver 两个智能体,从自生成任务的失败中提炼启发式规则并汇总为记忆库,在 AppWorld、τ^2-bench 和 AutomationBench 上将平均成功率较无记忆基线提升最多 15.9 点,pass^5 提升最多 2.2x,推理成本低于多数使用训练任务的方法。
端侧级联语音 Agent 采用推测工具执行方案,通过 Predictor 模块在 ASR 阶段预测工具调用并提前执行、缓存结果注入 LLM prompt,实测 Android 语音助手的中位首音频时间从 5.79s 降至 4.60s,标准差从 3.49s 降至 2.81s。方案用基于规则的校验机制过滤用户自我纠正导致的错误缓存,LLM 仍可直接发起工具调用,最坏情况延迟不高于基线串行流水线。
EmbodiedSmith 提出一个通过递归自我改进(RSI)生成可扩展具身数据的框架,将资产、场景与任务生成统一到同一流水线中,支持自主创建与语言驱动定制。其核心是智能体式精修回路,场景生成预判下游任务需求,任务生成反过来引导场景编辑,使两者迭代互促,提升任务生成成功率,包括长时程任务;框架还支持移动机械臂、人形机器人与灵巧手,以及可形变物体和流体交互。
跨 Tokenizer On-Policy 蒸馏研究发现,严格 1:1 对齐位置已覆盖学生生成的大部分 token,将 reverse KL 限制在每个严格位置的共享词表 top-16 子集即可达到与全共享词表 OPD 相当的准确率。
研究提出 SafeActBench,包含 6 个操作域、5 类协议下的 656 个案例,用证据溯源台账与确定性轨迹评估器追踪工具使用型 Agent 从静态动作判断到单步、多步工作流的失败点。在 10 种模型-框架配置中,静态动作评估较强与交互执行较弱并存,失败常发生在执行前:调查不完整或证据未确立就动手。证据确立后单步执行通常可靠,多步工作流则暴露未解决的前置条件与执行不完整。
TRACE 提出一种面向 MoE 语言模型强化学习训练的 FP4 量化框架,通过 rollout 侧量化结果引导训练侧 FP4 舍入决策,直接缩小训练与 rollout 两条量化执行路径的差异。
PhysEvo 提出围绕单一冻结模型的物理递归自改进(RSI)框架,由任务 agent 执行机器人任务、meta-agent 依据轨迹诊断失败并修订工具与技能,全程不更新模型权重也不训练独立动作策略。
推荐理由:论文给出与 RoboDawn 和直接 Astra 的对照成功率,便于评估冻结模型下递归自改进的实际增益。
Recursive Game Creator 在 GameCraft-Bench 上取得 77.89 的整体最优成绩,在 GameASG-Bench 上严格任务成功率达 53.2%,较同模型基线提升 34.1%,运行时检查通过率 93.4% 为对比方法中最高。
WorldSonus 提出面向世界模型的交互式视频到音频框架,用于实时空间声音合成。其采用流式因果自回归扩散架构,以 0.41 的低实时因子(RTF)生成音频块,并通过音频描述流水线与按块索引的提示调度实现生成中动态控制声音事件,同时用立体声与 ambisonic 数据做空间对齐监督。
报告提出 nanoMuse,一个 GPL-3.0 开源的个人智能体,运行在用户拥有的每台设备上,可操作手机和电脑屏幕,通过任何人可运行的中继共享同一段对话,所有动作经 Sentinel 审核,记忆以用户可读的文件形式保存,模型由用户自选。
DecepEval 发布了一个包含 1,532 个实例、覆盖 3 类任务与 28 个专业场景的 LLM Agent 欺骗行为评测基准,并提出 LLM Deception Diamond 框架,刻画压力、激励、机会、冲突四种可能诱发欺骗的外部条件。
Recurrent Looped Transformer(RLT)将层分为并行因果编码器与循环解码器,每个 token 上解码器融合编码器输出与上一 token 的最终解码状态,使计算路径随序列长度增长而单 token 成本固定。
论文提出 KL-Regularized Policy Optimization(KLPO),将 KL 正则锚定在采样器上,通过最小二乘拟合采样器自身轨迹的 log-ratio 最优性条件,无需重要性权重即可完成策略更新。
Hugging Face 收录论文提出 DLoop,一种循环形式的投机解码方法,在验证前自适应执行多轮草稿阶段,草稿模型保持高置信时持续起草并一次性验证累积的草稿 token。
研究团队提出 ProactiveCoach 套件,包含训练集 ProactiveCoach-Instruct、评测集 ProactiveCoachBench 与自适应引导系统,在阶段、步骤、动作三个层级提供结构化引导数据。
魔芯科技的4D世界模型MoWorld随华为Mate 90系列发布进入消费端,鸿蒙独占应用「摸小宠」可将几张手机拍摄的宠物照片生成可任意视角浏览的4D数字猫。技术上采用端云协同,云端昇腾NPU生成3D高斯模型,约6亿参数的MoWorld-2.0-Flash经量化裁剪后跑在麒麟芯片上完成端侧渲染,推理成本约为进口GPU方案的30%。
PrisMem 提出能力驱动的智能体记忆自进化方法,通过依赖感知的能力选择与历史引导诊断来优化记忆程序,并在 BEAM-1M 和 LongMemEval-M 上分别以 10.54 和 7.83 个百分点的优势超过最强基线。
研究提出激活对齐(activation alignment)方法,通过在合成无标签数据上训练一个轻量线性变换,将使用部分上下文的"学生"模型的中间激活映射向使用全部数据的"教师"模型,训练对齐器无需 GPU,在普通硬件上数秒至数分钟即可收敛。
LoGRA 通过低秩梯度草图保留有效学习信号,将 LLM 强化学习后训练的平均训练内存最多降低 45.7%,且不损失性能。该方法配合 predicted-KL 步长控制,在单个八 GPU 节点上稳定训练 27B 参数模型超过 1,100 步,而 dense Adam 会显存耗尽,使原本内存不可行的 RL 训练变得可行。代码已在相关库中开源。
LLM-as-Jev 框架在 Qwen3.5-4B 和 Qwen3-0.6B 上验证了通用 LLM 无需训练即可直接输出校准的分类决策,4B 模型免训练表现与同底座社区 Jev 式模型持平,且优于 letter-logit 读出方式,支持任意选项数量并原生处理图像多模态决策。
UCLA、MIT和加州大学戴维斯分校团队在《Science Robotics》发表一款185毫克全聚合物微型扑翼飞行机器人,去掉传统传动机构,靠电致伸缩弯曲驱动器直接带动柔性锥形机翼。
推荐理由:论文给出驱动器功率密度、升重比和压缩后升力保留率,可作为柔性抗冲击设计的量化参考。
Sanctuary AI 提出 TIGER(Task-Space Imitation Guidance for Efficient Reinforcement learning),把模仿策略当作稠密奖励信号而非控制器来引导强化学习。
推荐理由:原文给出把模仿策略转为稠密奖励的具体做法与消融结果,可参考其降低真机安全重置次数的思路。
SEER 提出一个自演化事件推理与检索闭环框架,将预测误差转化为反思式检索记忆与持久因果知识库两路解耦反馈,动态优化事件条件化预测。该框架在事件检索与反思中强制严格时序边界,防止前视偏差与数据泄漏。在六个高波动时间序列基准上,SEER 持续优于当前最优的时间序列基础模型与语言模型基线。
北京理工大学石青教授团队以象鼩为仿生原型,研制出搭载双关节耦合脊柱的微小型四足机器人 FLEXOR,整机重量 338 克、机身长度 110 毫米,相关长文发表于 Science Advances。
推荐理由:对照实验给出双关节耦合脊柱相对单关节脊柱的速度与能耗差异,可为腿足机器人本体设计提供参考。
SSR(Selection-based Structured Reasoning)框架将多模态搜索智能体的推理从开放式生成改为从预设可复用的自然语言候选中选择,无需辅助任务头。在七个多模态搜索基准上用 2B 和 4B 模型评测,SSR 在多种强化学习目标与监督微调下,每轮推理时延降低超过 90%,每题总模型推理时延降低 28-54%,平均成功率与同规模领先搜索智能体相当。