跳到正文
今天10月8日周四15 条
  1. Hugging Face 每日论文56

    RLHND:用视频基础模型从第一人称视频同时估计手部位姿与触觉

    RLHND 提出一种基于视频基础模型的手部跟踪模型,从单目第一人称视频中联合估计手部位姿与真实触觉信息。它把预训练的 Cosmos 3 视频扩散主干通过 clean-latent 条件化改造成确定性的片段级特征提取器,位姿流预测解剖学上合理的关节角度并支持形状参数条件化,触觉流在位姿流冻结下预测手表面的密集接触与力。

    推荐理由:论文说明了用视频基础模型补上接触与力线索的思路,关注人视频用于机器人策略训练的读者可了解其方法路径。

  2. Hugging Face 每日论文47

    RunningTab:为 LLM 智能体的直接工作区交互引入环境侧标签页

    RunningTab 提出一种为直接工作区交互(DWI)配备环境侧标签页的框架,由环境记录任务待办项、已读文件摘录及已列出但未打开的文件候选。在三个基准测试、三种 LLM 上的验证中,RunningTab 持续优于普通 DWI 及将记录保存在模型内的基线方法,其标签页通常已包含交付物所需内容。

  3. Hugging Face 每日论文49

    Tetris3D:生成彼此契合物体的单图 3D 场景重建框架

    Tetris3D 提出一种单图 3D 场景重建生成框架,显式以周围物体几何及其物理关系为条件生成每个物体,使形状与位姿在场景中保持几何与物理合理。研究同时发布基于物理仿真的数据集 ComOb,包含 1.2M 个场景,提供逐物体网格与成对物理关系标注。在合成与真实场景实验中,Tetris3D 在交互区域被遮挡时仍能恢复连贯的物体形状与位姿,生成质量与物理稳定性达到 state-of-the-art。

  4. Hugging Face 每日论文55

    长上下文混合模型机理研究 Part 1.1:从混合注意力到混合位置

    论文提出长上下文混合模型机理系列研究 Part 1.1,聚焦全注意力与 SWA 或 GLA、GDN 等线性注意力变体的混合结构。作者观察到上下文扩展中的跷跷板效应,即线性注意力混合模型更受益于长上下文持续预训练,而 SWA 混合模型在长度外推上表现更好,并将其归因于位置归纳偏置差异;同时指出 SWA 混合模型存在短上下文学习陷阱、短窗口倦怠和长窗口惰性。

  5. Hugging Face 每日论文49

    SGF+:解耦自回归视频生成中的梯度流

    SGF+(Self Gradient Forcing Plus)为自回归视频生成中的上下文写入与去噪分配独立参数,通过因果注意力保留两者交互,并用原始生成目标联合优化。在仅用 5s rollout 训练的条件下,SGF+ 无需长视频微调即可连续生成长达 24 小时的视频,视觉质量与长时一致性优于所评测的基线,且无需额外视频训练数据或更长训练周期。

  6. Hugging Face 每日论文57

    多向量视觉文档索引可被反演还原页面内容

    论文提出从多向量视觉文档检索器存储的索引中反演还原原始页面,把反演建模为条件文档图像生成。在 ViDoRe v3 基准上,从原始索引反演的页面可恢复 47% 的词和 45% 的敏感 token,用作查询时 98.4% 能把源页面排在首位。

    推荐理由:论文用实验量化了多向量文档索引的反演风险,并测试了两种低成本防护的实际效果,做文档检索系统安全评估时可参考其方法。

  7. Hugging Face 每日论文64

    Long-WAM:扩展世界-动作模型上下文的模型系统框架

    Long-WAM 提出在实时控制约束下扩展因果世界-动作模型上下文的模型系统框架,核心发现是访问历史不等于使用历史,更长历史只有在视频底座经自回归预训练时才显著见效。

    推荐理由:论文用对照实验说明自回归预训练的视频底座才让长历史真正转化为成功率提升,可为世界模型选型提供依据。

  8. IEEE Spectrum · Robotics57

    HiPHI:面向人形机器人大规模高精度人体动作与物体交互数据集白皮书

    IEEE Spectrum 与 Wiley 联合发布由 Noitom Robotics 赞助的白皮书,介绍 HiPHI 数据集:617.5 小时光学动作捕捉的全身人体动作数据,亚毫米级精度,其中 245.7 小时为人与物体交互数据,含同步物体轨迹与网格,并用 FrameNet 语言框架组织动作覆盖范围。

    推荐理由:白皮书给出了数据集规模与人机交互数据的组织方式,关注人形机器人数据来源的读者可据此评估其补充价值。

  9. Hugging Face 每日论文47

    AdvSim2Real:在冻结的 Web 世界模型中协同进化任务课程、注入对抗样本与 Web Agent,抵御自适应提示注入

    AdvSim2Real 在冻结的 Web 世界模型中协同进化任务课程、注入对抗样本与 Web Agent,使 4B agent 在有无攻击时完成率均提升,且能力增益可迁移到真实浏览器。在 150 个 Web 任务上,面对未训练过的前沿模型对抗者,AdvSim2Real 将完成率相对基础 agent 提升 33.6%。

10月7日周三
  1. Hugging Face 每日论文55

    DAEDALUS:从自生成任务中引导智能体记忆

    DAEDALUS 通过配对 explorer 与 solver 两个智能体,从自生成任务的失败中提炼启发式规则并汇总为记忆库,在 AppWorld、τ^2-bench 和 AutomationBench 上将平均成功率较无记忆基线提升最多 15.9 点,pass^5 提升最多 2.2x,推理成本低于多数使用训练任务的方法。

  2. Hugging Face 每日论文53

    通过推测执行隐藏端侧级联语音 Agent 的工具调用延迟

    端侧级联语音 Agent 采用推测工具执行方案,通过 Predictor 模块在 ASR 阶段预测工具调用并提前执行、缓存结果注入 LLM prompt,实测 Android 语音助手的中位首音频时间从 5.79s 降至 4.60s,标准差从 3.49s 降至 2.81s。方案用基于规则的校验机制过滤用户自我纠正导致的错误缓存,LLM 仍可直接发起工具调用,最坏情况延迟不高于基线串行流水线。

  3. Hugging Face 每日论文55

    EmbodiedSmith:通过仿真中递归自我改进飞轮扩展具身数据

    EmbodiedSmith 提出一个通过递归自我改进(RSI)生成可扩展具身数据的框架,将资产、场景与任务生成统一到同一流水线中,支持自主创建与语言驱动定制。其核心是智能体式精修回路,场景生成预判下游任务需求,任务生成反过来引导场景编辑,使两者迭代互促,提升任务生成成功率,包括长时程任务;框架还支持移动机械臂、人形机器人与灵巧手,以及可形变物体和流体交互。

  4. Hugging Face 每日论文53

    工具使用型 Agent 如何在证据到行动的链条上失败

    研究提出 SafeActBench,包含 6 个操作域、5 类协议下的 656 个案例,用证据溯源台账与确定性轨迹评估器追踪工具使用型 Agent 从静态动作判断到单步、多步工作流的失败点。在 10 种模型-框架配置中,静态动作评估较强与交互执行较弱并存,失败常发生在执行前:调查不完整或证据未确立就动手。证据确立后单步执行通常可靠,多步工作流则暴露未解决的前置条件与执行不完整。

10月6日周二
  1. Hugging Face 每日论文60

    PhysEvo:围绕冻结模型的物理递归自改进框架在 RoboDojo 与真机上评测

    PhysEvo 提出围绕单一冻结模型的物理递归自改进(RSI)框架,由任务 agent 执行机器人任务、meta-agent 依据轨迹诊断失败并修订工具与技能,全程不更新模型权重也不训练独立动作策略。

    推荐理由:论文给出与 RoboDawn 和直接 Astra 的对照成功率,便于评估冻结模型下递归自改进的实际增益。

  2. Hugging Face 每日论文55

    WorldSonus:为世界模型实时合成空间立体声的视频到音频框架

    WorldSonus 提出面向世界模型的交互式视频到音频框架,用于实时空间声音合成。其采用流式因果自回归扩散架构,以 0.41 的低实时因子(RTF)生成音频块,并通过音频描述流水线与按块索引的提示调度实现生成中动态控制声音事件,同时用立体声与 ambisonic 数据做空间对齐监督。

10月5日周一
  1. 新智元64

    魔芯科技MoWorld 4D世界模型落地华为Mate 90,摸小宠应用上线

    魔芯科技的4D世界模型MoWorld随华为Mate 90系列发布进入消费端,鸿蒙独占应用「摸小宠」可将几张手机拍摄的宠物照片生成可任意视角浏览的4D数字猫。技术上采用端云协同,云端昇腾NPU生成3D高斯模型,约6亿参数的MoWorld-2.0-Flash经量化裁剪后跑在麒麟芯片上完成端侧渲染,推理成本约为进口GPU方案的30%。

  2. Hugging Face 每日论文55

    LoGRA:用低秩梯度草图扩展 LLM 强化学习训练

    LoGRA 通过低秩梯度草图保留有效学习信号,将 LLM 强化学习后训练的平均训练内存最多降低 45.7%,且不损失性能。该方法配合 predicted-KL 步长控制,在单个八 GPU 节点上稳定训练 27B 参数模型超过 1,100 步,而 dense Adam 会显存耗尽,使原本内存不可行的 RL 训练变得可行。代码已在相关库中开源。

10月4日周日
10月3日周六
  1. 机器人大讲堂58

    UCLA等团队造出185毫克全聚合物扑翼飞行机器人,被1.1万倍自重压扁后仍能起飞

    UCLA、MIT和加州大学戴维斯分校团队在《Science Robotics》发表一款185毫克全聚合物微型扑翼飞行机器人,去掉传统传动机构,靠电致伸缩弯曲驱动器直接带动柔性锥形机翼。

    推荐理由:论文给出驱动器功率密度、升重比和压缩后升力保留率,可作为柔性抗冲击设计的量化参考。

10月2日周五
  1. Hugging Face 每日论文47

    SEER:面向时间序列预测的自演化事件推理与检索框架

    SEER 提出一个自演化事件推理与检索闭环框架,将预测误差转化为反思式检索记忆与持久因果知识库两路解耦反馈,动态优化事件条件化预测。该框架在事件检索与反思中强制严格时序边界,防止前视偏差与数据泄漏。在六个高波动时间序列基准上,SEER 持续优于当前最优的时间序列基础模型与语言模型基线。

10月1日周四
  1. 机器人大讲堂58

    北理工团队发布仿生脊柱四足机器人 FLEXOR,动态脊-腿协同使速度提升 31.6%

    北京理工大学石青教授团队以象鼩为仿生原型,研制出搭载双关节耦合脊柱的微小型四足机器人 FLEXOR,整机重量 338 克、机身长度 110 毫米,相关长文发表于 Science Advances。

    推荐理由:对照实验给出双关节耦合脊柱相对单关节脊柱的速度与能耗差异,可为腿足机器人本体设计提供参考。

  2. Hugging Face 每日论文55

    Selection-Based Structured Reasoning:面向高效多模态搜索智能体的结构化推理框架

    SSR(Selection-based Structured Reasoning)框架将多模态搜索智能体的推理从开放式生成改为从预设可复用的自然语言候选中选择,无需辅助任务头。在七个多模态搜索基准上用 2B 和 4B 模型评测,SSR 在多种强化学习目标与监督微调下,每轮推理时延降低超过 90%,每题总模型推理时延降低 28-54%,平均成功率与同规模领先搜索智能体相当。