跳到正文
Hugging Face 每日论文·· 1 天前精选AI 评分56

RLHND:用视频基础模型从第一人称视频同时估计手部位姿与触觉

RLHND: Video Foundation Models as Physically Grounded Hand Trackers for Robot Learning

AI 导读

RLHND 提出一种基于视频基础模型的手部跟踪模型,从单目第一人称视频中联合估计手部位姿与真实触觉信息。它把预训练的 Cosmos 3 视频扩散主干通过 clean-latent 条件化改造成确定性的片段级特征提取器,位姿流预测解剖学上合理的关节角度并支持形状参数条件化,触觉流在位姿流冻结下预测手表面的密集接触与力。

推荐理由

论文说明了用视频基础模型补上接触与力线索的思路,关注人视频用于机器人策略训练的读者可了解其方法路径。

来源:Hugging Face 每日论文 · huggingface.co