跳到正文
Hugging Face 每日论文·· 1 天前AI 评分53

OneSearch-VL:基于视觉锚定证据图的统一多模态深度研究智能体

OneSearch-VL: Unified Multimodal Deep Research Agent for Image and Video

AI 导读

OneSearch-VL 提出以 Visually Grounded Evidence Graph(VGEG)为核心,统一单图、多图与视频的深度研究流程,将视觉锚定、外部检索与事实组合的依赖关系编码为共享参考。

来源:Hugging Face 每日论文 · huggingface.co