Hugging Face 每日论文·· 2 天前AI 评分53
工具使用型 Agent 如何在证据到行动的链条上失败
From Evidence to Action: How Tool-Using Agents Fail
AI 导读
研究提出 SafeActBench,包含 6 个操作域、5 类协议下的 656 个案例,用证据溯源台账与确定性轨迹评估器追踪工具使用型 Agent 从静态动作判断到单步、多步工作流的失败点。在 10 种模型-框架配置中,静态动作评估较强与交互执行较弱并存,失败常发生在执行前:调查不完整或证据未确立就动手。证据确立后单步执行通常可靠,多步工作流则暴露未解决的前置条件与执行不完整。
来源:Hugging Face 每日论文 · huggingface.co