跳到正文
新智元· 新智元·· 23 小时前精选AI 评分58

AgentWorld 基准评测多智能体协作:最强模型主任务成功率 52.0%

Agent组队干活,最强模型只完成50%任务!基准评测协作能力

AI 导读

OpenAgents 与哥伦比亚大学、宾夕法尼亚大学、首尔大学等研究者构建多智能体协作评测基准 AgentWorld,论文链接 https://arxiv.org/abs/2609.31590。

推荐理由

原文给出四个模型在主任务集上的成功率与通信量对比,可据此理解多智能体协作评测的现状与方法。

来源:新智元 · mp.weixin.qq.com