新智元· 新智元·· 23 小时前精选AI 评分58
AgentWorld 基准评测多智能体协作:最强模型主任务成功率 52.0%
Agent组队干活,最强模型只完成50%任务!基准评测协作能力
AI 导读
OpenAgents 与哥伦比亚大学、宾夕法尼亚大学、首尔大学等研究者构建多智能体协作评测基准 AgentWorld,论文链接 https://arxiv.org/abs/2609.31590。
推荐理由
原文给出四个模型在主任务集上的成功率与通信量对比,可据此理解多智能体协作评测的现状与方法。
来源:新智元 · mp.weixin.qq.com