跳到正文
新智元· ASI启示录·· 13 小时前精选AI 评分57

Quantum-Harbor 虚拟量子实验室对 17 个 AI Agent 展开评测

全球17大顶级AI实验室大逃杀!惨遭集体翻车,GPT-5.6与Opus断层领先

AI 导读

NUS、NTU 等高校与 GaugeForge 团队提出 Verified Autonomy 概念,构建可交互虚拟量子实验室 Quantum-Harbor 与 QIQCBench,用 49 项量子工程任务对 17 个 AI Agent 进行压力测试,采用 Evidence-bound grading 评分机制。

推荐理由

原文给出了评测环境、任务数量和失败原因分布,可据此理解 Agent 在真实科研资源约束下的可靠性短板。

来源:新智元 · mp.weixin.qq.com