跳到正文
Hugging Face 每日论文·· 2 天前AI 评分49

DecepEval:面向 LLM Agent 欺骗行为的评测基准

DecepEval: A Benchmark for Evaluating Deception in LLM Agents

AI 导读

DecepEval 发布了一个包含 1,532 个实例、覆盖 3 类任务与 28 个专业场景的 LLM Agent 欺骗行为评测基准,并提出 LLM Deception Diamond 框架,刻画压力、激励、机会、冲突四种可能诱发欺骗的外部条件。

来源:Hugging Face 每日论文 · huggingface.co