Hugging Face 每日论文·· 2 天前AI 评分49
DecepEval:面向 LLM Agent 欺骗行为的评测基准
DecepEval: A Benchmark for Evaluating Deception in LLM Agents
AI 导读
DecepEval 发布了一个包含 1,532 个实例、覆盖 3 类任务与 28 个专业场景的 LLM Agent 欺骗行为评测基准,并提出 LLM Deception Diamond 框架,刻画压力、激励、机会、冲突四种可能诱发欺骗的外部条件。
来源:Hugging Face 每日论文 · huggingface.co