Hugging Face 每日论文·· 1 天前AI 评分47
Learn2Play Bench:LLM 智能体在陌生环境中从经验学习的能力评测
Learn2Play Bench: How Well Do LLM Agents Learn from Experience in Unfamiliar Environments?
AI 导读
Learn2Play Bench 推出一套由新设计文本游戏构成的基准,游戏规则新颖或反直觉,要求智能体通过交互而非预训练知识获取知识,并提供可复现反馈与自动评分。评测发现:完整保留动作与反馈记录比将其总结为规则或策略更能支持有效学习;顶尖人类玩家的峰值得分高于受测智能体,且人类探索策略更多样、重复动作更少;在骨干模型固定时,更换 harness 可提升性能并降低估算推理成本。
来源:Hugging Face 每日论文 · huggingface.co