跳到正文
arXiv cs.RO 机器人学· Hong Su·· 6 小时前AI 评分44

面向长期 LLM Agent 的情境条件化思考策略学习

Learning Situation-Conditioned Thinking Policies for Long-Term LLM Agents

AI 导读

论文提出情境条件化思考记忆框架,将历史推理经验转化为预测当前情境应思考内容的轻量策略,把详细推理留给大语言模型。实验显示该策略在时间规则泛化上达到 1.000 F1,将 DeepSeek 推理 F1 从 0.789 提升至 0.868,在 30,000 条历史情境下把单次查询在线处理时间从 0.3636 ms 降至 0.0382 ms。

来源:arXiv cs.RO 机器人学 · arxiv.org