Memento 3 用规则手册让冻结参数模型递归自我改进
热点事件观察中
Memento 3 用规则手册让冻结参数模型递归自我改进
1 篇报道1 个报道来源2 天前更新
先了解这件事
AI 综述
Memento 3 研究团队提出一种让参数冻结的 LLM 智能体持续学习的方法:维护自然语言规则手册作为持久记忆,并将其编译为可执行代码用于预测与规划,通过观察、反思、修订、编译与验证的循环,用预测误差同时改进规则手册和代码。更新后的代码须经 LLM 判断忠实于规则手册、且逐格回放复现观察到的状态转移才被接受。 团队报告的评测结果:在 ARC-AGI-3 上,该单模型智能体通关全部 25 个公开游戏的每一关,平均相对人类动作效率(RHAE)为 100.0,动作数为人类的 44%;在 Atari Pong 案例中,学到的反馈控制器在三个不同开局的评测对局中均以 21:0 获胜,且不再调用 LLM。
AI 根据报道生成 · 57 分钟前更新
最新进展10月8日 08:00
Memento 3:通过可修订规则手册实现基于模型的递归自我改进报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- Hugging Face 每日论文精选Memento 3:通过可修订规则手册实现基于模型的递归自我改进
Memento 3 让冻结参数的 LLM 智能体通过外部记忆持续学习显式世界模型:维护自然语言规则手册作为持久语义记忆,并将其编译为可执行代码用于预测与规划,通过观察、反思、修订、编译与验证的循环,用预测误差同时改进规则手册和代码,更新后的代码需通过 LLM 忠实性判断与逐格回放验证才被接受。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。