跳到正文
热点事件观察中

Memento 3 用规则手册让冻结参数模型递归自我改进

1 篇报道1 个报道来源2 天前更新

先了解这件事

AI 综述

Memento 3 研究团队提出一种让参数冻结的 LLM 智能体持续学习的方法:维护自然语言规则手册作为持久记忆,并将其编译为可执行代码用于预测与规划,通过观察、反思、修订、编译与验证的循环,用预测误差同时改进规则手册和代码。更新后的代码须经 LLM 判断忠实于规则手册、且逐格回放复现观察到的状态转移才被接受。 团队报告的评测结果:在 ARC-AGI-3 上,该单模型智能体通关全部 25 个公开游戏的每一关,平均相对人类动作效率(RHAE)为 100.0,动作数为人类的 44%;在 Atari Pong 案例中,学到的反馈控制器在三个不同开局的评测对局中均以 21:0 获胜,且不再调用 LLM。

AI 根据报道生成 · 57 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. Hugging Face 每日论文精选
    Memento 3:通过可修订规则手册实现基于模型的递归自我改进

    Memento 3 让冻结参数的 LLM 智能体通过外部记忆持续学习显式世界模型:维护自然语言规则手册作为持久语义记忆,并将其编译为可执行代码用于预测与规划,通过观察、反思、修订、编译与验证的循环,用预测误差同时改进规则手册和代码,更新后的代码需通过 LLM 忠实性判断与逐格回放验证才被接受。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。