伦敦大学学院与华为诺亚推 Memento 3,以冻结大模型通关 ARC-AGI-3
伦敦大学学院(UCL)与华为诺亚方舟实验室的研究团队发布 Memento 3,一种让底层大模型保持“冻结”、仅靠外部记忆自我改进的智能体框架。在 ARC-AGI-3 这个以“反记忆化”著称的抽象推理基准上,它通关了全部 25 个公开关卡,取得满分 100.0 的相对人类动作效率(RHAE),而总动作数仅 7,518 步,相当于人类基线 17,135 步的 44%。

与传统动辄微调或重训模型的做法不同,Memento 3 把“世界模型”写成一份 Markdown 格式的自然语言规则手册,并在每次预测失败后将其编译成可执行的 Python 模块。系统先观察环境、反思假设、修改规则、重新编译,再用“单元格级精确回放”验证新规则能否复现已观测到的状态转移;只有通过了语义对齐审计和确定性回放,更新才会被接受。论文作者包括 Haoyu Zhao、Zhengxu Yu 等人,相关结果发表于 arXiv(编号 2610.11794)。

这种“以代码为模型”的设计带来两个值得注意的效果。其一,在相同的 ARC-AGI-3 基准上,直接推理的 Claude Opus 5 仅拿到 40.7 的 RHAE,与 Memento 3 相差约 59 分,说明显式的规则修订比单纯依赖大模型推理更有效。其二,在一个 Atari 乒乓球案例研究中,由规则手册衍生的反馈控制器在三次对局中以 21:0 完胜对手,且执行阶段不再调用任何大模型推理,论文称其样本效率比 EfficientZero V2 等基于模型的强化学习基线高约 42 倍。
对业界而言,Memento 3 的意义在于把“外部记忆”推到了与“训练出的世界模型”平起平坐的位置。过去一年,企业一边扩张智能体预算,一边对各类基准成绩的可信度心存疑虑;一个冻结大模型、靠可读规则手册迭代就能逼近甚至超越人类动作效率的系统,正把争论引向一个新方向:驱动智能体表现的,究竟是更大的模型,还是围绕较小模型更聪明的脚手架。不过需要明确的是,上述成绩均来自公开关卡,基准还保留了一套用于防过拟合的私有评测集,Memento 3 在私有集上的表现仍有待独立验证。
读者评论 (0)
想参与讨论?请 登录 后发表评论。
还没有评论,欢迎抢沙发!