你有没有想过为什么现在的大模型 哪怕宣称拥有200万Token的超长上下文 但只要你把它扔进一个 需要连续执行几万步操作的 真实工程环境理事 它很快就会像个窝头仓一样原地打转呢 因为我们一直以来的直觉可能全错了 我们总是把大模型的记忆 当成是一块被动的硬盘 不管是RAG 是向量数据库 还是无线滑动的上下文窗口 思路都是系统替模型存 需要的时候替模型搜 但是试想一下 如果你在工作的时候 所有的笔记草稿参考资料 都是别人替你记 然后再强行塞进你的视野里 你能做好复杂的长期项目吗 这就是今天我们要拆解的硬核突破 今天这期视频我们要来看一篇 来自斯坦福大学的研究者的顶尖工作 题目叫自动学习记忆 作为一种认知技能 他们做了一件急剧破坏性的事情 那就是不再给大模型外挂静态的记忆模块 而是直接把记忆管理变成一种可以被训练的 类似敲击键盘一样的主动动作 结果我们看屏幕的Figure 1 仅仅通过优化怎么做笔记这一个环节 连模型本体的执行任务权重都没有碰 一个32B的开源小模型 Queen 2.5 32B Instruct 在超级长周期的极客游戏里 新能直接翻了2-4倍 它不仅把72B的老大哥按在地上摩擦 甚至一跃达到了 碧原天花板Cloud Opera 4.5和 Jamlet 3.1 Pro Thinking的同等水平 这期视频的信息量极大 我们会直接深入到Ultomand架构图和代码演化里 帮你把这种能够落地到生产环境的记忆工程学抛开 我们先来拆解它的核心玩法 你看如果要让模型自己管理记忆 第一步该做什么呢 作者给出单非常具有工程感 那就是为他提供一套标准的文件系统 在Ultomand设计里 大模型的动作空间被彻底截偶了 什么叫截偶呢 就像你在一座巨大的图书馆里 本来你只能执行找书和看书的操作 现在系统给了你一间独立的阅览室 不仅允许你在这里新建文件夹写备忘录 还允许你用read, write, search, append 这些标准的系统指令来管理你的专属草稿纸 你看这套内环逻辑 每走一步 agent都要跑两个标准的历程 首先是lock阶段 这就像是模型在自问自答 刚才发生了什么 环境给了我什么反馈 哪些值得记下来 模型可以自己决定 是不是要把新探索到的地图坐标 追加进文件里 或者创建一个新文件来记录 刚才遇到的怪物的属性 接着是plan阶段 在做出下个动作之前 他要问自己 我需要查什么资料才能决定下一步呢 于是他去搜索自己刚刚建好的文件 读取关键信息 最后才向游戏世界发出一个真实的动作 比如向东走或者准备长剑 这就把大模型脑子里那种黑盒式的影视状态跟踪 变成了显示的可控的U盘热插拔 你的每一步记忆操作都是记录在案的系统文本举令 这就意味着它是可以被审查 是可以被持续集成的流水线优化的 光看最终的分数还不够过瘾 我们必须看看这些宏观分数背后 具体发生了什么工程奇迹 等会儿你注意看图5和图4 我们先来看看这套记忆文件的scam 到底是怎么一步步演化的 也就是外环1到底做了什么 你仔细看图5这绝对是全篇 最让我兴奋的工程细节 在没有优化的V0初始版本里 模型维护的NetHang地图文件 简直就是一场灾难 它是一个无界追加的文件 这就好像一个初级程序员 在用卡夫克消息对裂打日子 不管3721每走一步 只要看到地图上的一堵墙 就往文件末尾加上一行 坐标44-19是一堵墙 如果你在一个房间里来回排回了100步 你的文件里就会出现100行重复的墙壁坐标 这根本不是记忆 这是一笔庞大的烂掌 到了V1版本 上帝视角的架构师Meta LM 审查轨迹之后 实在看不下去了 大笔一挥 引入了一个极其优雅的操作 Observ Map 这是一个带有坐标建制队的驱虫操作 这就把原本愚蠢的追加日子 变成了一个极其高效的Redis KV缓存库 只要是同一个坐标 新的观察结果直接覆盖旧的记录 这个小小的改动 带来了一个极其暴力的收益 你听好啊 就是模型的每部记忆文件 上下文增量 直接从138个字符 瞬间爆降到了仅仅6个字符 这是整整95%的空间压缩率 再进化到VR版本 架构师进一步发现 模型在管理背包时老是出错 于是直接在框架层面 加入了自动同步背包机制 以及预先加载好的战略指南 模型不需要再浪费API调用 去反复确认 我的目标是什么 我的背包理由什么 系统会自动帮它维持好当前状态 这种结构上的降维打击 直接反映在了模型的行为指标上 我们看图四 因为格式规范了 模型无意义的冗余写入 断崖是下跌了68%到83% 空搜索率降了13%到50% 对于我们开发者来说 这意味着什么呢 在真实的生产环境里 API是按Token计费的 GPU显存是按上下文长度占用的 准确率不仅没掉 每一步的输入上下文直接缩减了30% 也就是你的显存和API账单能闭眼省下30% 这就是这一篇论文最暴力的算力账本 并且这不仅仅是基于效率提高了 连模型执行任务的行为也变聪明了 你看图四最左侧这个图 游戏里的无效动作 比如卡在墙角抽搐 或者在走廊里来回踱步 直接下降了将近65% 如果你觉得还不直观 我们看图六里 Mini Hank的这个Current R3任务 要求是在迷宫一样的走廊里 找到向下的楼梯 基础模型和紧优化结构的模型都在这里原地打转 不断重走走过的死胡同 直到部署耗尽 通关率是0% 但是加上了专门训练的读写记忆的specialist之后 他内化了先查资料再写日志的习惯 他成功穿透了迷宫 通过率直接反转 从0到了完美的100% 这是一个巨大的极其震撼的飞跃 好吗 好吗 好吗 好吗 好吗 好吗 好吗 好吗 好吗 好吗 好吗 好吗 好吗 好吗 好吗 好吗 好吗 好吗 好吗 好吗 好吗 好吗 好吗 好吗 好吗 好吗 好吗