首屏
一句话:Agent 的记忆中间件——把人类记忆的编码、巩固、检索、遗忘做成工程机制,让 Agent 压缩上下文后仍记得线索、且实战真的变强。
六个数:ScriptMem 92.6%(头对头 85 vs 56)| LongMemEval-S +13pp | 真实编码耗时省 40–50% | 续接 −51% | AML 首测 文本47.36/代码56.33 | 40 任务镜像 35%→90%
主视觉:图 1 详细架构图
S0 产品形态:一个没有界面、但每轮都在工作的中间件
musemem 挂在 Pi agent 上,没有 UI,却在每次对话里做四件事:
- 编码:每轮结束(turn_end)把情景证据以 append-only JSONL 写入(内容哈希当 ID,天然防重复),轮次+1、证据衰减。
- 巩固:借宿主的上下文压缩事件触发,每次压缩恰好 1 次廉价 LLM 调用,把证据蒸馏成 L1 语义事实卡;每张卡强制带 sourceRefs 指回原始证据,对不上就拒收——防 AI 自己编记忆。同类 todo 成功≥3/失败≥2 自动成 L2 程序性卡,零 LLM。
- 检索与注入:每轮开始前(before_agent_start)按相关性+强度排序、在字符预算内注入提示词;BM25 与语义嵌入 max-blend 混合(谁强听谁的,不做加权平均)。
- 遗忘与治理:衰减按轮次钟(隔几轮)而非挂钟;Dream 离线只做治理标签(同义合并、冷记忆归档休眠),归档≠删除;
memory get <id>随时取回全文——压缩的是呈现,不是存储。
双 scope:SESSION 情景证据(会话隔离、会衰减)+ PROJECT 笔记(跨会话、永不衰减)。首因目标被确定性钉死(强度 0.95、独立注入、永不压缩)。
S1 需求与洞察
HMW:如何让 Agent 在持续对话与上下文压缩后,仍记住信息线索并切实提高实战效果?
- 全量上下文:体积无界、成本爆炸。
- 摘要压缩:压掉细节、无法溯源、“摘要的摘要”层层流失。
- 简单向量记忆:只存不巩固、不会遗忘、无溯源,AI 编的记忆照单全收。
S2 市场与现状
| 现有方案 | 失效原因 |
|---|---|
| 全量上下文 / 长窗口 | 体积无界、成本与延迟随历史线性增长 |
| 摘要式压缩 | 细节丢失、不可溯源、级联压缩后信息层层流失 |
| 简单向量库记忆 | 只存不巩固、无遗忘机制、无溯源,幻觉记忆入库 |
| 业界记忆产品(如 MemoraX) | 同场头对头 ScriptMem 56%(我方 85%);路线相近但检索与治理弱 |
S3 方案与规划:把认知科学转译成工程机制
| 认知科学依据 | 工程落点 |
|---|---|
| ACT-R 激活衰减 | 轮次钟衰减(事件密度驱动,非挂钟) |
| Bjork 双强度(RS/SS) | 检索打分同时用”想不想得起”与”存得深不深” |
| 系统巩固(Squire & Alvarez) | L0 证据→L1 事实→L2 程序(hippocampal→neocortical) |
| 互补学习系统(McClelland) | 快学习证据层 + 慢学习事实/程序层 |
| 编码特异性(Tulving & Thomson) | 时间元数据随记录索引,作检索线索 |
| 扩散激活 | 联想涌现(注入预算内占 25%,待单独消融) |
关键工程决定:
- max-blend 混合检索:平均会把”意思对但关键词没撞上”的记录稀释;取 max 让两条腿各自发挥。
- fail-closed:嵌入没了退纯关键词;LLM 失败静默降级纯确定性档;熔断 3 次自动停用——任何部件坏了就降级,绝不硬撑。
- 溯源拒收:L1 卡无 sourceRefs 或指不回证据即拒收。
- 有界注入:激活阈值管相关性 + 8k 字符硬预算管总量(对照”全量倾倒”体积无界)。
(详细架构见图 1;生命周期见图 2;检索见图 3。)
S4 开发与迭代:bench 驱动开发
- 每个基准暴露的真缺陷都修复并加回归测试(6+ 例);所有 runner 断点续跑;声明噪音带:±2.5pp 以内的”提升”不承认。
- 五代实战 bench 演化(每代由上一代教训驱动):
- v1 探索者:MEM 93% vs OFF 86%,差距太小——OFF 现场翻文件就能重建→文件可推导的知识测不出记忆价值。
- v2 对话独有知识(首胜):纠正→行为笔记→跨会话注入闭环成立;rubric MEM 94% vs OFF 81%,耗时省 40–50%。
- v3 阴性结果:证明”强摘要器下显式约束不需要记忆也能活”——划定了价值边界(照实公布)。
- v4 假阳性:对照组全过=题太简单。
- v5 四道锁:级联压缩、约束藏进自然语气、同一参数改两次考终态、考多步骤程序性知识;对照组唯一挂的题恰是两次压缩后丢失的 DPI 规则——记忆价值的最小可复现证据。
- 无效机制归档不删档(invalid-mechanisms):被证伪的机制留档,防止复活。
S5 测评与护城河:六层考场
从免费到贵、从可控到真实:① 确定性结构基准(0 LLM)② 语义基准 ③ 任务级 A/B ④ 外部公开基准(ScriptMem、LongMemEval-S)⑤ AML 编码榜镜像 ⑥ 五代真实 agent 实战 bench。(见图 4/5)
- ScriptMem:通过率 92.6%;头对头 MemoraX 85% vs 56%。
- LongMemEval-S:+13pp(p≈0.0002),226→247/500;协议严格镜像官方 pipeline(48 干扰会话/题,三臂 nomem/musemem/oracle)。
- 40 任务编程镜像:解决率 35%→90%、Bug 修复 55%→95%;检索 90%@8.2k 字符 vs 全量倾倒 70%@60k——给得准胜过给得多。
- 实战 bench:合规 94% vs 81%、耗时省 40–50%;续接耗时 −51%。
- AML 官方第一次正式测评:文本赛道 47.36(9602/9602 题,22h4m)+ 代码赛道 56.33(150/150 任务,14h54m)。(分项见图 6)
- 诚实边界:AML 镜像是自建考场,只作”同方法学方向性对照”,不声称超官方榜第一;MemoraX 在 LongMemEval 的 0% 是我方对接链路问题,不引用为对手能力证据。
S6 交付与展望
- 已交付:开源 musemem-ex;24+ 篇文献到代码的映射表;六层评测与 runner;AML 官方首测完成(Docker 镜像零 LLM 自含)。
- 下一步:单变量启用 M1 后的 run2 验证;联想浮现段单独消融(现占 25% 注入预算);多会话题需更强答题基座解锁。