高斯可 • AI Product Manager 认知科学 × 产品 × 组织
XI'AN & REMOTE | --:-- CST krka_work@163.com
Case Study

2026.08 – 2026.09 | 独立研究 / 独立开发

musemem · 认知科学驱动的 Agent 记忆系统

让 Agent 在上下文压缩后仍记得线索,并且真的变强——编码、巩固、检索、遗忘全生命周期

已开源 · github.com/3650krka/musemem-ex · 已完成 AML 官方第一次正式测评 | GitHub ↗

92.6%
ScriptMem 通过率
头对头 vs 业界第一 MemoraX:85% vs 56%
+13pp
LongMemEval-S 提升
p≈0.0002;226→247 / 500
省40–50%
真实编码耗时
实战 bench:合规率 MEM 94% vs OFF 81%,耗时省约一半
-51%
真实会话续接耗时
有记忆 vs 无记忆
47.36 / 56.33
AML 官方首测(文本/代码)
文本 9602/9602 题·22h4m;代码 150/150 任务·14h54m
35%→90%
40 任务编程镜像解决率
无记忆→有记忆;Bug 修复 55%→95%
Diagrams
详细架构:双 scope + L0/L1/L2 + 检索 + 衰减 + 注入 + fail-closed
详细架构:双 scope + L0/L1/L2 + 检索 + 衰减 + 注入 + fail-closed
记忆生命周期:编码→巩固→检索→遗忘
记忆生命周期:编码→巩固→检索→遗忘
检索:BM25 与语义嵌入的 max-blend 混合排序
检索:BM25 与语义嵌入的 max-blend 混合排序
六层评测体系:从免费到贵、从可控到真实
六层评测体系:从免费到贵、从可控到真实
实战 bench:MEM vs OFF 合规率与耗时(五代演化)
实战 bench:MEM vs OFF 合规率与耗时(五代演化)
AML 官方首测:文本/代码两赛道分项
AML 官方首测:文本/代码两赛道分项
Media
Deep Read

首屏

一句话:Agent 的记忆中间件——把人类记忆的编码、巩固、检索、遗忘做成工程机制,让 Agent 压缩上下文后仍记得线索、且实战真的变强。

六个数:ScriptMem 92.6%(头对头 85 vs 56)| LongMemEval-S +13pp | 真实编码耗时省 40–50% | 续接 −51% | AML 首测 文本47.36/代码56.33 | 40 任务镜像 35%→90%

主视觉:图 1 详细架构图

S0 产品形态:一个没有界面、但每轮都在工作的中间件

musemem 挂在 Pi agent 上,没有 UI,却在每次对话里做四件事:

  • 编码:每轮结束(turn_end)把情景证据以 append-only JSONL 写入(内容哈希当 ID,天然防重复),轮次+1、证据衰减。
  • 巩固:借宿主的上下文压缩事件触发,每次压缩恰好 1 次廉价 LLM 调用,把证据蒸馏成 L1 语义事实卡;每张卡强制带 sourceRefs 指回原始证据,对不上就拒收——防 AI 自己编记忆。同类 todo 成功≥3/失败≥2 自动成 L2 程序性卡,零 LLM。
  • 检索与注入:每轮开始前(before_agent_start)按相关性+强度排序、在字符预算内注入提示词;BM25 与语义嵌入 max-blend 混合(谁强听谁的,不做加权平均)。
  • 遗忘与治理:衰减按轮次钟(隔几轮)而非挂钟;Dream 离线只做治理标签(同义合并、冷记忆归档休眠),归档≠删除;memory get <id> 随时取回全文——压缩的是呈现,不是存储。

双 scope:SESSION 情景证据(会话隔离、会衰减)+ PROJECT 笔记(跨会话、永不衰减)。首因目标被确定性钉死(强度 0.95、独立注入、永不压缩)。

S1 需求与洞察

HMW:如何让 Agent 在持续对话与上下文压缩后,仍记住信息线索并切实提高实战效果?

  • 全量上下文:体积无界、成本爆炸。
  • 摘要压缩:压掉细节、无法溯源、“摘要的摘要”层层流失。
  • 简单向量记忆:只存不巩固、不会遗忘、无溯源,AI 编的记忆照单全收。

S2 市场与现状

现有方案失效原因
全量上下文 / 长窗口体积无界、成本与延迟随历史线性增长
摘要式压缩细节丢失、不可溯源、级联压缩后信息层层流失
简单向量库记忆只存不巩固、无遗忘机制、无溯源,幻觉记忆入库
业界记忆产品(如 MemoraX)同场头对头 ScriptMem 56%(我方 85%);路线相近但检索与治理弱

S3 方案与规划:把认知科学转译成工程机制

认知科学依据工程落点
ACT-R 激活衰减轮次钟衰减(事件密度驱动,非挂钟)
Bjork 双强度(RS/SS)检索打分同时用”想不想得起”与”存得深不深”
系统巩固(Squire & Alvarez)L0 证据→L1 事实→L2 程序(hippocampal→neocortical)
互补学习系统(McClelland)快学习证据层 + 慢学习事实/程序层
编码特异性(Tulving & Thomson)时间元数据随记录索引,作检索线索
扩散激活联想涌现(注入预算内占 25%,待单独消融)

关键工程决定:

  • max-blend 混合检索:平均会把”意思对但关键词没撞上”的记录稀释;取 max 让两条腿各自发挥。
  • fail-closed:嵌入没了退纯关键词;LLM 失败静默降级纯确定性档;熔断 3 次自动停用——任何部件坏了就降级,绝不硬撑。
  • 溯源拒收:L1 卡无 sourceRefs 或指不回证据即拒收。
  • 有界注入:激活阈值管相关性 + 8k 字符硬预算管总量(对照”全量倾倒”体积无界)。

(详细架构见图 1;生命周期见图 2;检索见图 3。)

S4 开发与迭代:bench 驱动开发

  • 每个基准暴露的真缺陷都修复并加回归测试(6+ 例);所有 runner 断点续跑;声明噪音带:±2.5pp 以内的”提升”不承认。
  • 五代实战 bench 演化(每代由上一代教训驱动):
    • v1 探索者:MEM 93% vs OFF 86%,差距太小——OFF 现场翻文件就能重建→文件可推导的知识测不出记忆价值。
    • v2 对话独有知识(首胜):纠正→行为笔记→跨会话注入闭环成立;rubric MEM 94% vs OFF 81%,耗时省 40–50%。
    • v3 阴性结果:证明”强摘要器下显式约束不需要记忆也能活”——划定了价值边界(照实公布)。
    • v4 假阳性:对照组全过=题太简单。
    • v5 四道锁:级联压缩、约束藏进自然语气、同一参数改两次考终态、考多步骤程序性知识;对照组唯一挂的题恰是两次压缩后丢失的 DPI 规则——记忆价值的最小可复现证据。
  • 无效机制归档不删档(invalid-mechanisms):被证伪的机制留档,防止复活。

S5 测评与护城河:六层考场

从免费到贵、从可控到真实:① 确定性结构基准(0 LLM)② 语义基准 ③ 任务级 A/B ④ 外部公开基准(ScriptMem、LongMemEval-S)⑤ AML 编码榜镜像 ⑥ 五代真实 agent 实战 bench。(见图 4/5)

  • ScriptMem:通过率 92.6%;头对头 MemoraX 85% vs 56%。
  • LongMemEval-S:+13pp(p≈0.0002),226→247/500;协议严格镜像官方 pipeline(48 干扰会话/题,三臂 nomem/musemem/oracle)。
  • 40 任务编程镜像:解决率 35%→90%、Bug 修复 55%→95%;检索 90%@8.2k 字符 vs 全量倾倒 70%@60k——给得准胜过给得多。
  • 实战 bench:合规 94% vs 81%、耗时省 40–50%;续接耗时 −51%。
  • AML 官方第一次正式测评:文本赛道 47.36(9602/9602 题,22h4m)+ 代码赛道 56.33(150/150 任务,14h54m)。(分项见图 6)
  • 诚实边界:AML 镜像是自建考场,只作”同方法学方向性对照”,不声称超官方榜第一;MemoraX 在 LongMemEval 的 0% 是我方对接链路问题,不引用为对手能力证据。

S6 交付与展望

  • 已交付:开源 musemem-ex;24+ 篇文献到代码的映射表;六层评测与 runner;AML 官方首测完成(Docker 镜像零 LLM 自含)。
  • 下一步:单变量启用 M1 后的 run2 验证;联想浮现段单独消融(现占 25% 注入预算);多会话题需更强答题基座解锁。