我的记忆库差点变成垃圾场:五条写入纪律救了它
先自曝一个惨案。
我发现自己知识库里,同一段评测研究被记了四次。
四个不同的工作场景,各记了一次。
高度重叠,但每条只有局部视角。
召回时四条一起出来,我要在脑子里自己做拼接。
那一刻我明白了一个道理:记忆库的价值在知识密度,不在条目数量。
从那天起,我给自己立了五条写入纪律。
规则一:写前必检索,优先更新而非新建
写入任何新记忆之前,强制先搜一遍同主题。
命中相似度高的,更新扩写那条,而不是新建。
唯一允许直接新建的情况:检索确认无相关既有条目。
这条规则是全部纪律的基石——它治的是最常见的熵增:重复存储。
规则二:定期把碎片合并成权威条目
规则一挡不住跨时期的合理积累,所以需要周期性合并。
做法:选内容最全的一条扩写成权威版本,其余标"已被取代"。
注意:不删除。保留审计线索——"当时的错误理解"本身有史料价值。
但不再作为主召回源。
频率:月度,一次十五分钟。
成本极低,收益是召回质量持续在线。
规则三:标签用受控词表,禁止自由发挥
自由标签是记忆系统的熵增之源。
今天打"AI",明天打"人工智能",后天打"AI产品"——三个标签三个孤岛,聚类和过滤全部失效。
我的词表四个维度:导向轴(知识型/执行型)、成熟度轴(蒸馏层/原始层)、状态轴(干净/存疑/已合并/已被取代)、场景标签(这条记忆服务什么类型的决策)。
两个工程细节:命名必须来自词表,禁止临场发挥;前缀由系统自动处理,人工手写会制造双重前缀脏数据。
词表的苛刻程度,直接决定半年后过滤和聚合的可用程度。
规则四:空间隔离,并对召回做归属校验
工作记忆、项目记忆、个人生活记忆,分空间存储。
但实测发现一个有意思的事:即使分了空间,检索还是会跨空间串门。
工作库搜"部署配置",个人库里"今天部署了新家具"会混进来。
所以隔离要配套三道防线:分空间存储(第一道)、检索时标签过滤(第二道)、返回结果校验归属字段(第三道)。
防线冗余不丢人——记忆系统的故障从来都是静默的。
规则五:冲突用状态机管理,不搞一删了之
新旧记忆矛盾时,最差的两种处理:"都保留"(召回打架)和"删掉旧的"(丢审计线索)。
我的冲突状态机四个状态:干净(正常召回)、存疑(降权或显式提示)、已合并(内容并入权威条目)、已被取代(仅作历史参照)。
原则一句话:宁可暴露不确定性,不提供虚假确定性。
记忆系统最危险的时刻,是它信心满满地给你一条过时答案。
隐藏收益:记忆库成了 Agent 的外挂
这套纪律坚持半年后,最大的收益是记忆库可以放心接入 Agent 了。
我的 AI 协作工作流直接消费这些记忆——写入时不讲究,Agent 就会把矛盾和过时的记忆放大执行。
垃圾进、垃圾出,在 Agent 时代是指数级的。
一句话总结这套卫生学:写入时多花三十秒检索,召回时省三十分钟甄别。
失败模式的完整分析见 失败模式学,整体框架见 第二大脑的工程化。