一、v5 vs v4.5-Pro:6 项指标全面提升
在唯一变量为检索算法的前提下,v5 通过复合线索评分 + 实体索引实现全面超越:
nDCG@10:0.233 → 0.333,提升 +43%
Recall@10:0.327 → 0.395,提升 +21%
HitRate@10:0.359 → 0.449,提升 +25%
F1@10:0.175 → 0.218,提升 +25%
MAP@10:0.200 → 0.293,提升 +47%
Fact nDCG:0.363 → 0.519,提升 +43%(实体索引 extractEntities 直接驱动)
体积仍控制在 427KB,零外部依赖,纯本地运行,零 API Key。在这里插入图片描述

二、6 系统横评:nDCG@10 综合排名与延迟
测试条件:80 条查询、topK=10、CLI 冷启动、Ubuntu 24.04。
nDCG@10 排名:
BM25 (baseline) 0.930 > MemPalace Evolve 0.537 > Mem0/ChromaDB 0.495 > AgentMemory 0.412 > Mnemosyne v5 0.333 > Mnemosyne v4.5-Pro 0.233
P50 Latency (ms):
BM25 3ms < v4.5-Pro 42ms < v5 55ms ≈ AgentMemory 56ms << Mem0/MemPalace ~815ms
v5 在零依赖组中召回率最高;与 embedding 系统相比,nDCG@10 低约 33%,但延迟仅为 Mem0/MemPalace 的 1/15,且体积小两个数量级。差距主要来自同义改写、隐含推理等深度语义场景,这是 TF-IDF 的固有天花板。在这里插入图片描述

三、Fact 检索专项:实体精确匹配能力
条事实类查询,测试实体精确匹配能力:
MemPalace Evolve 0.851 > Mem0/ChromaDB 0.781 > Mnemosyne v5 0.519 (+43% vs v4.5-Pro 0.363) > AgentMemory 0.420 > Mnemosyne v4.5-Pro 0.363
v5 的实体索引(extractEntities)让 Fact nDCG 从 0.363 跃升至 0.519,在零依赖方案中首次接近 embedding 系统的半数水平。在这里插入图片描述

四、适用场景与不适用场景(决策指南)
✅ 推荐使用 v5 的场景:离线 Agent / 断网环境、隐私敏感应用(医疗/政务/金融)、边缘设备(树莓派/IoT)、对依赖体积有硬性约束、快速原型验证(无需配置向量数据库或申请 API Key)。
❌ 不推荐使用 v5 的场景:需要深度语义理解的云端 RAG 系统、大规模知识库(>10 万记忆块)、多语言混合场景(当前元认知检测仅覆盖中英文)、需要实时协同记忆的分布式系统。
五、3 行代码集成示例
from mnemosyne import MemoryEngine
mem = MemoryEngine.from_config(“config.yaml”)
mem.add(user_id=“u1”, content=“我喜欢手冲咖啡,尤其是耶加雪菲”)
results = mem.search(user_id=“u1”, query=“咖啡偏好”, top_k=10)
六、当前开源内容与独立验证方式
当前 GitHub 仓库已开源核心引擎源码、完整基准报告(docs/BENCHMARK-REPORT.md,含上述全部图表原始数据与测试参数)、评估数据集来源标注(LoCoMo / Memory-Native Eval 链接)。完整 reproduce.sh 脚本正在整理中,如需独立验证请参考报告中的数据集链接与测试环境参数自行搭建。

不是完美方案,但在零依赖赛道里是目前工程完成度较高的实现。欢迎在 issue 区提交你的验证结果或使用反馈。
🔗 GitHub:https://github.com/ElonAug7/openclaw-mnemosyne-memory-engine
📄 完整 Benchmark:见仓库 docs/BENCHMARK-REPORT.md

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐