ai-memory recall-eval实战:快速搭建AI记忆召回基准测试的完整指南 📅 发布时间:2026/9/16 12:24:04 👁 浏览次数: ai-memory recall-eval实战快速搭建AI记忆召回基准测试的完整指南【免费下载链接】ai-memorySolution for long term memory for agent coding CLIs and to facilitate handoff between different agent vendors项目地址: https://gitcode.com/GitHub_Trending/ai/ai-memoryai-memory 是面向 AI agent CLI 编程助手的长期记忆方案而 recall-eval 就是它内置的召回基准测试工具链只需 3 步你就能用自己的真实会话数据重放、跑通 LongMemEval-S 检索基准、得到可复现的 hitk / recallk 基线数字让AI 记忆到底记不记得住这件事从感觉变成可量化的工程事实。一、为什么 AI 记忆需要一个召回基准测试记忆系统的核心承诺是之后能找回来。但如何证明靠人肉抽查吗ai-memory 的答案是双层测试体系层级位置作用CI 迷你基准recall_eval.rs10 个语料页 10 条探针查询跑在 CI 里守住召回底线端到端基准evals/ 的retrieval子命令用 LongMemEval-S 公开数据集500 题压测真实的ai-memory serve服务前者保证改坏了会立刻报警后者回答我的记忆系统在标准数据集上到底排第几。二、准备工作克隆仓库并构建被测服务器⚠️ 前提已安装 Rust 工具链仓库自带 rust-toolchain.tomlgit clone https://gitcode.com/GitHub_Trending/ai/ai-memory cd ai-memory cargo build --release -p ai-memory-cli # 构建被测的 ai-memory 服务器retrieval基准不做任何 mock它会启动一个真实的ai-memory serve子进程运行在全新临时数据目录上按生产 hook 节奏重放会话数据再通过 MCPmemory_query工具查询并打分——测的是你实际部署的那套系统而不是一个理想化的检索器。三、三步跑通你的第一次 recall-eval 基准第 1 步冒烟测试10 题快速验证cargo run -p ai-memory-eval -- retrieval --sample 10先跑 10 题确认环境没问题再上全量能省下大量等待时间。第 2 步完整 500 题基准cargo run --release -p ai-memory-eval -- retrieval --fetch--fetch会自动下载 LongMemEval-S 数据集约 278 MB到evals/datasets/并校验 sha256——数据集上游一旦漂移会大声报错保证数字可复现。想对比 2.0 默认的本地嵌入模式进程内 all-MiniLM无需 API Key、零外发cargo run --release -p ai-memory-eval -- retrieval --fetch --embeddings local第 3 步读报告、发布基线报告输出到evals/runs/时间戳-retrieval/包含report.json和report.md自带完整溯源git commit、数据集 sha256、硬件信息、逐题得分。发布基线时把 markdown 复制进 docs/benchmarks/ 即可。官方基线一览LongMemEval-S2026-09-01 实测模式整体 hit5报告本地嵌入2.0 默认0.823longmemeval-s-2026-09-01-local.md停用词过滤 FTS0.668longmemeval-s-2026-09-01-fts.mdzero-llm2.0 之前0.617longmemeval-s-2026-09-01.md2.0 检索工作把整体 hit5 从0.617 提升到 0.82320.6 分且每一步改进FTS 停用词过滤 5.1 分、本地嵌入 掩码均值池化 6.6 分都是先在这个基准上测出数字、再合入的。四、读懂报告hitk 与 recallk 两大核心指标指标定义特点hitk证据会话任一出现在 top k 即为 1多数记忆系统对外发布的 Recallkrecallk被找到的证据会话比例对跨多会话的问题更严格几个保真设计值得注意30 道弃权题abstention无证据会话被排除并单独报告无法归属到会话的页面永远不得分杜绝碰运气捕获是生产形态摘录受 2 KB 隐私边界约束埋得太深的证据真的够不着——这是被测系统本身的代价不是基准缺陷部分运行不可发布任何一题失败整份报告不生成宁缺毋假。五、构建你自己的召回基准语料、探针与底线CI 层的小基准是绝佳模板。recall_eval.rs 的骨架就三样东西语料CORPUS10 个手工编写的 wiki 页会话笔记、概念页、决策记录每页(路径, 正文)探针PROBES10 条(自由文本查询, 期望命中的页面路径)底线RECALL_FLOOR 0.70纯 FTS5 与混合检索FTS5 实体 图谱 RRF 向量两条路径的 recall5 都必须 ≥ 0.70且混合路径不允许劣于纯 FTS5。每个探针跑 top-5 检索、看期望路径是否在结果里命中数 / 探针总数即召回率。数值每次都会打到 stderr——即使 CI 绿灯你也能在日志里观察数字漂移。它还钉住了三个兜底路径的专项测试图谱邻居扩展页面正文不含种子词但被另一页[[链接]]指向 → 混合检索必须找回实体流正文和链接都没有探针词唯一桥梁是 frontmatter 的entities:列表 → 必须找回原始观察回退wiki 完全漏掉的细节直接落回原始观察raw observation搜索。想换成真实语义信号设置AI_MEMORY_EMBEDDING_PROVIDER环境变量并接入真实嵌入模型即可——测试自带的合成嵌入器是确定性的但不懂语义所以目前 hybrid ≈ FTS5这正是框架先行的设计意图。六、实战避坑官方代码注释里的真话语料里避开连字符FTS5 查询解析器把裸-当作 NOT 运算符分词器又把-留在词内两者叠加让带连字符的词成了自由文本搜索的地雷。基准语料因此刻意拼写完整如single writer而非single-writer回归门禁思维docs/benchmarks/ 明确规定——任何改动如果显著拉低某个切片category的数字那是要修复的回归不是值得记录的观察可比性声明其他系统在同一数据集上的发布数字如 agentmemory 0.967 R5与hit5可比但本项目的管线额外承担了生产级捕获的隐私边界成本读数时应结合模式mode一起看。七、基准跑完后用 Web 视图审计记忆基准只回答找没找回来Web 浏览器回答落下来的是什么。启动ai-memory serve后打开 Web 界面可以逐页检查记忆页面fact / gotcha / decision的归属、层级与最近活动——它和 MCP 工具memory_query、memory_recent、memory_explore一样都是审计召回基准测试落盘结果的好帮手。总结你的召回基准测试清单 ✅cargo build --release -p ai-memory-cli构建被测服务器--sample 10冒烟 →--fetch全量 500 题报告落盘evals/runs/核对 commit、数据集 sha、硬件好数字复制进docs/benchmarks/成为新的回归基线参照 recall_eval.rs 的语料探针底线结构为自己的业务数据搭一个 CI 级小基准有了这套 recall-eval 基准每次改提示词、换模型、调检索权重你都能一句话回答这一版让 AI 的记忆变好了还是变差了【免费下载链接】ai-memorySolution for long term memory for agent coding CLIs and to facilitate handoff between different agent vendors项目地址: https://gitcode.com/GitHub_Trending/ai/ai-memory创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考