产品评测

衡量上下文带来的改变。

LoCoMo 衡量 PowerContext 能否从长期对话中找回正确依据;SWE-bench Pro 衡量项目上下文能否帮助 Codex 解决更多代码仓库问题。

查看两项评测
LoCoMo 准确率与搜索延迟1,540 道计分题
系统准确率搜索 p95
PowerContext90.78%1.38
PowerMem87.79%1.44
完整上下文52.9%17.12

LoCoMo:找回正确上下文

LoCoMo 根据跨 Session 的长对话提问。PowerContext 需要先找到相关对话依据,再生成答案。本次结果覆盖类别 1 至 4,共 1,540 道计分题。

问题构成共 1,540 道
单跳回忆841
时间推理321
多跳推理282
开放域问答96
PowerContext 结果类别 1 至 4

90.78% 问答准确率

PowerContext 答对 1,540 道题中的 1,398 道,比完整上下文方案高 37.88 个百分点。搜索 p95 为 1.38 秒,单题回答约使用 1.65k Token。

SWE-bench Pro:把上下文转化为可用补丁

为了衡量 PowerContext 对结果的影响,我们用同一套 Codex 配置在 public v2 的 731 个任务上完成两次运行。两组仅改变是否启用 PowerContext。

SWE-bench Pro 配对运行通过基准测试即计为解决
PowerContext OFF602 / 731 · 82.35%
PowerContext ON634 / 731 · 86.73%
+4.38 个百分点 · 多解决 32 个任务

这是一组固定任务集上的配对运行,不是 SWE-bench Pro 官方提交。Agent 运行存在随机性,因此分数只描述这两次运行。

与公开结果对照

LoCoMo 结果采用的 Reader、Judge 与答案匹配规则并不统一。SWE-bench Pro 数据来自官方 Public 榜单,因此两组榜单需要按各自口径解读。

数据核验于 2026 年 8 月 31 日

15 个系统 · 全部 1,540 道计分题

  1. 1Zep供应商实测94.70%
  2. 2EverMemOS第三方实测94.50%
  3. 3XMDB供应商实测93.20%
  4. 4TrueMemory Pro开放评测工具93.00%
  5. 5Mem0供应商实测92.50%
  6. 6PowerContext项目实测90.78%
  7. 7Honcho供应商实测89.90%
  8. 8Dakera可复现供应商实测88.20%
  9. 9PowerMem项目实测87.79%
  10. 10Memvid开放评测工具85.65%
  11. 11Genesys认证供应商实测85.55%
  12. 12Engram第三方实测84.50%
  13. 13MemHQ开放评测工具83.20%
  14. 14Logica Mind开放评测工具72.50%
  15. 15Supermemory第三方实测65.40%

Reader、Judge 与答案匹配规则并不统一,因此不作为官方排名。

评测方法与来源

两项评测的方法依据与复现资源。

把 PowerContext 接入工作流

可以从受支持的 Agent 开始,也可以通过 HTTP API 接入自己的应用。仓库包含运行时、集成和评测工具。

打开 GitHub 仓库