产品评测
衡量上下文带来的改变。
LoCoMo 衡量 PowerContext 能否从长期对话中找回正确依据;SWE-bench Pro 衡量项目上下文能否帮助 Codex 解决更多代码仓库问题。
查看两项评测 ↓LoCoMo 准确率与搜索延迟1,540 道计分题
| 系统 | 准确率 | 搜索 p95 |
|---|---|---|
| PowerContext | 90.78% | 1.38 秒 |
| PowerMem | 87.79% | 1.44 秒 |
| 完整上下文 | 52.9% | 17.12 秒 |
LoCoMo:找回正确上下文
LoCoMo 根据跨 Session 的长对话提问。PowerContext 需要先找到相关对话依据,再生成答案。本次结果覆盖类别 1 至 4,共 1,540 道计分题。
问题构成共 1,540 道
单跳回忆841
时间推理321
多跳推理282
开放域问答96
PowerContext 结果类别 1 至 4
90.78% 问答准确率
PowerContext 答对 1,540 道题中的 1,398 道,比完整上下文方案高 37.88 个百分点。搜索 p95 为 1.38 秒,单题回答约使用 1.65k Token。
SWE-bench Pro:把上下文转化为可用补丁
为了衡量 PowerContext 对结果的影响,我们用同一套 Codex 配置在 public v2 的 731 个任务上完成两次运行。两组仅改变是否启用 PowerContext。
SWE-bench Pro 配对运行通过基准测试即计为解决
PowerContext OFF602 / 731 · 82.35%
PowerContext ON634 / 731 · 86.73%
这是一组固定任务集上的配对运行,不是 SWE-bench Pro 官方提交。Agent 运行存在随机性,因此分数只描述这两次运行。
与公开结果对照
LoCoMo 结果采用的 Reader、Judge 与答案匹配规则并不统一。SWE-bench Pro 数据来自官方 Public 榜单,因此两组榜单需要按各自口径解读。
数据核验于 2026 年 8 月 31 日
15 个系统 · 全部 1,540 道计分题
- 1Zep供应商实测94.70%
- 2EverMemOS第三方实测94.50%
- 3XMDB供应商实测93.20%
- 4TrueMemory Pro开放评测工具93.00%
- 5Mem0供应商实测92.50%
- 6PowerContext项目实测90.78%
- 7Honcho供应商实测89.90%
- 8Dakera可复现供应商实测88.20%
- 9PowerMem项目实测87.79%
- 10Memvid开放评测工具85.65%
- 11Genesys认证供应商实测85.55%
- 12Engram第三方实测84.50%
- 13MemHQ开放评测工具83.20%
- 14Logica Mind开放评测工具72.50%
- 15Supermemory第三方实测65.40%
评测方法与来源
两项评测的方法依据与复现资源。
LoCoMo
SWE-bench Pro
任务集与评测规范scaleapi/SWE-bench_Pro-os
把 PowerContext 接入工作流
可以从受支持的 Agent 开始,也可以通过 HTTP API 接入自己的应用。仓库包含运行时、集成和评测工具。