SWE-bench Verified · 40 题 · 被测 bench-openai-xiaomi-mimo-v2-5-pro · Judge claude-opus-4-8
共享会话下上下文逐题累积:flowctx:off 无压缩,prompt tokens 从 ~49k 单调涨到 ~374k;flowctx:on 折叠后被压回、稳定在 ~100–170k。off 隔离会话每题独立、无累积,~45k 作对照。横轴 = 40 题(已做移动平滑)。
每题的点 = 该题跑完后的 prompt tokens 值(非起始值);共享会话下它反映到该题为止累积的上下文规模。第 1 题起点相近(off共享 49k / on共享 52k / off隔离 48k)是因为都才跑完首题、尚未累积。数据源:off_shared 20260708T125312Z、on_shared run#2 20260710T170648Z、off_isolated 20260708T081538Z 的逐题 run.json(agentMeta.promptTokens)。平滑:5 点移动平均,端点缩窗。
flowctx 开启后,原始 transcript 越过 100k 门控即触发折叠(leaf 叶汇总 / condense 上卷 d1)。竖线顶=折叠前 raw、底=折叠后入模;面积线=逐 turn 组装后入模 est(被压回门控内)。展示 on 共享 run #2(20260710T170648Z)。
on = 两次共享 run 的平均;节省对比基准 = off 共享会话(同为累积上下文口径)。解决率统一用 /40 口径。
KV Cache 命中率 = usage.cacheRead / (cacheRead + input) —— 一题内所有 LLM 调用的加权平均命中率(越高=越多 prompt 命中缓存、少走全价 input)。off 共享与 on 均在 ~94–96% 高位,flowctx 折叠重写摘要节点会略微降低命中率(改写内容需重算),但代价极小。总 Token = usage.total 每题累计。解决率为 /40 口径(分子=判定 resolved 的题数,分母固定 40)。