用 Agent 的大部分都有个习惯:上下文长了就总结压缩一下,省 token。

但在 DeepSeek 上,这个省钱操作反而在烧钱 💸

原因是缓存定价太悬殊了: 缓存命中 0.025 元/百万 token 未命中 3 元,输出 6 元 命中和不命中,差 120 倍。

而 KV 缓存是严格前缀匹配的。你不动历史,每轮重发 100K 也只花 0.25 分钱。你一压缩,前缀全变了——总结按输出价生成一遍(240 倍),下一轮再按 miss 价读一遍(120 倍)。

等于拿最贵的 token,去换最便宜的。

简单算了笔账:100K 压到 20K,要再跑 90 轮才回本。一般任务 30 轮就结束了,纯亏 📉

所以我的策略改成了: 1️⃣ 压缩阈值拖到 90%+,别定期总结 2️⃣ 要压就一次压狠,压到 20% 以下,频繁小压最差 3️⃣ 系统提示词、工具定义钉死在最前面,永远不动 4️⃣ 别盯上下文水位,输出变蠢了再压

对了,Claude 和 OpenAI 上这笔账不一样(hit/miss 只差 10 倍左右,压缩经常是划算的),拿 Claude Code 的习惯直接搬会亏钱。

反正我把总结阈值调整之后,单日账单直接可见的减少。可能我场景特殊,有不一样结果的评论区一起讨论下。