成本问题
典型的 Coding Agent 会话消耗 token 的速度非常快:
按高端模型费率计算,每位开发者每小时 500–5,000。
智能模型选择
并非每个编码任务都需要最贵的模型。按任务匹配合适的档位:缓存策略
Coding Agent 非常适合缓存,因为它们不断重复相似的模式。Prompt Cache(提供方级别)
提供方级别的 Prompt Cache 通过 AI Sonar 自动生效。长系统提示——Coding Agent 每次都会包含——在提供方层被缓存:
由于 Coding Agent 每次调用都发送相同的系统提示 + 项目上下文,Prompt Cache 命中率通常为 70–90%。
组合节省示例
一个 50,000 输入 token 的请求(典型 Coding Agent 调用):Token 管理技巧
设置 max_tokens
防止生成失控:使用 Auto-Compact
大多数 Coding Agent 支持上下文压缩——总结旧对话轮次以减少 token 数量:- Claude Code:内置 auto-compact,在上下文达到限制时自动触发
- Cursor:自动上下文管理
- Codex CLI:使用
--max-context参数
避免上下文膨胀
- 只需要一个函数时不要粘贴整个文件
- 使用
.gitignore风格的模式排除无关文件 - 切换任务时清除对话历史