http://www.youtube.com/watch?v=8ji5vURIllM
在这视频 Why harness is SO expensive.. 中,作者 Caleb Writes Code 详细分析了为什么 AI 代码 Agent(外壳/Harness)的使用成本远高于直接与 AI 模型对话。视频的主要核心内容总结如下:
1. 背景:模型变便宜,但开源与闭源竞争加剧
- 模型算力成本下降 [00:07]:两年前的 OpenAI O1 成本还较高,但到了 GPT-5.6 Soul,价格降低了 2~3 倍且性能大涨,满足了杰文斯悖论(Jevons Paradox,成本降低反而激发了更大规模的使用)。
- 开源模型的追赶 [00:41]:2025 到 2026 年间,开源权重模型(如 Kim K3、Qwen 3.8 Max、DeepSeek V4 等)迅速崛起,极大缩小了与闭源商用模型的差距。
2. 核心问题:模型(Model)vs. 外壳(Harness)
大部分普通用户使用的是薄外壳(Thin Harness)(如直接在网页端聊天),模型交互非常直接,成本极低 [01:05]。
而编程 AI 开发者使用的是厚外壳(Thick Harness)(如 Claude Code, Cursor, Open Code, Cline 等 Agent 系统),成本会呈数倍乃至数十倍地暴涨 [01:19]。
成本暴涨两大主因:
- 巨大的系统提示词(System Prompt / Overhead) [02:24]:
- 像 Claude Code 这种具备大量内置命令和功能的 Agent [02:50],每次发送请求时,外壳都会自动附带 8,000 到 30,000 个 Token 的系统提示词 [02:30]。
- 实际案例对比:同样一段“生成包含字母表的简单文件”的请求,在纯模型对话中只需 $0.01 [02:10],而在 Claude Code 中则跳涨到了 $0.37(相差约 30 倍)[02:17]。
不同 Harness 的系统提示词设计不同,成本差异很大:Claude Code(~$0.37)> Open Code(~$0.11)> Cline(~$0.07)> Pi(~$0.025)[03:20]。
多轮递归循环(Oscillation / Loops) [03:45]:
编程 Agent 不是“一问一答”的单轮对话,而是不断在模型与本地环境(Harness)之间来回交互(检查文件是否存在 ➔ 创建文件 ➔ 写入内容)[04:12]。
对于长达 10~20 分钟的复杂任务(如从零构建网站),交互轮次极多,且每一次交互都会重新携带庞大的系统提示词和上下文,导致 Token 消耗飞速累积 [04:46]。
3. 应对方案:Prompt Caching(提示词缓存)与基础设施经济学
- 利用 Prompt Caching 降本 [05:13]:推理提供商(如 Anthropic)通过在 GPU 显存中临时保存 KV 缓存,避免重复计算庞大的系统提示词,从而大幅节省长任务的 API 费用 [05:35]。
- 厂商的算力经济 [06:13]:对于 Anthropic 等提供商来说,如果能将上下文量化并高效装进 GPU(如 NVIDIA H100),提供短期/长期的缓存服务能带来极高的算力利用率和收益 [06:32]。
Top comments (0)