GPT-5.6 真正可怕的地方:它开始优化自己的推理基础设施
OpenAI 关于 GPT-5.6 frontier efficiency 的文章,比普通模型发布更值得写。它不是在讲“模型又强了多少”,而是在讲一个更底层的变化:GPT-5.6 Sol 已经开始参与优化 OpenAI 自己的推理基础设施。
这件事的核心不是炫技,而是经济学。模型需求增长比算力扩容更快,推理成本会成为每家 AI 公司的生命线。一个模型如果只是在 benchmark 上更强,但服务成本高得离谱,产品化就会被账单卡住。OpenAI 这篇文章直接把竞争焦点从能力拉到“每一美元能买到多少有效智能”。
OpenAI 披露的优化点很具体:生产流量负载均衡、模型 forward pass、GPU kernel、speculative decoding、KV cache、prompt caching,以及 Codex / ChatGPT Work 的 agentic harness。GPT-5.6 Sol 在 Codex 里帮助分析生产流量、发现负载不均、尝试路由策略,甚至改写和优化生产 kernel。
最值得注意的是两个数字。OpenAI 称 GPT-5.6 Sol 相关 kernel 与系统优化让 end-to-end serving cost 降低 20%;在 draft model / speculative decoding 上,token generation efficiency 提升超过 15%。这类改进单看可能不像模型能力突破那么性感,但它们会复利。成本下降意味着更高并发、更低价格、更长上下文、更复杂 Agent 工作流。
这也给“AI 优化 AI”一个很实际的版本。不是模型突然递归自我改进成科幻意义上的爆炸,而是模型帮工程师在具体系统里找瓶颈:哪里路由不均,哪里缓存没命中,哪里数据布局导致 GPU 空转,哪里 prompt 前缀不稳定影响缓存。
文章里另一个关键点是 agentic harness。OpenAI 说 Codex 一个用户任务可能包含多次模型请求、工具调用、文件读取、测试运行。每个小成本都会在循环里重复放大。所以他们通过 deferred discovery、防止工具输出吃满上下文、append-only 历史和稳定工具顺序来提升 prompt cache 命中。这说明 Agent 效率不是只靠便宜模型,而是靠整个工作流少做重复劳动。
对开发者来说,这篇文章的启发很强:如果你在做 AI 产品,成本优化不该等到最后。路由、缓存、上下文裁剪、工具输出限制、批处理、speculative decoding、模型分层,这些都是架构问题。Agent 越复杂,重复区域越多,节省一次就会被调用次数放大。
我的判断是,未来模型公司的竞争会分成两层:前台拼智能,后台拼效率。真正厉害的不是模型单次回答更强,而是能把推理、工具、缓存、内核和 Agent harness 统合成一个持续降本系统。GPT-5.6 这篇文章说明,OpenAI 已经开始把 AI 本身当成优化这套系统的工程师了。