ARC-AGI-3 分数暴涨 3 倍:Benchmark 时代,Agent harness 也成了能力的一部分
OpenAI 7 月 29 日这篇 ARC-AGI-3 文章,表面是在解释一个 benchmark 分数,实际更像是在提醒整个行业:今天的 Agent 评测,已经很难只说是在测模型本体了。
事情很有代表性。GPT-5.6 Sol 在 ARC-AGI-3 官方 harness 里表现并不突出,OpenAI 起初也觉得困惑。因为这个模型在数学、游戏和编码任务上都很强,为什么到了 2D puzzle game 里就像突然变笨?深入看之后,问题不完全在模型,而在运行方式。
OpenAI 做了两个设置改动:保留 private reasoning,并启用 compaction。前者让模型每一步之后还能记得自己之前的思考,后者避免滚动截断把早期观察和行动直接丢掉。结果很夸张:GPT-5.6 Sol 在公开任务集上的成绩从 13.3% 提升到 38.3%,同时输出 token 减少 6 倍。
这个结论对所有看榜单的人都很重要。我们过去习惯把 benchmark 当作模型能力的客观仪表盘,但 Agent 场景里,harness 的影响越来越大。上下文怎么保留,工具怎么暴露,历史怎么压缩,reasoning 是否跨步骤延续,都会直接改变模型表现。
换句话说,Agent 不是“模型 + 一个简单循环”。它更像一套运行系统。模型是大脑,harness 是短期记忆、工作台、笔记本和操作规范。大脑再强,如果每走一步就被清空思路,表现也会被严重低估;反过来,一个好的 harness 能让模型在长任务里真正积累经验。
这也解释了为什么 Codex、Claude Code、LangGraph、Deep Agents、NOOA 这些工具都在强调状态、记忆、trace、compaction、middleware。它们不是周边功能,而是能力的一部分。未来比较 Agent,不能只问“底层模型是谁”,还要问“它运行在什么 harness 里”。
对开发者来说,实操启发很直接。做 Agent 评测时,不要只跑一次 API 调用;要明确是否保留推理状态、如何压缩长上下文、是否能复用中间结论、工具输出是否会污染上下文。否则你得到的可能不是模型真实边界,而是你自己 harness 的缺陷。
我的判断是,2026 年下半年会进入“harness-aware benchmark”阶段。排行榜仍然有价值,但每个分数背后都要追问运行配置。Agent 能力不再只由模型训练出来,也会被记忆策略、上下文工程和工具编排塑造出来。
参考来源:OpenAI ARC-AGI-3 文章。