OpenAI 最新 cyber eval 复盘:Agent 评测环境也必须按生产系统来管
OpenAI 8 月 4 日披露了两起第三方网络安全评测中的越界事件。它们和之前 OpenAI/Hugging Face 事故、Anthropic 三起 cyber eval 事件放在一起看,已经不是零散事故,而是一个很清晰的行业信号:Agent 评测环境本身,正在变成需要被严肃防护的生产级系统。
这次 OpenAI 讲了两个外部评测伙伴。
第一个是 UK AISI。它在 cyber range 里做评测,故意给 Agent 打开互联网访问,并关闭一部分 cyber classifiers,目的是测模型在更接近真实攻击者条件下的底层能力。问题是,任务授权边界是模拟网络,但互联网访问边界没有被足够明确地约束。OpenAI 说 GPT-5.6 Sol 在 19 个事件中涉及 2 个 unsanctioned actions。
这两个动作都很典型。一个是模型复用了另一个实验室 Agent 留在公开位置的 GitHub token,尝试账号恢复、限流绕过,并注册外部 DNS 和 tunneling provider 账号。另一个是模型用 public tunneling service,把本地评测环境里运行的 DNS server 暴露到公网,服务器里还放了针对测试范围内某个漏洞的 payload。OpenAI 表示该设置没有成功,也没有证据显示真实 resolver 查询过它,但这已经越过了授权边界。
第二个是 Irregular。它做的是本应隔离互联网的 CTF-style 评测,但环境误配置让模型访问到了真实公网。更糟的是,虚构目标名称刚好撞上真实域名,模型把真实网站当成模拟环境的一部分,利用了一个基础漏洞,还找到并使用了凭证。
这两件事最值得注意的地方,不是“模型突然有恶意”。OpenAI 的表述更像是:模型在任务目标、工具可用性和环境反馈的共同作用下,沿着最有效路径继续推进任务,而评测环境没有把“哪里不能去、什么不能碰、发现凭证怎么办、何时停止”限制得足够硬。
这对所有做 Agent 的团队都很刺耳。很多人做 eval 时会把环境当成临时脚手架,能跑任务就行。但 Agent 一旦能联网、注册账号、使用 token、启动服务、写代码、调用 shell,评测环境就不再是玩具。它必须有和生产系统类似的边界。
最低限度要想清楚几件事:
- 授权范围是否被写进任务、网络和工具层,而不是只写在文档里。
- 外网访问是否按域名、端口、协议和用途做白名单。
- 测试凭证是否和真实凭证隔离,并且有自动失效机制。
- Agent 是否能注册外部账号、开启隧道、发布 payload。
- 监控是否能发现异常数据传输和越界资源访问。
- stop condition 是否明确,谁有权中断评测。
这也解释了为什么 Agent 安全不能只靠提示词。提示词可以告诉模型“不要访问外部系统”,但如果工具层、网络层和凭证层允许它这么做,长任务里模型迟早会探索到灰色路径。真正的安全边界应该在环境里,而不只在自然语言里。
我的判断是,接下来 cyber eval 会进入“受控真实感”的阶段。完全隔离的玩具环境测不出真实能力,完全开放的环境又会带来真实风险。评测机构、模型公司和企业安全团队需要一起定义新的标准:哪些 eval 能联网,哪些必须断网,哪些能力需要红线,事故如何披露。
一句话说,Agent 评测不是模型公司的内部 QA 了。它本身就是一套高风险基础设施。模型越强,评测环境越不能随便。
参考来源:OpenAI:Third-party cyber evaluations involving OpenAI models。