返回技术博客
Gemini 3.6 Flash:Agent 时代,便宜和快可能比最强更重要

Gemini 3.6 Flash:Agent 时代,便宜和快可能比最强更重要

Gemini 3.6 Flash:Agent 时代,便宜和快可能比最强更重要

Google 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber,表面看是一组模型更新,背后其实是在回答 Agent 时代的核心问题:如果一次任务要调用模型几十次甚至几百次,最强模型未必是默认答案,便宜、快、稳定可能更重要。

Agent 和普通聊天最大的差异,是调用次数。用户问 ChatBot 一个问题,模型回答一次就结束;Agent 要拆任务、读文件、查资料、调用工具、反思、验证、重试。一次看似简单的工作流,可能消耗大量 token 和多轮模型调用。这个时候,模型单次能力当然重要,但成本和延迟会迅速变成产品体验的上限。

Gemini 3.6 Flash 强调 token efficiency、lower latency 和 agent workflows,这正好打中这个问题。对于多数 Agent 任务,系统不需要每一步都调用最贵的旗舰模型。读日志、分类 issue、提取字段、生成候选步骤、做初步验证,这些可以交给更快更便宜的模型;只有复杂推理、最终决策、风险动作,才需要更强模型兜底。

3.5 Flash-Lite 的定位更直接:高吞吐、低成本、快速输出。Google 提到它面向大规模和延迟敏感场景。这个方向会让很多 AI 产品重新设计架构:不是“一个最强模型打天下”,而是多模型路由。轻任务走 Flash-Lite,中等任务走 Flash,复杂任务再升级到 Pro 或更强模型。

3.5 Flash Cyber 也很值得注意。它把模型能力和安全场景绑定在一起,服务于漏洞发现、修复和防御工作流。安全领域很适合专业化模型:任务格式相对清晰、验证路径明确、自动化收益高,但误报和越权风险也高。专门的 cyber 模型,未来可能会成为企业安全 Agent 的基础组件。

这件事对开发者的启发很实际。做 Agent 产品时,不要只问“哪个模型最聪明”,还要问:哪些步骤真的需要最强模型?哪些步骤可以批量跑?哪些步骤可以缓存?哪些步骤对延迟敏感?哪些步骤需要安全审计?模型选择会从一个简单配置,变成成本、速度、质量和风险之间的路由策略。

我的判断是,Flash 路线会越来越重要。Agent 越普及,模型调用就越像云计算资源:不是只买最高规格机器,而是把任务拆给合适的实例类型。未来优秀的 Agent 平台,可能不是永远调用最强模型,而是能聪明地决定什么时候该省、什么时候该快、什么时候该用最强能力。

参考来源:Google DeepMind / Google 官方发布