昨夜,在 Alphabet 发布财报前一天,谷歌一口气推出了三款全新的 Gemini 模型,全部属于主打“快速、低成本”的 Flash 系列,重点聚焦于提升复杂智能体(agentic)工作流中的运行效率,并降低 token 消耗。其核心特性很明确:效率优先于绝对性能。
短短一周内,xAI 的 Grok 4.5、OpenAI 的多版本 GPT-5.6 以及 Moonshot AI 的
根据谷歌的说法,这一全新的 Flash 系列旨在通过更强的能力与更高的性价比,优化 AI 智能体的开发。该系列共包括三款模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 以及面向安全场景的 Gemini 3.5 Flash Cyber。
其中,Gemini 3.6 Flash 是其旗舰模型中的“主力款”,主打在质量与效率之间取得最佳平衡。谷歌表示,相比前代,其知识截止时间更新至 2026 年 3 月,在编程、知识型任务以及多模态推理能力上均有所提升,同时将平均输出 token 消耗降低了 17%。

同时,在部分使用场景中,Gemini 3.6 Flash 相比 3.5 Flash 最多可减少 65% 的输出 token。在后“token 精打细算”的时代,它确实在“省 token”方面有所表现,且这已经成为一个颇具意义的指标。通过减少中间推理步骤与工具调用,该模型显著压缩了多步骤 AI 工作流的整体运行成本。在基准表现上,Gemini 3.6 Flash 在代码修改准确率、机器学习研究、计算机操作、文档解析以及报告生成等任务中均有明显提升。包括 Heavia 和 Harvey 在内的企业客户表示,在视觉处理、图表分析和数据提取等多模态任务中,模型表现得到了显著增强。

关键的是,该模型的成本也更低,其输入价格为每百万 token 1.50 美元,输出价格从每百万 token 9 美元降至 7.5 美元。随着人们对 AI 使用成本的认知不断提高,这一点确实进一步增强了市场竞争力。但在性能对比层面,Gemini 3.6 Flash 并没有让人眼前一亮。
在大多数关键基准测试中,它似乎落后于 Anthropic 的 Claude Sonnet 5 以及 OpenAI 的 GPT-5.6;甚至在诸如智能体编程(agentic coding)等任务上,也开始被最新的 Grok 4.5 甩在后面。考虑到 Gemini 3.6 Flash 的价格并没有比竞争对手便宜太多,大致与 Grok 4.5 和 GPT-5.6 持平。因此,它要在这场模型大战中找到自己的定位,难度不小。

Gemini 3.5 Flash-Lite 是该系列中“最快、最具性价比”的模型,主要面向高吞吐的智能体搜索和大规模文档处理场景。该模型每秒可生成 350 个 token,和 3.6 Flash 一样,在延续前代性能的基础上进一步提升了整体效率。谷歌表示,Flash-Lite 在多个代理和编程基准测试中击败了旧款 3 Flash,包括 SWE-Bench Pro 和 OSWorld-Verified。与其直接前身 3.1 Flash-Lite 相比,其终端工作台 2.1 评分从 31% 提升至 54%。
该模型的价格也更低,其输入为每百万 token 0.30 美元、输出为每百万 token 2.50 美元,为高负载企业应用提供了更具性价比的解决方案。
可以看出,Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 两款模型背后押注的是同一个战略判断:大多数 AI 使用场景,并不需要“前沿级大脑”,而是一个足够快、足够便宜的模型。今年早些时候,谷歌 CEO Sundar Pichai 表示:“企业已经在透支全年 token 预算,而现在才 5 月。”他在接受采访时称,组合使用 Flash 系列模型,每年可以为企业节省超过 10 亿美元。
目前,这两款模型背已向 Gemini 企业用户以及 Gemini 应用用户开放,3.5 Flash-Lite 也将在不久后接入 Google 搜索。
最具针对性的发布,是 Gemini 3.5 Flash Cyber。该模型基于 Gemini 3.5 Flash 打造,并针对网络安全任务进行了专门优化,用于发现和修复软件漏洞。据悉,谷歌将其集成进 Google DeepMind 的代码安全智能体 CodeMender 中,该系统由多个 Flash Cyber 子智能体并行运行,并将结果汇总成一份统一报告,是谷歌进军网络安全专用模型的一次尝试。
谷歌将 Flash Cyber 定位为大型安全模型的“高性价比替代”,声称其在某项关键基准测试上可达到前沿模型水平,但成本仅为其一小部分。在 CyberGym 基准测试中,该模型取得了 83.2% 的成绩,仅比 OpenAI 的 GPT-5.5-Cyber(85.6%)低约 2 个百分点,尽管其模型规模要小得多。值得注意的是,CyberGym 是目前少数包含竞品模型对比的基准测试之一,各模型分数差距非常接近,而谷歌的优势主要体现在更低的 token 成本上。

在另一项测试中,Google 云漏洞研究团队利用该模型扫描公开 API,仅用两小时就发现了远程代码执行漏洞,并生成了可绕过安全防护的有效利用代码。在实际应用中,Google 的 Big Sleep 团队使用该模型检测 Google Chrome 和 Safari 中的关键漏洞,其表现超过了标准 Flash 模型以及 Anthropic 的 Claude Opus 4.6。在扫描 V8 JavaScript 引擎的代码提交时,Flash Cyber 发现了 55 个已确认的独立问题,而标准 3.5 Flash 发现 47 个,Opus 4.6 发现 36 个;其中有 10 个漏洞是其他模型完全未能识别的。
此外,Anthropic 在 AI 安全领域的领先地位也受到挑战。Mythos 是该模型的“隐形对手” ,但定价高达每百万输入 token 10 美元、输出 50 美元。
不过,谷歌也承认,这类模型在“进攻”和“防御”两方面同样强大,因此必须严格控制访问权限。目前,Flash Cyber 仅通过 CodeMender,在试点计划中向政府机构及可信合作伙伴开放,用于检测并修复安全漏洞。至于 CodeMender 智能体本身,则已通过 Gemini Enterprise Agent 平台提供预览版(但使用的是标准 Gemini 模型),支持 C/C++、Go、Java、Python、Ruby、Rust 和 TypeScript 等多种编程语言。
其竞争对手在网络安全能力上也采取了类似的访问限制策略。Anthropic 对其 Claude Mythos 实施了受限访问,而 OpenAI 则通过“可信访问”计划,仅向经过验证的用户开放 GPT-5.6 的部分防御能力。
尽管谷歌在 3.6 Flash 上有所推进,但更引人注意的,其实是“没有发布的东西”。
目前,谷歌在公开榜单前十中甚至没有一款模型。谷歌原计划在 6 月推出的旗舰模型 Gemini 3.5 Pro,至今仍在测试阶段,而华尔街正以该模型作为衡量 Google 旗下 Google DeepMind 是否能够与 Anthropic 和 OpenAI 保持竞争力的重要信号。去年 11 月,Gemini 3 系列模型的推出,一度显示出 Google 在经历多年落后后重回 AI 竞赛前列,甚至促使 OpenAI 在内部拉响“红色警报”,加速推进其 GPT 模型的研发。
7 月 17 日,据外媒报道,Gemini 3.5 Pro 的延期,据称是因为其未能达到内部预期,尤其是在编程能力方面,而这恰恰已成为企业级 AI 最具商业价值的应用场景之一。6 月下旬,团队曾尝试通过更新训练数据(即模型学习所依赖的大规模数据集)来进行改进,但结果依然令人失望。受该消息影响,Alphabet Inc. 的股价单日下跌约 4.4%,市值蒸发约 2000 亿美元。
有 10 名现任和前任谷歌员工透露,包括研究人员和管理层在内的许多人担心,随着竞争对手 Anthropic 和 OpenAI 推出能力超过 Gemini 模型,公司可能会在市场上失去优势。这些不愿具名的知情人士表示,谷歌在模型发布前需要协调多个层级的利益相关方,同时还要努力将 AI 融入其庞大的产品体系,包括搜索、地图以及 YouTube,这种复杂性也可能导致发布进度放缓。
谷歌对此的回应,是把目光投向更远处。该公司表示,已经启动了迄今为止“最雄心勃勃的一次预训练”,目标直指 Gemini 4。但这更多是一种意图表达,而非已经落地的能力。也就是说,Gemini 4 也很可能已经在预训练阶段。因此,与其说 Gemini 3.6 是一次重大升级,不如说更像是在“真正的大版本到来之前”,提醒市场 Gemini 仍然存在的一次展示。
这次谷歌的三款模型发布,率先传达出“效率优先”的策略。整体来看,这一策略是自洽的:在企业开始精打细算 token 成本的年份,用“便宜 + 快速”占领中端市场,同时为旗舰模型争取时间。并且,该策略也不止体现在软件层面。据了解,谷歌同时在研发自研芯片,以更低成本运行 Gemini。
但这场赌局能否成立,取决于两点:Gemini 3.5 Pro 能否尽快落地,以及 Gemini 4 最终是否不只是一次“训练中的承诺”。
参考链接:
https://ai.google.dev/gemini-api/docs/latest-model
https://www.reuters.com/business/google-updates-lightweight-gemini-models-flagship-still-delayed-2026-07-21/
https://www.bloomberg.com/news/articles/2026-07-16/google-gemini-launch-delayed-as-tech-falls-short-of-internal-goals
