Gemini 3.8 Flash深夜突袭,六周三更,谷歌到底在急什么?
2 小时前 / 阅读约9分钟
来源:36kr
谷歌推出Gemini 3.8 Flash,强化长周期软件工程等能力,基准测试成绩亮眼,但社区实测反馈不佳,存在配置依赖、速度与质量矛盾等问题。谷歌因旗舰难产、组织动荡,选择高频迭代Flash。

今天凌晨,谷歌再度出手,Gemini 3.8 Flash毫无征兆地正式上线。

距离上一代3.7 Flash发布仅仅过去三周——这是谷歌在短短六周内端出的第三款Flash系列模型。平均两周一代,这速度放在过去的大模型圈子里,几乎难以想象。

更让人意外的是价格。输入每百万Token 0.75美元,输出3.75美元,与3.7 Flash完全一致,"白菜价"的标签死死焊在脸上。同步登场的还有专攻网络安全的Gemini 3.8 Flash Cyber,通过全新的Fairwind计划向受信防御者开放。

官方摆出的数据足够唬人:DeepSWE长程编程追平Claude Opus 5,Terminal-Bench 2.1(终端操作基准测试)逼近90%大关,HLE推理分数甚至反超了GPT-5.6 Sol。谷歌DeepMind核心成员姚顺宇更是留下一句耐人寻味的话:“对模型而言,这只是迈出了一小步;但对于RSI(递归自我改进)来说,却是一次巨大的飞跃。”

话虽如此,跑分终究是跑分。当这款被谷歌推到C位的“性价比杀器”落到真实开发者手里,社区反馈却远没有官方通稿那么乐观——做得快、交得多,和真正做得好,眼下还不是一回事。

01 Gemini 3.8 Flash白菜价越级反杀顶流旗舰 

先看谷歌摆出的硬货。

Gemini 3.8 Flash被定位为"迄今最聪明的Flash模型",重点强化长周期软件工程、自主Agent任务和复杂多步骤推理。官方给出的基准测试成绩单相当亮眼:

第一,编程能力逼近行业天花板。在DeepSWE v1.1长周期软件工程测试中,3.8 Flash拿下73.7%,上一代3.7 Flash是65.3%,直接追平了Claude Opus 5的74.0%。第三方机构Datacurve的独立验证同样显示,两者通过率均为74%,但3.8 Flash每题平均成本仅2.36美元,Opus 5要花11.84美元——差了整整五倍。

在Terminal-Bench 2.1(终端操作基准测试)上,3.8 Flash拿下89.4%,超过了Opus 5的89.1%,成为首个在该基准上逼近90%大关的Flash级模型。

第二,跨学科推理挤进第一梯队。HLE-Verified(人类终极考试)测试中,3.8 Flash拿到54.9%,略高于Opus 5的54.4%和GPT-5.6 Sol的54.5%。涵盖STEM、人文和专业领域的多步推理,一个Flash价格的模型已经能和旗舰坐在同一张桌子上。

第三,垂直专业Agent场景反超旗舰。在Vals金融Agent V2评测中,3.8 Flash取得61.4%,超过了3.7 Flash的59.0%、Opus 5的58.6%和GPT-5.6 Sol的53.8%。

Harvey法律Agent基准上,它的完整任务通过率达到10.0%,而Opus 5只有6.7%。

这些成绩背后藏着一个核心设计选择:3.8 Flash在复杂任务上会"更努力"。面对难题,它不再急于仓促给答案,而是执行更多推理步骤、反复调用工具、验证自己的结果。DeepSWE任务中,3.7 Flash平均输出10.7万Token、执行125个步骤;3.8 Flash则是14.3万Token、166个步骤。代价是:单价没变,但复杂任务实际成本从0.40美元涨到约0.58美元。

再说说Cyber版。在CyberGym漏洞发现基准上,它以86.2%的Pass@1超过了GPT-5.5-Cyber;CWE-Bench自动修复测试中,47.2%的成绩与行业领先的47.8%几乎持平,成本却低出一大截。实战层面,Chrome安全团队用它生成的正确补丁数量是其他商业模型的2.6倍;谷歌云团队借助它不到2小时就定位了一个以往需要数月才能发现的关键漏洞。不过,这款模型并不公开发布,只通过Fairwind计划向受信防御者开放。

跑分归跑分,社区实测是另一回事。当这款"性价比杀器"落到真实开发者手里,反馈却远没有官方通稿那么乐观。

02 跑分屠榜的学霸,一上考场就露怯? 

谷歌官方演示里,3.8 Flash能搭出3D魔法城堡,能做一个DOS界面的Google Maps——效果炫酷,像模像样。但落到真实开发者手里,画风立刻变了。

首先,官方演示用的那套配置,普通用户根本拿不到。

爱范儿让3.8 Flash用Three.js建一架空客H145直升机,109秒确实出了东西——可打开一看,机身部件关系粗糙,运动方式别扭;3D水流模拟的火山口甚至还在"漏水"。同样的提示词,官方能做出城堡,用户只能得到一个半成品。

差别在哪?官方案例不是把提示词一丢就完事,而是模型在Antigravity平台里持续循环指令,还调用了Nano Banana生成纹理。换句话说,跑分里那个73.7%,是"模型+Agent框架+多轮验证+工具调用"这套系统的成绩,不是模型单打独斗考出来的。

其次,Flash引以为傲的"快",也经不起推敲。

开发者Aditya用3.8 Flash和Kimi K3做同一个Sticky Ball游戏——Flash确实出得快,Token也省,但最终游戏的运动机制、移动表现全面落后。

博主AI Pulse Daily的纽约城市场景测试更是"公开处刑":同样提示词下,3.8 Flash只放了6棵树——比三周前3.7 Flash的10棵还少——而Opus 5塞进了1840棵。提示词明确要求的人行横道条纹、水下焦散全部被略过,它却主动加了5个摄像机预设、3个后处理开关——用户要的不给,用户没要的瞎加。

再者,短跑惊艳,长跑露怯。

Terminal-Bench 4.0上,3.8 Flash只有19.1%,Opus 5是51.8%;OSWorld 2.0电脑操作任务里,Flash拿59.0%,Opus 5是75.4%。Artificial Analysis综合智力榜上,3.8 Flash排第八、59分,和Kimi K3、GLM-5.3同一档——代码单项能摸到第二,但一到需要耐力、多步骤、跨领域的长任务,底子不够厚的问题就全暴露了。

这就引出一个更扎心的问题:既然实测落差这么明显,谷歌为什么还这么急着把3.8 Flash推出来?

03 六周三款Flash,谷歌到底在急什么? 

六周三款Flash,表面是技术迭代,背后全是无奈。

旗舰Pro难产,进度一鸽再鸽。皮查伊今年5月就透露新版Pro可能"随后一个月"到来,结果谷歌内部准备的Gemini 3.5 Pro方案最终被取消——核心原因居然是相对于Flash系列的提升不够明显。从五月鸽到九月,鸽到大家懒得催了。更远的Gemini 4虽然完成部分预训练,目前仍卡在后训练阶段,距离正式发布遥遥无期。

核心技术人员流失,组织动荡。过去一个半月,谷歌经历了一窝人事变动。Noam Shazeer、Jeff Dean等重要技术人物在今年夏天陆续离开,甚至连"二进制能力拥有者"Jeff Dean都离职了。谷歌随后调整了DeepMind管理层,Koray Kavukcuoglu接手更多管理职责,新管理层给出的明确要求是:进一步加快模型研发与发布速度。

Flash规模相对较小,修改和重新训练所需算力远低于Pro系列。据《华尔街日报》披露:谷歌内部可以让多个团队同时在Flash上尝试不同的后训练方案,三周左右就能完成一轮迭代。换成Pro系列,每一次调整都涉及更多GPU、更长的训练时间和跨团队资源协调,试错成本天差地别。

换句话说,谷歌之所以能在短短六周内连发三款Flash,不是因为技术突然爆发,而是因为Flash这条线本身就比Pro更适合"小步快跑"。旗舰难产的局面下,Flash自然成了唯一能持续输出新版本的产品线。

所以,谷歌在旗舰难产、Flash又天然适合"小步快跑"的双重压力下,选择了"以小博大",让Flash扛起这面大旗。六周三款,高频迭代,能跑多快跑多快。

04 不争第一,反而可能赢得更多 

跑分越级、实测露怯——这些矛盾放在一起看,反而把Flash的真实处境说得更清楚了。

它还不是旗舰,却已经开始承担旗舰的任务;它还不够全能,却足够便宜、足够快,还能不断迭代。这说明Flash距离真正的旗舰级全能模型还有差距,但对现在的谷歌来说,这已经够用了。

Pro迟迟不到,Gemini 4还在路上,Flash就是谷歌眼下最快的一张牌。六周三更,表面是Flash在狂飙,背后其实是谷歌在抢时间。

它能不能赢下终局,还得看Pro和Gemini 4;但至少现在,Flash正在替谷歌守住牌桌。