就在刚刚,谷歌杀回来了!
今夜,谷歌正式发布了Gemini 3.8 Flash,以及专攻网络安全的Gemini 3.8 Flash Cyber。
这是谷歌在短短六周内,连续发布的第三个Flash版本。
前两次更新,看起来只是热身,因为这一次,谷歌直接把性价比推到最前沿——
单任务成本0.58美元!输入仅仅0.75美元/百万Tokens!
就是这么一个「白菜价」的小模型,在多项核心基准测试中,硬生生摸到了全球最强旗舰Opus 5、GPT-5.6 Sol以及Grok 4.6的门槛。
谷歌DeepMind大牛姚顺宇评价说:对模型而言,这只是迈出了一小步;但对于 RSI来说,这是一次巨大飞跃。

X上,开发者们已经炸了。
有人实测后,发出灵魂拷问:「天哪,谷歌是不是发错货了?这不就是一直没放出来的Gemini 3.5 Pro吗?拿着Flash的价格,干着Pro的活!」


「DeepMind团队里,大概有人从7月份开始就没合过眼。」
所有人还在消化Fable 5.1的时候,谷歌又一次掀翻了牌桌。
谷歌「卷王」回来了:性价比之王
沉寂许久的谷歌,用极其内卷的方式,向世界宣告:大魔王杀回来了。

要理解Gemini 3.8 Flash带来的震撼,我们必须先看看当今AI市场的格局。
本来,在Artificial Analysis测试中,已经形成了极其森严的壁垒。你要想拥有顶级的智力(Intelligence Index达60分左右),就必须付出高昂的Token成本。
结果,Gemini 3.8 Flash就像一个刺客,简直不讲武德。
在Artificial Analysis的高推理模式下,Gemini 3.8 Flash的智力指数飙升到了59分!

这是什么概念?这距离最顶级的GPT-5.6 Sol和Grok 4.6仅有一步之遥,甚至在某些维度上超越了Claude Opus 5!
而做到这一切的代价呢?它的单任务成本仅为0.58美元。
具体来说,输入成本维持在0.75美元/百万Tokens,输出3.75美元/百万Tokens。
谷歌做了一张图:在智力与成本的帕累托前沿上,Gemini 3.8 Flash那个代表「最高效」的蓝点位于软件工程基准DeepSWE的右上角,把第二名甩出了一条街。

Gemini 3.8 Flash不仅聪明,还快得离谱。它的生成速度达到了惊人的 305 tokens/s,而下一档的模型才勉强跑到154 tokens/s。
「又快、又聪明、还便宜得像不要钱,这才是人类真正能天天用的模型。」

尤其在长周期软件工程基准(DeepSWE v1.1)上,3.8 Flash打出了 73.7% 的惊人成绩。
在这个需要AI自主解决复杂工程问题、端到端写代码的测试中,它不仅超越了大多数昂贵的前沿大模型,而且成本仅仅是后者的零头。
要知道,这只是「Flash」版,并不是「Pro」,更不是「Ultra」。
这一次,谷歌又一次让小模型抢了旗舰模型的饭碗。
有人亲测了Gemini 3.8 Flash和Opus 5做同一任务。

这种在编程能力上的大幅跃升绝非偶然。

这种在编程能力上的大幅跃升绝非偶然。
据报道,在谷歌内部的代码工具Jetski的测试中,谷歌工程师们甚至已经更倾向于使用3.8 Flash,而不是Anthropic的Opus模型。

这背后是谷歌从年初开始就在强化学习上猛砸资源——也就是模型训练的「后期打磨」阶段,让模型在试错中真正学会干活。
Google DeepMind组建了一支代码突击队,专注于提升编程模型能力,这个团队由DeepMind CTO领导,联创谢尔盖·布林直接监督。
他们的目标是,逼出递归自我进化,把编程模型硬生生改造成全自动AI研究员,彻底打通整个研发闭环。

在内部备忘录,谷歌直接说了:
为了赢得最后的冲刺,我们必须紧急弥合智能体执行方面的差距,把我们的模型变成主力开发者。

另外,谷歌还挖来了Barret Zoph——Thinking Machines Lab联合创始人,曾任OpenAI后训练负责人,现在出任研究副总裁,主管强化学习和后训练方向。这波操作,摆明了是要死磕到底。
上个月,联合创始人、诺奖得主Demis Hassabis卸任CEO,接棒的Koray Kavukcuoglu上来就放话:提速、提速、再提速。
基准「注水」,还是实力超群?
不过,在赞叹声中,谷歌普遍被指提前开香槟,高兴的太早。

最不爽的是Meta——
Meta的Muse Spark 1.3和Gemini 3.8 Flash狭路相逢,前者在Artificial Analysis的智能指数上获得了62分,与Claude Fable 5持平,跻身顶尖行列。
而Muse的输入成本比Fable 5低8倍,输出成本低近12倍,性价比拉满。
Meta的首席AI官Alexandr Wang直接阴阳起来:在Artificial Analysis智能指数上,Gemini啥也不是,只能吃别家模型的汽车尾气。


Muse Spark 1.3得分高于GPT-5.6 Sol、Grok 4.6和Gemini 3.8 Flash,但目前只是受限预览。
有人指出,虽然3.8 Flash的基准测试图好看,但实战起来,就未必了。
的确,Gemini 3.8 Flash在Terminal-Bench 2.1、HLE等测试中超越了GPT-5.6 Sol和Opus 5,但TBench 2.1与TBench 4之间的巨大分数差距,暴露了这其中可能存在一定的「刷榜」成分。
也就是说,当面对陌生的、尚未被包含在训练集中的真实世界Zero-shot挑战时,3.8 Flash大概率还是不如Opus 5这种参数巨兽。
但谷歌的解法极其聪明——勤能补拙。
正如谷歌在官方博客中所言:「这些性能的提升源于核心的设计选择:3.8 Flash工作得更努力。」
面对复杂任务时,3.8 Flash被设计成了会执行额外的推理步骤、不断迭代调用工具。当遇到不懂的问题,它不会直接摆烂,而是通过消耗更多的Token,在内部进行高速的自我验证和反思。
即便它通过多次循环思考消耗了更多的Token,由于其基础单价实在太便宜(0.75刀/百万tokens),算总账下来,它依然比你直接调用一次GPT-5.6要便宜得多!
这种策略,直接打破了过去「大参数=强能力」的单一维度竞争。
它证明了:在一个完美的Agent循环中,速度和极低的推理成本,本身就是一种强大的智力。
为什么发Flash?「被毙掉的」Pro版
谷歌这次,真的没发错货吗?
Gemini 3.5 Pro到现在连影子都没有。下一代的王牌Gemini 4倒是预训练数据挺漂亮,但后训练阶段还没走完。

事实上,谷歌迟迟不发Pro版本,背后有着一段辛酸史。
劈柴曾在今年5月夸下海口,说「下个月」就会推出更强大的Pro系列,但一直在鸽。
其实,谷歌内部原本有几个 3.5 Pro 的候选模型,但最终都被无情「毙掉」了——因为它们并没有比现在的 Flash 系强出足够多的身位!
同时,大家翘首以盼的下一代旗舰 Gemini 4 虽然在预训练评估中表现良好,但目前仍卡在最关键的后训练阶段。
总之,一切阴差阳错地造就了Flash系列的疯狂迭代。
2小时挖出数月才能发现的漏洞:网络安全版屠榜了
谷歌这次,只是让3.8 Flash在常规任务上卷价格吗?
远远不止。
这次发布会真正的杀器,是它的双生兄弟——Gemini 3.8 Flash Cyber。
连开发者都在惊呼:「到底是什么样的安全任务,值得谷歌专门为Flash推出一个Cyber专属变体?」
谷歌的答案就是:为了对抗未来的AI黑客。
在发现漏洞的基准测试 CyberGym 上,3.8 Flash Cyber 跑出了 86.2% 的分数,直接屠榜,将之前的大模型远远甩在身后。
不仅如此,现实世界中的代码可不止C/C++。
在谷歌内部横跨20种编程语言的复杂代码库综合测试中,这个模型发现广泛漏洞的成功率竟然超过了70%。
更惊人的,是它在真实世界的实战战绩。
Chrome安全团队拿它去测,发现它生成的正确修复补丁数量,是之前市面上最好、且体积大得多的商业模型的 2.6倍。
Wiz安全公司测试发现,它在渗透测试中的召回率提高了7.5-9.7%,而成本降低了2.3到5.2倍。
最让人惊讶的是,谷歌云漏洞研究团队利用它,在短短 2小时内,就发现了一个关键的基础性漏洞——而以往,人类顶级专家找到这样的漏洞,通常需要几个月的时间!
在CWE-Bench(打补丁能力测试)中,3.8 Flash Cyber的首次通过率达到了47.2%,与最领先的前沿大模型(47.8%)几乎不相上下,但价格比起来只有九牛一毛。

也正因为3.8 Flash Cyber的网络攻防破坏力过于惊人,谷歌并没有选择将其完全开源,而是通过全新的 Fairwind计划 ,仅向受信任机构开放。
OpenAI、Anthropic与谷歌:大模型三国杀进入分水岭
透过Gemini 3.8 Flash的发布,可以看出当今AI三巨头已经走上了三条截然不同的进化路线。
Anthropic (Claude系),死磕的是「知识可靠性与稳定」。
在偏向知识覆盖和事实准确率的测试(如AA-Omniscience)中,Claude依然是降维打击。
前七名全是Claude系,他们现在明显在强化企业级任务中的不犯错能力,力求稳定输出。
OpenAI (GPT系),押注的是「深度推理与顿悟」。
在偏向物理、数学推导的CritPt测试中,GPT-5.6 Sol断崖式领先。
OpenAI像是在追求一种纯粹的智力涌现,要求模型在没人告诉它答案时,自己能像科学家一样「想」出来。
Google (Gemini系),打造的是「无尽循环的超高速打工人」。
谷歌这次给出了第三种答案:也许我一次想不通最难的物理题,但我反应极快、成本极低。
在Agent的时代,我可以一秒钟思考100次,写代码、运行、报错、修改,用极低成本的暴力迭代,硬生生砸出正确结果。
Agen在现实中遇到的麻烦,需要反复试错、调用工具、动态调整。
而Gemini 3.8 Flash,简直就是为这种「长程工作流」量身定制的。
你可以在Google Antigravity中,仅用一个提示词加上循环指令,就让3.8 Flash自动生成一个包含谜题、环境贴图和3D关卡的完整游戏。
你可以用它一键生成带有街景和导航的DOS版谷歌地图。

显然,Gemini 3.8 Flash的易用性和成本,已经突破了某个奇点。
Gemini 3.8 Flash的到来,仿佛谷歌向全行业宣告:大模型正在摆脱「只有巨头才用得起」,向着算力普惠狂奔。
那些原本需要耗费几万美金、跑上几天几夜的智能体任务,现在只需要几杯咖啡的钱,几分钟就能完成。
属于普通人的超级个体时代,真的来了。
这是属于小模型的觉醒时刻。
参考资料:
https://x.com/alexandr_wang/status/2095266112212754659?s=20
https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/
文章来自于微信公众号 “新智元”,作者 “新智元”
【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。
项目地址:https://github.com/browser-use/browser-use
【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!
项目地址:https://github.com/coze-dev/coze-studio
【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。
项目地址:https://github.com/n8n-io/n8n
在线使用:https://n8n.io/(付费)
【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。
项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file
【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。
项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file
在线使用:https://vectorvein.ai/(付费)
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md
【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。
项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md
在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0