谷歌邪修Gemini 3.8 Flash!险胜DeepSeek,姚顺宇:RSI一大步

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
谷歌邪修Gemini 3.8 Flash!险胜DeepSeek,姚顺宇:RSI一大步
7137点击    2026-09-03 10:25

刚刚,Gemini 3.8 Flash,正式发布


Coding能力大幅提升,LMArena上,Gemini 3.8 Flash空降Agent榜单第14名,以微弱优势险胜DeepSeek-V4-Pro。


对一款走量定位的Flash模型来说,无疑是超常发挥了,值得表扬。


毕竟价格一分没涨。


是的,3.8 Flash在定价上,仍然与3.7 Flash保持一致。


谷歌邪修Gemini 3.8 Flash!险胜DeepSeek,姚顺宇:RSI一大步


Benchmark啥的就不细说了,大家看看就行。


相比而言,背后的方法论可能更有意思一点——


从谷歌披露的这些数据看来,Gemini好像「邪修」上了啊。。。


OpenAI和Anthropic都在努力让模型表现更强,同时用更少的步骤完成任务。


谷歌这边,完成任务需要走的步骤却越来越多,主打靠Loop大力出奇迹。


估计也是为了弥补模型智能本身的不足吧。


谷歌邪修Gemini 3.8 Flash!险胜DeepSeek,姚顺宇:RSI一大步


这可能也是Gemini如此注重「速度」的原因。


目前看来,3.8 Flash是市面上输出最快的模型,断崖碾压的那种,比第二名Meta高了几乎一倍。。。


但就是不知道实际用起来到底咋样。


如果智能水平跟不上,输出的全是劣质Token啊。


谷歌邪修Gemini 3.8 Flash!险胜DeepSeek,姚顺宇:RSI一大步


这方面,有网友发现了端倪。


说这玩意儿完全就是刷分刷出来的,像Terminal-bench 4.0这种8月底刚出的bench,新版Gemini表现纯纯一坨。


谷歌邪修Gemini 3.8 Flash!险胜DeepSeek,姚顺宇:RSI一大步


但不管怎么样,谷歌这次,终于是睡醒了吧。


过去一个半月,谷歌经历了一窝人事变动,甚至连二进制能力拥有者Jeff Dean都离职了——


谷歌,却连出了三款Flash。


关于这点,DeepMind成员姚顺宇的新帖子,或许能给出一点解释。


对模型来说,那只是一小步;但对RSI来说,则是一次巨大的飞跃呢


谷歌邪修Gemini 3.8 Flash!险胜DeepSeek,姚顺宇:RSI一大步


六周三款Flash,搞不好只是开胃菜。


Gemini 3.8 Flash:笨,但很努力


3.8 Flash无疑是一款性价比模型,相比3.7 Flash性能大涨,多数场景已经逼近更高成本的旗舰模型。


谷歌邪修Gemini 3.8 Flash!险胜DeepSeek,姚顺宇:RSI一大步


DeepSWE v1.1上,它能端到端自主解复杂工程问题,得分超过大多数体型大得多的前沿模型,成本只要零头。


谷歌邪修Gemini 3.8 Flash!险胜DeepSeek,姚顺宇:RSI一大步


金融和法律这类企业级agent场景,它也压过3.7 Flash和其他前沿模型。


HLE-Verified,人类最后的考试上拿到 54.9%,跨STEM、人文、专业领域的多步推理,和旗舰的差距肉眼可见地缩小了。


但智能方面,似乎并没有本质的提升。


3.8 Flash能考出这个分数,单纯是靠卷出来的。。。


是的,面对复杂任务,它会多走几步推理,反复迭代调用工具,所以在高effort档位下,它可能比前辈们烧更多Token。


这么一看,好像也没性价比到哪去啊。


谷歌如果想重回第一梯队,光靠这种Trick估计是不太行的。


还是坐等一手Pro吧。


只守不攻的Cyber模型


对了,还有一款模型——


3.8 Flash Cyber。


谷歌史上最强的网络安全模型。专攻自主发现漏洞、自动生成补丁。


基准上,CyberGym 漏洞发现测试里,3.8 Flash Cyber 超过 3.5 Flash Cyber,也超过大得多的前沿模型。在覆盖 20 种编程语言的内部代码库测试里,挖洞成功率超过 70%。


谷歌邪修Gemini 3.8 Flash!险胜DeepSeek,姚顺宇:RSI一大步


修洞方面,CWE-Bench上它pass@1达到47.2%,目前领跑的前沿模型是47.8%,几乎打平,成本却低出一大截。


谷歌邪修Gemini 3.8 Flash!险胜DeepSeek,姚顺宇:RSI一大步


更硬核的是实战报告,它已经在谷歌内部上岗了。


Chrome安全团队拿它修洞,产出的正确补丁数量,是最强商业模型的 2.6倍


Wiz用它跑内部渗透测试,召回率提升7.5到9.7个百分点,同样成绩的花费,只有其他前沿模型的2.3到5.2分之一。


最夸张的是Google Cloud漏洞研究团队,用它不到两小时,就挖出了一个以往需要研究数月的关键基础漏洞。


不过吧,这又是一个不公开发布的模型。。。


是的,谷歌表示能力太强,只通过Fairwind计划向受信防御者开放。


One More Thing


就在谷歌发模型的当口,Meta也端出了新货,Muse Spark 1.3。


又是一款对标Opus 5的模型,Agent和Coding能力同样大幅提升。


谷歌邪修Gemini 3.8 Flash!险胜DeepSeek,姚顺宇:RSI一大步


还顺手嘲讽了Gemini一波——


我真不想这么说,但是……


Gemni,谁啊?


谷歌邪修Gemini 3.8 Flash!险胜DeepSeek,姚顺宇:RSI一大步


不是,bro,你跟Gemini比个啥啊???


参考链接:

[1]https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/


文章来自于"量子位",作者 "Jay"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md