今天凌晨,谷歌发布Gemini 3.6 Flash、Gemini 3.5 Flash-Lite和Gemini 3.5 Flash Cyber三款模型,重点提升Agent工作流所需的Token效率、响应速度和运行可靠性。
▲谷歌发布Gemini 3.6 Flash、Gemini 3.5 Flash-Lite和Gemini 3.5 Flash Cyber(图源:X)
其中,Gemini 3.6 Flash面向编程、知识工作和多模态任务,在第三方评测机构Artificial Analysis的Intelligence Index(智力指数)中,其任务Token消耗量比3.5 Flash少17%,在DeepSWE测试中的输出Token消耗最多减少约65%。
Gemini 3.5 Flash-Lite主打低延迟和高吞吐量,生成速度达到每秒350个输出Token,在Agent工作流中较前代的Flash-Lite模型也有较大提升。
Gemini 3.5 Flash Cyber则专门用于发现和修复网络安全漏洞,将其与CodeMender代码安全Agent配合使用,性能已达到前沿模型的竞争水平,与Mythos 5和GPT-5.6 Sol能力相当,不过暂不面向普通开发者开放。
目前,在Artificial Analysis榜单上,Gemini 3.6 Flash速度测评成绩优秀,但智力和成本的优势相对不明显:该模型的Intelligence得分只有50,落后于Claude Fable 5、GPT-5.6 Sol、Kimi K3、Grok 4.5、GLM-5.2,连Meta的Muse Spark 1.1也排在它前面;其单任务成本达到0.50美元(约合人民币3.39元),较DeepSeek、MiniMax、GLM、Muse Spark、Grok等模型更贵。
▲Gemini 3.6 Flash在能力、速度和成本上与其他模型对比(图源:Artificial Analysis)
作为昔日大模型“御三家”之一,谷歌此次最突出的优势仍然是速度。目前,Gemini 3.5 Flash-Lite和Gemini 3.6 Flash在输出速度上,位列榜单前两位。
▲Gemini 3.5 Flash-Lite和Gemini 3.6 Flash位列模型输出速度榜前两位(图源:Artificial Analysis)
对于等了两个月的用户来说,这次发布多少有些“等错了人”。今年5月,谷歌CEO桑达尔·皮查伊(Sundar Pichai)在I/O大会上预告,Gemini 3.5 Pro将在6月推出;如今7月已经过半,用户还是没有等来3.5 Pro。
对于这款迟到的Gemini 3.5 Pro,谷歌称该模型正在与合作伙伴测试,将在准备就绪后尽快发布。与此同时,谷歌提前预告Gemini 4,称已启动公司迄今规模最大的预训练任务。鸽了我们两个月的谷歌又画了两张新“饼”,也算是“不负众望”。
01.3.6 Flash:输出Token最多减少65%,编程、知识工作提升明显
Gemini 3.6 Flash基于开发者和企业客户对3.5 Flash的反馈改进。在处理多步骤工作流时,新模型需要的推理步骤和工具调用次数更少,同时减少了输出冗余。
3.6 Flash的输入价格为每100万个Token 1.5美元(约合人民币10.2元),输出价格为每100万个Token 7.5美元(约合人民币51元),输出价格低于3.5 Flash,输入价格不变。
3.6 Flash大幅降低了每项Agent任务的运行成本。在DeepSWE v1.1测试中,3.5 Flash平均每项任务消耗约27.6万个输出Token,3.6 Flash降至约9.7万个,降幅接近65%;在Artificial Analysis Intelligence Index中,两款模型的平均输出Token消耗分别约为2.8万个和2.3万个,Gemini 3.6 Flash的Token消耗量降低约17%。
▲Gemini 3.6 Flash和Gemini 3.5 Flash任务输出Token对比(图源:谷歌)
在软件工程Agent评测DeepSWE v1.1中,3.6 Flash得分为49%,高于3.5 Flash的37%和3.1 Pro的12%;在机器学习工程测试MLE-Bench中,3.6 Flash得分为63.9%,领先3.5 Flash的49.7%和3.1 Pro的42.6%。
知识工作测试GDPval-AA v2中,3.6 Flash、3.5 Flash和3.1 Pro的得分分别为1421、1349和965;在测试Computer Use(计算机操作能力)的OSWorld-Verified中,三者得分分别为83.0%、78.4%和76.2%。Computer Use现已成为Gemini API和Gemini Enterprise中的内置客户端工具。
▲3.1 Pro、3.5 Flash和3.6 Flash其他能力对比(图源:谷歌)
同时,谷歌还展示了模型的应用案例,Gemini 3.6 Flash能够更高效、准确地分析金融数据和电话会议记录、通过多Agent协作执行代码迁移、为3D工作流开发照片纹理提取工具,以及结合tldraw离线编辑器创建交互式主题设计工具。
在代码迁移任务的对比测试中,Gemini 3.6 Flash的规划耗时为20秒,低于3.5 Flash的24秒;执行迁移的时间则由2分08秒缩短至1分20秒,整体耗时减少约34%。根据案例展示的信息,3.6 Flash生成了更详细、结构更清晰的代码审计与验证文档,覆盖数据模型、API接口、业务逻辑、UI组件等多项针对性验证任务。
▲Gemini 3.5 Flash和Gemini 3.6 Flash在代码迁移任务中耗时对比(图源:谷歌)
多家早期客户也给出了反馈。设计软件公司Figma认为,3.6 Flash在质量、速度和成本之间取得了较好平衡,可以加快原型探索和迭代;法律AI公司Harvey称,该模型在文档起草和审查任务中平均快12%;开发工具公司JetBrains称,其低推理等级下的编程性能较上一代Flash提高了10%至20%。
安全方面,3.6 Flash加强了针对化学、生物、放射性与核风险以及网络攻击滥用的前沿安全防护。谷歌称,这些措施提高了模型抵抗越狱攻击的能力,同时尽量减少对正常用途的错误拒绝。
02.3.5 Flash-Lite:每秒输出350个Token,部分测试超过3 Flash
Gemini 3.5 Flash-Lite是Gemini 3.5系列中速度最快、价格最低的模型,主要面向Agent搜索、文档处理等强调低延迟和高吞吐量的任务。
根据Artificial Analysis的数据,该模型每秒可以生成350个输出Token。其输入和输出价格分别为每100万个Token 0.3美元(约合人民币2元)和2.5美元(约合人民币17元)。
开发者可以根据工作负载调整模型的思考等级:在大规模、低成本任务中选择minimal或low等级,在需要处理多步骤子Agent任务时启用更高等级。3.5 Flash-Lite同样内置了Computer Use工具。
与3.1 Flash-Lite相比,3.5 Flash-Lite在Agent终端编程测试Terminal-Bench 2.1中的得分从31%升至54%;在长上下文测试GDM-MRCR v2中,得分从60.1%升至72.2%;在知识工作测试GDPval-AA v2中,得分从642升至1140。
▲Gemini 3.1 Flash-Lite与Gemini 3.5 Flash-Lite对比情况(图源:谷歌)
3.5 Flash-Lite在部分测试中还超过了定位更高的3 Flash。在SWE-Bench Pro中,Gemini 3.5 Flash-Lite和Gemini 3 Flash两款模型得分分别为54.2%和49.6%;在OSWorld-Verified中,两者得分分别为74.0%和65.1%。
▲Gemini 3 Flash和Gemini 3.5 Flash-Lite对比情况(图源:谷歌)
美国金融科技公司Ramp认为,Gemini 3.5 Flash-Lite在票据提取任务中较好地平衡了准确率、延迟和成本。
▲美国金融公司Ramp对Gemini 3.5 Flash-Lite的评价(图源:谷歌)
03.网络安全模型:搭配Agent使用,暂不面向普通开发者开放
第三款模型Gemini 3.5 Flash Cyber基于3.5 Flash微调,专门用于发现、验证和修复网络安全漏洞。相比体量更大的模型,其Token价格更低,适合规模化检查代码安全问题。
该模型将与谷歌代码安全Agent CodeMender配合使用。CodeMender会同时运行多个3.5 Flash Cyber Agent,最后将不同Agent的分析结果合并成一份报告。
在CyberGym测试中,CodeMender最多调用5次模型时,3.5 Flash Cyber得分为83.2%。该模型在测试中的表现接近OpenAI和Anthropic的前沿模型,Anthropic Agent内的Mythos Preview得分为83.1%,OpenAI Agent内的GPT-5.6 Sol得分为83.6%,Anthropic Agent内的Mythos 5得分为83.8%,OpenAI Agent内的GPT-5.5-Cyber得分为85.6%。
▲Gemini 3.5 Flash Cyber在CyberGym测试中的表现(图源:谷歌)
考虑到漏洞发现和修复技术具有明显的双重用途,谷歌暂不向普通开发者开放3.5 Flash Cyber。该模型近期将通过CodeMender启动小范围试点,仅供政府机构和可信合作伙伴使用。
04.两款模型均已上线,3.5 Pro仍在测试
目前,Gemini 3.6 Flash和3.5 Flash-Lite已经通过Google AI Studio、Android Studio及Gemini API向开发者开放,其中3.6 Flash还进入了Google Antigravity。
企业客户可以通过Gemini Enterprise Agent Platform使用这两款模型,3.6 Flash同时接入了Gemini Enterprise应用。普通用户可以在Gemini应用中使用两款模型,3.5 Flash-Lite还将逐步接入谷歌搜索。
Gemini 3.5 Pro目前仍处于合作伙伴测试阶段,谷歌计划在准备完成后扩大开放范围。
05.结语:Gemini从追求单次性能,转向降低Agent总成本
谷歌此次更新Flash系列,重点转向降低Agent的实际运行成本。Gemini 3.6 Flash显著减少了完成任务所需的输出Token、推理步骤和工具调用次数,Gemini 3.5 Flash-Lite则进一步提升了生成速度。对于需要大规模部署Agent的企业和开发者来说,更低的成本和更快的响应速度仍具有实际吸引力。
不过,从Artificial Analysis等第三方榜单来看,Gemini的Flash系列模型能力目前难以保持领先。上周,月之暗面发布Kimi K3,其Intelligence得分仅落后于Claude Fable 5和GPT-5.6 Sol,在前端编程测试中甚至排到了榜首。
国产模型已经从跟随者变成全球前沿模型竞争中的重要力量,谷歌面对的对手也远不止OpenAI和Anthropic。至于谷歌能否重回昔日“御三家”的牌桌中,恐怕还要看已经延期的Gemini 3.5 Pro,以及刚刚开始预训练的Gemini 4。
来源:谷歌、X、Artificial Analysis
本文来自转载智东西 ,观点仅代表作者本人,发现AI平台仅提供信息存储空间服务。
如若转载,请联系原作者;如有侵权,请联系编辑删除。

微信扫一扫

