谷歌连发三款“Lite、Flash”模型,但Pro再次缺席

2026-07-22 00:26:01 · chineseheadlinenews.com · 来源: 腾讯科技

谷歌连发三款“Lite、Flash”模型,但Pro再次缺席

文丨晓静

编辑丨徐青阳

美国当地时间7月21日,谷歌DeepMind团队一口气放出三款新的Gemini模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite以及Gemini 3.5 Flash Cyber。

其中,主力模型Gemini 3.6 Flash在编码和多模态任务上表现更强,但更关键的是,它处理相同工作所消耗的输出token比前代减少了17%到65%。

Gemini 3.5 Flash-Lite主打极致的速度与性价比,每秒可生成350个输出token。

而Gemini 3.5 Flash Cyber则是一款针对网络安全漏洞检测与修复进行微调的专用模型,目前仅向政府和特定合作伙伴开放。



与此同时,外界期待已久的旗舰模型Gemini 3.5 Pro依然没有露面,谷歌表示它正在与合作伙伴进行测试,并首次透露,更庞大的Gemini 4预训练工作已经启动。

01 告别“啰嗦”的AI

在大语言模型的应用成本中,输出token的数量直接关联到费用与延迟。Gemini 3.6 Flash的设计目标之一,就是降低这种不必要的消耗,同时保持或增强任务完成的质量。

第三方基准测试机构Artificial Analysis Index的实测显示,该模型输出token使用量较前代降低了17%。在需要多步骤推理和工具调用的复杂工程任务中,节省效果更为明显。



例如在Datacurve的DeepSWE基准测试中,token消耗减少了65%,这意味着Gemini 3.6 Flash在完成任务时执行了更少的冗余代码编辑和循环操作。



这种效率提升还带来了直接的价格下降。

Gemini 3.6 Flash定价为每百万输入token 1.50美元,每百万输出token 7.50美元。相较于3.5 Flash每百万输出token 9美元的价格,单次智能体任务的总成本有所降低。



性能方面,Gemini 3.6 Flash在多个基准测试中取得了可量化的提升。

DeepSWE测试中得分为49%,高于3.5 Flash的37%。MLE-Bench机器学习工程基准测试中,得分从49.7%提升至63.9%。



计算机使用能力在OSWorld-Verified测试中得分为83%,此前为78.4%,该功能现已成为Gemini API和Gemini Enterprise的内置客户端工具。

知识工作方面,GDPval-AA v2基准上的得分从1349提升至1421。

多家客户已经给出反馈。

Figma、Harvey、Hebbia和JetBrains均表示,Gemini 3.6 Flash在处理复杂工作流和知识型任务时,在token效率、准确性和速度之间取得了平衡。

谷歌展示了Gemini 3.6 Flash在几个实际场景中的表现。

在金融领域,该模型使用AI Studio上的Managed Agents,能够比Gemini 3.5 Flash更高效、更准确地解析和分析财务数据及记录。



在代码迁移任务中,Gemini 3.6 Flash在Antigravity平台上借助多智能体编排执行操作,比前代具有更低的延迟和更高的质量。



在创意工具方面,Gemini 3.6 Flash利用视觉理解能力,通过Antigravity和tldraw开源绘图工具构建了一个交互式主题工作室。



此外,该模型还使用Gemini App中的画布功能,帮助开发者制作了一个用于3D工作流的摄影纹理提取器。



02 在速度上卷出新高度

Gemini 3.6 Flash追求的是效率平衡,Gemini 3.5 Flash-Lite追求的则是速度极限。

谷歌将其定义为3.5系列中“最快、最具成本效益”的模型。根据Artificial Analysis的实测,它的生成速度达到每秒350个输出token,这大约是上一代3.1 Flash-Lite速度的两倍。

定价也极具竞争力,每百万输入token 0.30美元,输出token 2.50美元。这种低成本和高速度,瞄准的是高吞吐量的业务场景,例如智能体搜索、大规模文档处理等。

虽然名字中带有Lite,但Gemini 3.5 Flash-Lite在SWE-Bench Pro测试中,得分54.2%,超过了标准版Gemini 3 Flash的49.6%。在OSWorld-Verified测试中,它以74%的成绩优于Gemini 3 Flash的65.1%。





开发者还能根据工作负载调整模型的“思考层级”:处理简单的高容量任务时,可设为最低思考以换取低延迟和低成本;面对复杂子智能体任务时,再提高思考层级保证质量。

谷歌公布了Gemini 3.5 Flash-Lite在四个场景中的演示案例。

第一个是从海量电子商务数据集中提取产品特征并进行整合。



第二个是作为主智能体与Gemini 3.5 Flash-Lite协同工作,即时生成25个独特的、可随时探索的网页设计概念。



第三个是利用多模态理解能力,大规模进行收据翻译和摘要。



第四个是通过即时生成并迭代多个选项来构建游戏。



早期客户Ashler、Paloalto和Ramp均强调了该模型在速度、智能和成本效益方面的独特组合,认为其适用于扩展智能体工作流和数据处理任务。

03 “白帽黑客”专用模型

谷歌发布的第三款模型Gemini 3.5 Flash Cyber,是专门用来发现和修补网络安全漏洞的。

这款模型基于Gemini 3.5 Flash进行微调,谷歌希望它能以更低的token成本,去完成那些通常交给大模型的代码安全任务。在名为CyberGym的基准测试中,它的表现已经达到了前沿水平。



不过,鉴于网络攻防的双刃剑性质,谷歌对这款模型采取了审慎的交付策略。它不会面向所有开发者开放,而是直接集成到谷歌的代码安全智能体CodeMender中,作为一个有限访问试点项目,仅独家提供给政府和受信任的合作伙伴。

谷歌Gemini团队产品管理高级总监图尔西·多希表示,这是为了让一线的防御者能在关键漏洞被广泛利用前,抢先一步发现并修复它们,降低被滥用的风险。

谷歌透露,在内部测试中,这个模型在开源代码库V8 JavaScript Engine中找出了55个问题,其中10个漏洞是其他模型未能发现的。

从三款新模型的布局能看出,谷歌当前的策略是在效率上建立优势。

当下,越来越多的企业开始审视AI投入产出比,意识到大量消耗token并不总能换来好结果。谷歌CEO桑达尔·皮查伊在今年早些时候就提过,有的公司5月份就花完了全年的token预算,如果能混合使用Flash模型和其他前沿模型,能节省大量资金。

这种思路反映在产品上,就是不断压低成本、提高速度,同时增强模型处理具体任务的能力。

伴随这些高性能指标,安全也是必须要做的功课。Gemini 3.6 Flash在化学、生物、放射性、核(CBRN)以及网络攻击滥用方面,都加强了前沿安全防护,提升了抵御越狱攻击的能力,同时尽量减少对正常有益用途的拒绝。

对于普通用户和开发者,这些模型自发布当天就可以在Google AI Studio、Android Studio和Gemini应用里用到,同时可在Google Antigravity及Gemini Enterprise应用中使用。

Gemini 3.5 Flash-Lite还会逐步在谷歌搜索引擎中推开。Gemini 3.5 Flash Cyber,将通过CodeMender以邀请制落地。

04 3.5 Pro仍在测试,Gemini 4已在路上

尽管Flash模型陆续到位,但开发者社区更关心的问题始终是:Gemini 3.5 Pro何时发布?

谷歌上一次更新Pro系列模型是在今年2月发布的Gemini 3.1 Pro。此后,竞争对手的旗舰产品持续迭代。

OpenAI先后发布了GPT-5.5并开始推出GPT-5.6,Anthropic推出了Claude Opus 4.8和Claude Sonnet 5,并扩大了前沿模型Fable 5的访问权限。

今年5月,谷歌在发布Gemini 3.5 Flash时曾预告Pro版本已在内部使用,预期一个月内推出。如今已至7月末,该模型仍处于未公开状态。彭博社此前报道称,谷歌因难以达到内部性能目标,在推出3.5 Pro方面面临内部延迟。

对此,谷歌DeepMind技术负责人洛根·基尔帕特里克在社交媒体上回应说,Gemini 3.5 Pro正在与合作伙伴进行测试,计划在准备就绪后立即广泛提供。但他没有给出具体的时间节点。



谷歌方面并未详细解释延期原因,但在公布Flash系列的同时,首次正式提及了下一代旗舰模型Gemini 4的进展。团队表示,已经启动了Gemini 4的预训练工作,并称其为“迄今为止最雄心勃勃的预训练工作”。

这在一定程度上表明,谷歌的模型研发管线仍在持续推进,而3.5 Pro的交付节奏可能受内部测试和性能目标的影响。

美国网络科技媒体BI表示,截至Flash系列新模型发布当天,在Artificial Analysis的数学和推理等综合基准测试中,谷歌还没有一款模型进入该排行榜前十名。

新模型开放访问后,开发者社区很快传出了相当数量的负面声音。这些反馈主要集中在3.6 Flash的实际表现上。

有开发者在构建3D金门大桥场景时,反复提示了三次,模型仍持续忽略指令。最终输出质量甚至还不如5个月前发布的Gemini 3.1 Pro。



另一位开发者在Antigravity平台上测试后反馈,木头纹理质量更差,大理石缺乏功能性,在AI游戏测试中同样失利。



有用户给模型布置中等规模任务,两分钟就完成了,但结果被评价为“一个本地4B模型都能比它做得更好”。



还有人将矛头指向了性价比。

有评论指出,3.6 Flash虽然便宜,但在每个编码基准上都表现不佳。相比之下,Kimi K3和GLM 5.2等模型由资本规模远小于谷歌的实验室打造,却交出了更好的成绩。

月之暗面作为Kimi的创建者,估值约300亿美元,与谷歌约4.5万亿美元的市值相差约150倍。开发者对此表达了困惑。

更具体的数据来自Artificial Analysis的评分。

有用户注意到,3.6 Flash在该平台上的得分与3.5 Flash完全相同,但排在Meta Spark 1.1、GLM-5.2、GPT-5.6 Luna、Claude Sonnet 5、Grok4.5和GPT-5.6 Terra之后。




    24小时新闻排行榜更多>>
  1. 台积电拟于2027年涨价至多10%
  2. 黄仁勋“达链”背后的生意经
  3. 北京“中国尊”遭飞机撞击事件 2家轻航业者被停业
  4. 西班牙冠军奖金也要交税
  5. 16岁高中生被刺死案,牵出“涉黄”疑云
  6. “两岸间只剩三公里”:金门对面多了一座巨型机场
  7. 中情局前分析师:美伊战争给北京留下3大教训
  8. 张维迎:重新思考几个重大问题
  9. 接下来值得留意的几个叙事
  10. 网络攻防:GPT-5.6-Sol 超越了Mythos
  11. 科技股暴力反弹,花旗却泼冷水
  12. 李希到重庆训话 袁家军不妙?张安疆死或致更大风暴
  13. 清华教授关于三峡惊人预言 触怒高层被打成右派
  14. “毋忘初心”举行721事件七周年纪念集会 吁守护真相
  15. 川普冻结加州明州$10亿医保资金
  16. 梅西蹲在草坪,C罗煽风点火:FIFA保送阿根廷?
  17. Kimi K3爆红 马斯克放狠话“宣战” 月之暗面简单回应
  18. 美国对加拿大加征50%新关税
  19. 盛雪:从川普撕开美国选举黑幕看中共企图颠覆美国
  20. 卸任英国首相数小时后,斯塔默被拍到在酒吧畅饮
  21. 印尼游轮夜间被巨浪击沉 中国游客海上漂流获救
  22. 美国大模型开始抄中国作业
  23. 刘煜辉最新谈AI:我们可能在冲击一个顶部
  24. 被质疑“5A”身份造假,景区回应
  25. 我们说的“AA制”,老外压根听不懂
  26. 英国10年连换7个首相
  27. 新泽西州6600名非公民被误登记为选民
  28. 习近平成国际嘲讽目标 中国网友:全球辱包热潮来了
  29. BBA集体降价
  30. 悬疑剧也能“文气”十足?
  31. 酸奶是最垃圾的食品,有害还致癌?
  32. 纽约市长想抓内塔尼亚胡 川普霸气保证:看谁敢动你
  33. AI硬件的下一个核心瓶颈在哪里?
  34. 富贵之人拥有哪些面相特征?
  35. F、J、I类美签D/S制或取消 律师:及早规划绿卡避险
  36. 川普有了“新盟友”
  37. 川普对200亿商品祭50%关税!加总理喊话深入谈判
  38. 日本文化的独到之处:小小梅干中藏大大作用
  39. 美国河边惨剧:一人落水 4人施救全被卷走 2童目睹
  40. 英法加等西方多国外交使团联合声明 谴责以色列
  41. 德铁宣布德火车站将全面禁酒
  42. 食品涨价怪超市?经济学人:元凶另有其人
  43. 非法移民枪杀美女友还告川普 求偿要求道歉给公民身分
  44. 川普本周将启动新一轮关税 60国面临最高12.5%税率
  45. 中国宣扬“开放普惠” 与美竞逐AI全球治理主导权
  46. 新一代农田滴灌砂石过滤器实现高效净化与反冲洗
  47. 首批“美宝”长大后,更难的选择开始了
  48. 习近平刚吹完这件事 就遭了一记响亮的耳光
  49. 战火年代:我的家族记忆与童年往事
  50. 梅西发文:太痛苦 国际足联调查决赛后冲突事件
  51. 原国开行行长欧阳卫民被查 财新网要切割王岐山?
  52. 建议媒体在报道刑事案件时慎用“求爱”等词汇
  53. 杭州黄总事件,一句误会掩盖不了“骚扰”的本质
  54. 深圳地铁安检新规致排长队,广州的教训没看见?
  55. 在白宫会见黎总统 川普表示将“大力帮助”黎巴嫩
  56. 习近平访美有变数?川普再批中国介选
  57. 女子高速接管网约车,送司机就医
  58. 美国会美中经济安全审查委员会时隔七年再访北京
  59. 特别难过,广西还是没能留住他
  60. 证监会:行业机构加大逆周期架构力度