加量不加价!谷歌发布Gemini 3.8:主打编程与网络安全

2026-09-02 20:26:29 · chineseheadlinenews.com · 来源: 腾讯科技

加量不加价!谷歌发布Gemini 3.8:主打编程与网络安全

Alphabet兼谷歌CEO桑达尔·皮查伊。图片经由AI生成

美国当地时间9月2日,距离Gemini 3.7 Flash发布三周后,谷歌推出了Gemini 3.8系列模型。

本次更新包含两个版本:标准版Gemini 3.8 Flash以及面向网络安全领域的Gemini 3.8 Flash Cyber。

其中,谷歌将Gemini 3.8 Flash定位为用于推理和编码的Flash级主力模型。在保持与3.7 Flash相同速度与成本的前提下,新模型提升了在软件工程、复杂智能体任务以及特定领域多步骤推理上的性能表现。

在价格方面,Gemini 3.8 Flash延续了先前的优惠促销定价,API价格维持在每百万Token输入0.75美元、输出3.75美元,试图通过低价策略推动中端模型在复杂工程和自动化任务中的应用。

在旗舰模型Gemini 3.5 Pro发布节奏放缓的背景下,谷歌在六周内连续三次更新Flash系列,展现出了明确的战术调整:通过加快中端主力模型的迭代频率与降本增效,在真实工程、智能体自动化以及垂直安全场景中建立生态布局。

01 编程与长链条推理:增加计算投入以提升任务完成率

Gemini 3.8 Flash在底层设计上进行了调整。与前代相比,新模型在处理复杂任务时会执行更多步骤的推理,并以循环迭代的方式调用内部工具。

尽管在部分高难度任务中,模型可能会消耗额外的Token,但这种机制旨在提高任务的首次成功率,并减少死循环重试和人工干预。对于强调极简Token消耗的场景,开发者可以通过调整思考配置降低消耗,或继续使用完全受支持的Gemini 3.7 Flash。



图注:Gemini 3.8 Flash 与主流前沿模型在 API 价格及各项基准测试中的性能对比数据

在基准测试中,Gemini 3.8 Flash在长程软件工程与自动化智能体评测中展现出接近高成本模型的表现:

在长程软件工程(DeepSWE v1.1)测试中,模型能够自主解决复杂的端到端工程问题,得分高于部分体量更大的模型,且综合成本较低。



图注:Gemini 3.8 Flash 在 DeepSWE v1.1 长程软件工程基准测试中的准确率与单任务成本对比,处于帕累托最优前沿

在专业领域推理方面,针对金融与法律等高精度分析场景,新模型在Vals Finance Agent V2和Harvey Legal AgentBenchmark等测试中的得分超过了前代模型及部分竞品。



图注:Gemini 3.8 Flash 在金融(Vals Finance)、法律(Harvey's Legal)及跨学科专家推理(HLE-Verified)基准测试中的表现对比

在跨学科综合推理方面,模型在HLE-Verified基准测试中取得了54.9%的成绩,涵盖了STEM、人文科学和专业领域的复杂多步骤推理任务。

为了展示新模型的工程能力,谷歌展示了多个依托Gemini 3.8 Flash构建的实际案例:



纯文本生成3D魔法师游戏:开发者输入文本提示,模型即可在Google Antigravity环境中构建包含谜题、环境叙事与3D关卡的游戏,并协同Nano Banana实时生成角色与场景纹理。



单次生成DOS版谷歌地图:仅凭一条指令即可生成复古DOS风格的谷歌地图,支持地点检索、路线规划及街景预览。



交互式地形图解析:结合美国地质调查局的真实数据集,动态生成知名地理景点的实时剖面图、2D投影与科学解释。



硬件结构拆解可视化:基于Three.js自动生成具备物理比例的硬件拆解视图,并提供可控制的动态剥离与检查功能。

02 Gemini 3.8 Flash Cyber:面向防御场景的网络安全模型

作为本次发布的另一版本,Gemini 3.8 Flash Cyber是谷歌专为网络安全防御打造的定制模型,将Flash级别的高速迭代特点与安全防护能力结合,定向面向合规防御人员开放。

与偏向攻击性测试的模型不同,谷歌在3.8 Flash Cyber的训练中明确将漏洞发现与自动补丁修复置于最高优先级:

在自主漏洞挖掘(CyberGym)测试中,其漏洞发现能力高于前代3.5 Flash Cyber以及部分体量更大的模型。在涵盖20种编程语言的谷歌内部代码库漏洞测试中,成功率超过70%。



图注:Gemini 3.8 Flash Cyber 在 CyberGym 漏洞挖掘基准测试中的 Pass@1 表现对比

在自动化补丁修复(CWE-Bench)测试中,由Collinear运行的测试显示,3.8 Flash Cyber取得了47.2%的pass@1成绩,处于准确率与成本的帕累托前沿,性能逼近前沿模型,同时使用成本更低。



图注:Gemini 3.8 Flash Cyber 在 CWE-Bench 自动化漏洞修复测试中的 Pass@1 准确率与单次成本对比,处于帕累托前沿

目前,谷歌内部已部署该模型用于自身代码安全防护。

Chrome安全团队表示,该模型生成的漏洞修复补丁数量是大型商业模型的2.6倍;Wiz的内部渗透测试显示,新模型的召回率提升了7.5%至9.7%,而成本则降低至其他前沿模型的2.3分之一到5.2分之一;谷歌云漏洞研究团队利用该模型,在不到两小时内发现了一项通常需要数月研究才能定位的基础性关键漏洞。

03 安全防护与生态落地



图注:Gemini 3.8 Flash在Gray Swan测试中的表现

在安全防护方面,Gemini 3.8 Flash遵循谷歌的前沿安全框架(Frontier Safety Framework),内置了针对化学、生物、放射性、核风险以及网络攻击滥用的防护规则。

同时,根据Gray Swan的测试数据,新模型在抵御提示词注入攻击(Prompt Injection)方面提升明显。针对防护机制更为宽松的Cyber版本,谷歌则通过全新的Fairwind Program计划,向受信任的政府机构、关键基础设施运营方及开源软件维护者定向开放申请。

发布之后,Gemini 3.8系列已接入谷歌的开发者工具与终端产品:

在开发者侧,可通过Google AI Studio、Android Studio及Gemini API直接调用 Gemini 3.8 Flash,或在Google Antigravity中探索智能体优先的工作流,并在Stitch中自动生成UI界面。

在企业侧,企业客户可通过Gemini Enterprise平台进行业务部署。

在消费侧,Google AI Pro和Ultra订阅用户可在Gemini App、谷歌搜索的AI Mode以及Google Sheets中直接体验3.8 Flash。

04 架构创新扩展:视频多模态同步引入智能体理解



Agentic 视频理解工作流程架构图(Agentic Loop)

在提升模型推理与编码能力的同时,谷歌近期也将其智能体(Agentic)架构引入到了多模态视频分析领域。在此前针对Gemini Flash系列(包括 3.7 Flash、3.6 Flash及3.5 Flash-Lite)的更新中,谷歌推出了智能体视频理解(Agentic Video Understanding)功能。

该技术改变了过去按固定帧率(如默认1 FPS)全量摄入视频的静态模式。通过引入智能体循环(Agentic Loop),模型可以根据用户提问,自主决定观看的区域、播放速度,并按需调取画面、音频或字幕。



图注: Gemini 3.7 Flash 在 Minerva、1H-VideoQA、LVBench 三个基准测试中,Token 消耗最高降低88.0% 以及准确率最高提升7.2%的具体对比数据

在API基础Token单价保持不变的前提下,这种按需调取的计算优化使输入Token消耗最高可降低88%,开发者综合分析成本最高可降低66%,同时理解质量最高提升7%。这一能力已应用在亚秒级时刻检索、长视频“大海捞针”搜索、动态异常检测以及动作物体计数等场景中,未来还将接入Gemini App和YouTube 的“Ask YouTube”功能。


    24小时新闻排行榜更多>>
  1. 超级圣婴现象强化,纽约今年迎暖冬
  2. 赵世勇张忠押解刘建洋 习近平储君“抢滩”陆家嘴
  3. 中国农业多厉害,人均农业GDP超美
  4. 《富爸爸》作者自爆"负债12亿":有钱人都这样玩
  5. 习近平怕军队借机造反?中共救灾迟缓引质疑
  6. 49岁曾黎回老家种地,晨跑被骂不雅
  7. 德国财长被迫滞留美国
  8. 习近平健康有问题?央视剪掉舷梯上的17秒
  9. 习近平时隔十年再访埃及
  10. 孙割把胡锡进和舆论算得死死的
  11. 中国最惨的一代人!从月入4-5万 到街头摆摊卖水果!
  12. 中国人不穿皮鞋了,皮鞋厂怎么自救?
  13. “赛考斯”,为什么要加引号?
  14. 尼泊尔6岁女孩被埋废墟60小时后获救,首次开口了
  15. 台风“沙德尔”重创福建 洪灾汹涌有人在泥水中挣扎
  16. 西交利物浦大学两所新学院亮相
  17. 老公战死伊朗,遗孀被克扣福利:因美国没宣战
  18. 浑身是泥:朱琳在老山“被三名越军追击”
  19. 苹果与Google联手更名安大略湖 美民众真实反应强烈
  20. 马克龙继女官宣新恋 男友小20岁 “和妈一样”引热议
  21. 180度大反转!在被美国驱逐后,他彻底改口了
  22. 中国记者到了尼泊尔以后,采访能力突然"恢复"了?
  23. “SaaS末日”幸存者数量惊人
  24. 汇丰警告:这次亚洲“风暴眼”不在汇市
  25. 首届全球治理天津论坛举行
  26. 德州野火已烧毁9万英亩,恢复恐需三年
  27. “两边阵营都很愤怒,川普情况不太妙”
  28. 美推铸造学校,多国企业领袖授课
  29. 黄之锋:从学运领袖到国安法囚犯,重获自由未有期
  30. 马克龙妻42岁女儿恋小20岁鲜肉!母女都谈"姐弟恋"
  31. 普京向习近平提议:11月举行三方会晤
  32. 又一中国男子ICE拘留后死亡
  33. 黄仁勋:英伟达今年在美投入近万亿美元
  34. 景甜保卫战?大佬纷纷下场对战孙宇晨 她人缘这么好?
  35. 地底惊现异常,火星再添谜团
  36. 不吃晚饭的人,最后都怎样了?
  37. 政府专机又趴窝 德国副总理兼财长被迫滞留美国
  38. 乌克兰离奇“特工内战” 两大情报机构竟在街头火拼
  39. 美军已完成新一轮对伊打击
  40. 能“光合作用”的生物?罕见的盗食质体
  41. 黄之锋被关押六年:从学运领袖到国安法囚犯
  42. 马斯克预言:AI一年半内“碾压”人类
  43. 加拿大CEC降至521分,邀请人数翻倍
  44. 黄之锋身形消瘦出庭认罪 已服刑多年 原本明年出狱
  45. 美财长警告各界“闪远点”!下一轮制裁瞄准3大领域
  46. 3天4尸,警察离奇结案,恐惧笼罩韩国济州岛
  47. 炸药无人机闯德机场,欧盟召见俄特使
  48. 中国书画名家——苏葆桢
  49. 高盛:AI淘汰赛开打,赢家通吃数据与工作流
  50. 告别Chatbot,AI同事时代开启
  51. 张又侠被免职 引发军方新一轮愤怒 爆退休将领不接电话
  52. 贝森特指G20中仅中方反对提“廉价出口”不可持续
  53. 油管还没拔 加油车竟开走了 纽约机场柄航客机受损
  54. 幸存者讲述在大峡谷洪水中的生死5小时
  55. 日本拟向菲印转让老旧军舰 借防务网络制衡中共
  56. 谷歌上新两款Gemini 3.8
  57. 苹果新CEO薪酬曝光,比库克还高
  58. 月之暗面秘密交表,正式启动IPO
  59. 伊朗袭击致“多名美方人员死亡”
  60. 邵氏时期武打巨星陈观泰逝世 疑因脑出血抢救不治