NeFut Logo NeFut
EN 管理员登录

[AI造物主] Gemini 3.8 Flash 与 Flash Cyber 发布概述

发布于:2026-09-05 22:00 最后更新:2026-09-06 01:02
#algorithm #AI #Machine Learning

Gemini 3.8 系列在 3 周前的 3.7 Flash 基础上推出两款新模型:Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber。两者共享同一核心智能,并通过长循环的 agent 机制递归评估与优化模型输出。

Gemini 3.8 Flash 侧重长时程编码和自主代理任务,性能接近更高价位的前沿模型,在 DeepSWE v1.1、Vals Finance Agent V2、Harvey 法律代理基准等场景中均显著超越 3.7 Flash,HLE‑Verified 达到 54.9%。模型在复杂任务上会主动增加推理步数并迭代调用工具,必要时会消耗更多 token;若对算力敏感,可切换到低努力模式或继续使用 3.7 Flash。该模型还能在 Google Antigravity 环境中仅凭单一提示生成 3D 解谜游戏、DOS 版 Google Maps、基于 USGS 数据的地形图以及硬件拆解可视化等交互式示例。

Gemini 3.8 Flash Cyber 面向受信任的防御者,加入 Fairwind 计划,以同等速度和成本提供前沿的漏洞发现与自动修补能力。它在 CyberGym 基准上实现业界领先的自主漏洞检测,在覆盖 20 种语言的内部评测中成功率超过 70%。在 CWE‑Bench 上的 pass@1 为 47.2%,几乎与最高前沿模型持平但成本更低。

实际应用中,Chrome 安全团队报告该模型产生的正确补丁数量是商业大模型的 2.6 倍,Wiz 的渗透测试召回提升 7.5‑9.7% 且成本降低 2.3‑5.2 倍,Google Cloud 漏洞研究团队在不到 2 小时内发现了原本需数月才能定位的关键漏洞。

安全方面,3.8 Flash 在化学、生物、放射和核(CBRN)以及网络攻击领域加入使用限制;3.8 Flash Cyber 则提供更宽松的网络安全防护措施,仅向可信防御者开放。模型在 Gray Swan 测试中的提示注入鲁棒性也有显著提升。

开发者可通过 Google AI Studio、Android Studio 或 Stitch 使用 3.8 Flash,企业版在 Gemini Enterprise 中提供,消费者可在 Gemini App、Google Search AI 模式和 Google Sheets 中使用。Cyber 版通过 Fairwind 计划向政府、关键基础设施运营商和软件维护者开放,申请入口已上线。

点评

原文链接: https://deepmind.google/blog/introducing-gemini-3-8-flash-and-38-flash-cyber/

下一篇:没有了
[h] 返回首页