
9 月 2 日谷歌同时发布了两款模型Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber。前者继续干编程、智能体这类常规活后者专门负责发现和修复软件漏洞而且不放进普通 API只通过一个叫 Fairwind 的受控计划给审核通过的机构使用。这是谷歌六周内第三次更新 Flash 系列。大模型卷完写代码开始卷找代码毛病了。技术本质同一个底座两种安全边界从公开信息看两个版本共享基础能力差异在用途和安全设置。普通版 3.8 Flash 定位是面向编程和智能体的主力工作模型支持文本、图片、音频、视频、PDF 输入上下文约 100 万 token单次最多输出约 6.5 万 token带代码执行、函数调用、文件搜索、搜索增强和结构化输出等工具能力。价格延续 3.7 Flash输入每百万 token 0.75 美元、输出 3.75 美元据报道该价格执行到 2026 年底2027 年起上调。长任务能力是这次宣传的重点。在长周期软件工程测试 DeepSWE v1.1 上按谷歌公布的口径3.8 Flash 拿到 73.7%接近 Claude Opus 5 的 74.0%高于 GPT-5.6 Sol 的 72.7%。但同一张表也显示它并非全面领先在更接近真实终端操作的 Terminal-bench 4.0 上只有 19.1%而 Claude Opus 5 是 51.8%、GPT-5.6 Sol 是 37.3%。跑分这事看哪张表差别很大。Cyber 版则是完全围绕安全场景做的发现漏洞、分析代码风险、生成修复补丁。谷歌公布的测试里Cyber 版在 CyberGym 基准的 C/C 漏洞发现任务上 Pass1 是 86.2%上一代 3.5 Flash Cyber 是 77.5%在覆盖 20 种编程语言的内部测试中发现漏洞的成功率据报道超过 70%。外部补丁测试 CWE-Bench 上首次修复通过率 47.2%和头部模型 Fable 5 的 47.8% 很接近但单次成本更低。另有报道称Chrome 安全团队实测它生成的正确修复补丁数量是此前最好商业模型的 2.6 倍谷歌云漏洞研究团队用它在两小时内发现了一个关键漏洞——以往人类专家找这类漏洞通常要几个月。这些数字基本是厂商口径参考就好但方向是明确的。变了什么没变什么变的是发放方式模型开始按风险分级。以前的安全限制主要在对话内容层面谁都能调 API。而 Cyber 版这种能自主挖洞、写补丁的能力是典型的双用途技术防守方能用来提前排雷攻击方也能拿去找可利用的缺陷。所以谷歌把它放进 Fairwind 计划做受控访问优先考虑政府和安全主管机构、医疗能源通信金融等关键基础设施运营方、影响大量下游用户的核心平台以及做防御性评估的安全研究机构获准机构要做身份认证、抗钓鱼多因素认证和访问控制且不得转售共享。这套安排说明大模型安全治理正在从内容拒绝转向准入 审计谁能用、模型能连什么工具、操作有没有留痕成了新的安全机制。没变的是老问题依然存在。谷歌模型卡自己承认3.8 Flash 的多语言安全自动评估指标相比 3.7 Flash 回退了 5.4 个百分点官方解释是误报居多但值得观察模型卡还提示高推理强度下响应可能变慢、token 消耗上升。也就是说Flash并不保证每种任务都快和便宜该算的账还得算。对普通开发者意味着什么对我们这种实际干活的人来说最直接的变化有两层。第一层便宜的长任务模型把 agent 类应用的成本门槛又压低了一截。按官方单价粗算# 估算一次长任务输入50万token 输出2万token的裸成本单价取官方公布值input_price_per_m0.75# 美元/百万token输入output_price_per_m3.75# 美元/百万token输出cost0.5*input_price_per_m0.02*output_price_per_mprint(f单次裸成本约 ${cost:.2f})# 单次裸成本约 $0.45注意这没算推理等级上调和高强度工具调用带来的增量消耗。做 agent 的同学建议按任务完成率 × 单任务实际成本算总账别只盯单价。第二层Cyber 版虽然普通开发者拿不到但AI 辅助挖漏洞这个能力方向基本确定会向下渗透变成通用安全工具能力。做安全、运维或者维护开源项目的可以提前关注这类能力的落地节奏。想自己练从静态扫描工具 大模型辅助代码审查的本地组合开始最省钱。另外提醒一句挖洞能力是双刃剑团队里引入这类工具权限和审计流程最好先立起来——工具越强管理越得跟上。这周大模型发布密度很高谷歌这次双版本、分级开放的打法能不能被验证有效还得看 Fairwind 计划里跑出来的实际效果。你怎么看评论区聊聊。