一个被模型找到的医院漏洞
2026年9月30日,Google在官方博客中披露了一则案例:
在一次早期展示中,其新一代前沿模型 Gemini 4 Argon 发现了一个严重漏洞——全球多家医院使用的医疗软件中,敏感个人信息面临暴露风险。Google 特别强调,这是一个"此前前沿模型未能识别的严重风险"。
发现者是 Argon,而 Argon 目前的使用者只有一类:经过筛选的网络安全防守者。
同一天,Google 宣布了这款模型。没有注册页面,没有免费额度,没有面向公众的发布日期。这篇博客要回答的问题很具体:Argon 到底强在哪,Google 又为什么这样交付它。
Argon 的基本盘:为"长程工作流"而生
Argon 的发布作者是 Google DeepMind 首席 AI 架构师 Koray Kavukcuoglu。官方对模型的定位覆盖三个场景:
- 真实世界的软件工程
- 企业知识工作(如法律、财务)
- 网络安全防御
核心规格如下:
| 规格 | 数值 |
|---|---|
| 输出 token 上限 | 100万(此前为 6.4万) |
| 首发价格(输入) | 每百万 token 2 美元 |
| 首发价格(输出) | 每百万 token 10 美元 |
| 缓存输入价格 | 在输入价基础上优惠 95% |
| 首发期后价格 | 输入 4 美元 / 输出 20 美元(每百万 token) |
一个值得停留的数字是输出上限:从 6.4万提升到 100万,15 倍以上的跨越。Google 表示模型"能够在复杂的长程工作流中维持深度推理",单次可生成数十万 token。换句话说,Argon 的目标负载不是"回答一个问题",而是"连续干几小时活"——审查整个代码库、迁移数十万行代码、产出长篇研究报告。
能力证据一:安全领域的实战成绩
Argon 在网络安全防御端的表现,是 Google 着墨最多的部分。
Wiz 的医院软件案例。 Wiz 是 Google 今年早些时候收购的网络安全公司,其 Scan for Good 项目免费为关键公共基础设施寻找并修复高风险漏洞。Argon 在该项目中发现了前述医院软件漏洞。Google 未披露受影响的具体软件名称,也未说明该问题是否已被修复。
公开基准。 据安全媒体 SecurityWeek 报道,在漏洞修复基准 CWE-bench v1(由 Collinear AI 开发)上,Argon 以 68% 的成绩并列第一,与 OpenAI 的 GPT-6 Astra 和 xAI 的 Grok 4.7 打平。
内部基准。 在 Google 自建的漏洞发现基准上,Argon 在 20 种编程语言编写的复杂代码库中识别出各类漏洞;在 Wiz 内部的黑盒渗透测试基准(针对无源码的在线系统)上,Argon 在攻击面发现、漏洞识别和概念验证生成方面均优于上一代 Gemini 3.8 Flash Cyber。
对于开发者而言,"自主发现、验证并修复关键软件漏洞"不再是一个概念描述——它是有基准分数和实战案例支撑的能力。
能力证据二:Google 内部已经在大规模使用
Argon 在 Google 内部的三个使用案例,分别对应三种不同的"长程工作流"。
量子算法优化。 Argon 帮助量子计算团队优化了限制关键应用性能的子程序的时空资源(量子比特数 × 门数)。在其中一个示例中,几分钟内将结果提升了 40%(相对已发表的基线)。
数据中心内存优化。 一组 Argon 智能体分析了全机群的性能遥测数据,自主识别并应用内存优化,全面推广后可释放超过 300 TiB 内存;Google 估计总节省潜力在 500 TiB 到 1 PiB 之间。
大规模代码迁移。 Argon 智能体正在 Google 内部推动 C/C++ 代码库向 Rust 的迁移,规模从核心库 re2、libgav1 的数万行代码,到 Fuchsia Zircon 内核的 80 万行以上。Google 强调,由于这些系统的关键性,如此大规模的重写正在接受严格的自动化与人工审计、仿真测试和评审后才会进入生产环境。在 libgav1(Google 开源的视频解码库)项目中,Argon 智能体在现有 Rust 移植版的基础上,通过多轮 profile 引导实验和编译器输出分析,替换了 3.2 万行 SIMD 代码。
这组案例的共同点:模型的产出不是文档或建议,而是直接进入生产环境的代码变更——当然,伴随着严格的人工审核流程。
交付方式:Fairwind 计划与"去护栏"释放
能力讲完,再看 Google 选择的交付方式。
第一站是 Fairwind 计划。 该计划于2026年9月初启动,面向的对象是政府机构、Google Cloud 客户和网络安全合作伙伴,启动时已有超过 650 家参与方。它最初组合了 Gemini 3.8 Flash Cyber 模型与 Google 的 CodeMender 工具链(负责发现、验证和修复漏洞),Argon 发布后成为该计划承载的新前沿模型。
争议点在"去护栏"。 Google 在官方声明中明确表示:
"对于可信防守者和我们自己的内部团队,我们将以不带网络安全护栏(cyber guardrails)的方式释放 Argon,使其能够发挥完整的前沿级网络安全防御能力。"
普通用户未来拿到的版本是否带护栏、护栏具体内容是什么,Google 暂未详细说明。但"同一模型、不同安全配置、按对象交付"的机制,是这次发布中最值得注意的设计。
开放路径是分阶段的。 Google 的表述是:先向付费 API 客户和 Google AI Ultra 订阅用户开放,然后是开发者、企业和消费者,"尽快"推进但未给出日期。官方博客还提到,Google 正在参与美国政府的自愿性预发布模型访问流程;据 SecurityWeek 报道,包括 Google 在内的多家 AI 公司于9月29日签署了一份自愿性安全协议,涵盖预发布评估与针对非预期入侵的防护措施。
行业坐标:密集发布期中的特例
把 Argon 放回行业节奏里看。
根据大模型发布追踪站点 LMMarketCap 的统计,过去30天内有 25 家提供商发布了 61 款新模型。就在 Argon 发布的前后几天:9月28日 Anthropic 发布 Claude Sonnet 5.5,9月29日 OpenAI 发布 GPT-6.1 Sol 系列,9月30日 Google 发布 Gemini 4 Argon。
区别在于获取方式:GPT-6.1 Sol 和 Claude Sonnet 5.5 面向各自的付费用户开放,而 Argon 第一批用户是白名单式的"可信防守者"。同一周的行业发布会,第一次出现了"同为前沿模型、交付逻辑完全不同"的对照。
对开发者意味着什么
第一,100万 token 输出上限定义了新的任务类型。 当模型单次可以输出数十万 token,"让模型连续工作一小时"类任务(全库安全审计、大规模语言迁移、深度研究报告)在技术上变得可行。评估这类应用时,推理成本、超时容忍度和人工审核流程需要重新设计。
第二,定价给出了前沿能力的参考坐标。 首发价每百万 token 输入 2 美元、输出 10 美元,首发期后翻倍至 4/20 美元。缓存输入 95% 的优惠幅度,说明长上下文、多轮调用场景是官方重点优化方向。
第三,"当前开放到哪一层"成为评估模型的新变量。 过去评估一个模型看性能基准就够了;现在还需要问:这个基准分数对应的版本,我用得到吗?它带不带护栏?这类问题今后会越来越多地出现在技术选型讨论中。
第四,网络安全是前沿模型落地最快的高价值场景之一。 Argon 的案例(发现前代模型漏掉的医院高危漏洞、CWE-bench 并列第一)说明,在防御端,前沿模型已经产生可验证的实战产出。这类能力的两用属性,也意味着相关的获取门槛短期内不会降低。
结语
Gemini 4 Argon 的发布,把一个过去很少被公开讨论的问题摆到了台面上:当模型强到可以自主修改 80 万行内核代码、发现医院软件中的高危漏洞时,"谁先拿到它"就不再是一个营销问题。
Google 的答案是防守者优先、分阶段开放、按对象配置安全护栏,并且把整个逻辑写进了官方博客。无论你是否认同这种交付方式,它都代表了前沿模型走向基础设施化过程中的一个真实节点。
下一次看到一个"最强模型"发布时,值得先问两个问题:它能干什么?以及,它现在先给了谁?
参考来源: