一、背景:一个被”藏起来”的模型终于登场

2026年8月1日,OpenAI 曾用一种极其罕见的方式向外界展示下一代模型 Astra——没有发布会、没有产品界面,只有 10 篇由数学界顶尖学者认可的证明手稿。当时它还是一张”数学名片”。仅仅一个月后,9月3日,Astra 以 GPT-6 Astra 的正式产品名称全面亮相,被 OpenAI 称为”代际级跳跃(generational leap)”。

与以往不同,这次 GPT-6 Astra 并非无限制开放。它是 OpenAI 首个达到内部”Critical”(关键级)网络安全能力阈值的模型——这一门槛触发了公司 Preparedness Framework(准备度框架)下的最高级别发布审查。因此它的先进能力被置于受控的 Daybreak 计划中,分阶段向企业与研究伙伴开放。换句话说,OpenAI 第一次因为”太强”而主动给模型上了锁。

二、核心规格:105万上下文与”计算机使用”霸榜

GPT-6 Astra 的关键参数如下:

  • 上下文窗口:约 1,050,000 tokens(1.05M),最大输出 128,000 tokens
  • 定价:输入 $10 / 输出 $50 每百万 tokens,与上代保持一致的亲民姿态
  • 计算机使用(Computer-Use):在 OSWorld 2.0 基准上达到 **72.6%**,单任务耗时较上代 Sol 降低约 47%;ChatGPT 中的”电脑操作”速度提升近一倍

OpenAI 明确表示,GPT-6 Astra 是”迄今最强的软件工程模型”。在需要完整状态、长链推理的托管 harness 下,它还能 saturate FrontierMath Tier 4(97.6%)与 ExploitBench(100%),ARC-AGI-3 抽象推理达到 99.9%——不过这些顶级分数高度依赖”有状态”的昂贵调用方式,无状态的普通 API 调用得分会明显偏低。

三、技术分析:为什么”Critical”阈值如此重要

网络安全阈值的意义,不在于跑分高低,而在于能力与风险的临界点。OpenAI 的 Preparedness Framework 将模型在攻防场景下的潜在破坏力分级,”GPT-6 Astra”是第一个被判定为达到 Critical 级别的产品。这意味着它具备自主发现漏洞、构造利用链的高风险能力,一旦流入不受控环境可能被恶意使用。

因此 OpenAI 采取了与”全量开放”相反的路线:

  1. 分阶段部署:先向 Daybreak 计划中的企业客户与研究伙伴开放
  2. 能力门控(gating):高级网络安全功能需通过权限审批才能启用
  3. 强化发布前防护:在模型交付前嵌入更强的对齐与安全约束

这一做法标志着前沿实验室的叙事从”谁先开源/谁先全量”转向”谁敢在强能力下守住安全闸门“。可控性本身,正在成为比参数规模更稀缺的竞争维度。

四、影响与未来展望

GPT-6 Astra 的发布释放了几个清晰信号:

  • 软件工程进入”自主攻坚”时代:超长上下文 + 快速计算机使用,使模型能独立啃下整段代码库与复杂调试任务
  • 安全成为产品化的硬约束:当能力达到 Critical,”如何安全地给出来”与”如何做得更强”同等重要
  • 企业级访问范式转变:门控 + 分阶段开放,将催生一批”受信任 AI 操作员”角色

可以预见,未来的模型竞争不再只是基准分数的军备竞赛,而是能力、可控性与信任机制的三重博弈。GPT-6 Astra 把这道题摆在了台面上——而答案,才刚刚开始书写。