起源:普京访华筹备工作进入最后阶段作者
GPT-5.6正式颁布,,Codex与ChatGPT合二为一
这两天,,AI 行业迎来了一轮密集的产品颁布。。先是 xAI 颁布 Grok 4.5,,持续强化其在编码和 Agent 场景上的竞争力;后有 Meta 及锋而试,,推出 Muse Spark 1.1,,并初次向开发者盛开 Model API,,起头正面抢夺企业和开发者市场。。
但就在这一轮竞争进入白热化之际,,OpenAI 正式颁布 GPT-5.6 系列模型,,并同步实现 ChatGPT 产品架构的一次重要调整,,再次将行业关注点拉回自己身上。。经过 12 天确当局审查与受限预览,,OpenAI 于本地功夫 7 月 9 日正式向全球用户盛开 GPT-5.6 系列模型——Sol、、、Terra、、、Luna 三款同时上线。。
(起源:X)
与此同时,,独立运行近一年的 Codex 利用正式并入 ChatGPT 桌面端,,与新推出的 ChatGPT Work 智能体共同组成统一产品入口,,整合了对话、、、编码以及长程工作执行等能力。。这也是 OpenAI 自今年 4 月颁布 GPT-5.5 以来规模最大的一次产品更新,,模型能力、、、产品架构和贸易战术三条线同措施整。。
当局审查实现,,GPT-5.6 正式全面盛开
6 月 26 日,,GPT-5.6 初次以受限预览大局上线,,仅向约 20 家通过美国当局审查的合作机构盛开。。据多家媒体报道,,白宫国度网络安全总监办公室(ONCD)和科技政策办公室(OSTP)以为,,旗舰模型 Sol 已具备较强的网络安全能力,,因而要求 OpenAI 在正式颁布前实现额外安全评估。。
官方数据显示,,Sol 在内部网络攻击评测中的得分达到 96.7%,,在 ExploitBench 缝隙利用基准上的成就也从 GPT-5.5 的 47.9% 提升至 73.5%。。美国商务手下属 AI 尺度与创新中心(CAISI)参加了技术评审,,OpenAI 工程师也前往华盛顿与当部门门进行了技术互换。。
固然整个流程仍属于企业自愿参加,,但从外界来看,,美国当局已经起头形成针对前沿 AI 模型"颁布前评估"的治理框架。。对于将来能力更强的基础模型而言,,这种安全审查机制很可能逐步成为行业常态。。
不再卷"最强",,而是卷"最划算"
这次 GPT-5.6 家族选取了全新的定名系统。。
Sol 定位旗舰模型,,Terra 主打机能与成本平衡,,Luna 则面向更高性价比场景,,名称别离来自拉丁语中的太阳、、、大地和月亮。。数字代表模型代际,,Sol、、、Terra、、、Luna 则成为持久保留的能力层级,,将来能够别离独立迭代。。
价值系统也体现了这一思路。。Sol 每百万 Token 输入价值为 5 美元、、、输出 30 美元;Terra 别离降至 2.5 美元和 15 美元;Luna 则进一步降低至 1 美元和 6 美元。。OpenAI 同时调整了 Prompt Cache 的计费方式,,缓存写入按尺度输入价值的 1.25 倍收费,,读取价值享受折扣,,并支持开发者手动设置缓存断点,,使持久运行的 Agent 成本越发可预测。。
从官方颁布的数据来看,,GPT-5.6 的主题卖点并不是绝对机能,,而是机能、、、速度和成本之间的综合平衡。。
在 Artificial Analysis 编程智能体指数上,,Sol 获得 80 分,,超过 Claude Fable 5,,同时输出 Token 数量不到后者的一半,,运行功夫缩短约一半,,整体成本约低三分之一;Terminal-Bench 2.1 和 DeepSWE 等编码工作也获切当前最佳成就。。Terra 和 Luna 别离超过 Claude Fable 5 与 Claude Opus 4.8,,在速度和成本方面同样拥有显著优势。。
不外,,在综合推理能力上,,Anthropic 依然维持当先。。在 Artificial Analysis 综合智能指数中,,GPT-5.6 Sol 得分 59,,仍低于 Claude Fable 5;SWE-Bench Pro 软件工程评测中,,Sol 为 64.6%,,而 Claude Fable 5 和 Mythos 5 均超过 80%;FrontierMath Tier 4 数学测试中,,Sol 的成就甚至低于 GPT-5.5。。
这也反映出 OpenAI 这次产品战术的变动。。相比追求每一项基准测试都维持第一,,GPT-5.6 更强调开发者最常使用的编程、、、Agent 和企业利用场景,,在保障能力的同时进一步压低推理成本和响应功夫。。
萦绕这一指标,,GPT-5.6 还参与了几项新的能力。。
Ultra 模式允很多个智能体并行工作,,默认启动 4 个 Agent,,最多可扩大至 16 个,,以更多推算资源换取更好的了局;Max 模式则赐与模型更长思虑功夫,,提高复杂推理工作的不变性。。
API 层面推出的 Programmatic Tool Calling 也值得关注。。从前,,开发者必要在利用层设计复杂的工具挪用流程;此刻模型能够自行编写法式,,对工具进行调度、、、处置一时数据并组织执行流程,,从而进一步降低复杂 Agent 的开发成本。。
Codex 并入 ChatGPT
模型之外,,OpenAI 对产品系统也进行了近年来最大规模的一次整合。。
从 7 月 9 日起头,,独立运行近一年的 Codex 正式并入新版 ChatGPT 桌面利用。。新版利用提供 Chat、、、Work、、、Codex 三种模式,,用户无需切换分歧软件,,即可实现日常对话、、、代码开发和长功夫复杂工作。。
原有 Codex 用户能够保留项目、、、配置和工作流,,也能够持续使用 Codex 图标或将其设为默认视图;此前的 ChatGPT 桌面利用则改名为 ChatGPT Classic。。与此同时,,独立 Atlas 浏览器终场更新,,其智能体浏览能力被整合至 ChatGPT Chrome 扩大。。
(起源:OpenAI)
事实上,,这一整合早已有迹?裳。。今年 5 月,,OpenAI 已将 ChatGPT 消费产品团队与 Codex 团队归并,,由结合首创人 Greg Brockman 统一掌管产品研发。。
更直接的原因则来自用户行为。。OpenAI 披露,,Codex 每周活跃用户已超过 500 万,,其中超过 100 万人并非用于编程,,而是在处置文档、、、分析资料、、、规划项目等通用工作。。
在这一布景下,,OpenAI 还同步推出了 ChatGPT Work。。它可能跨多个利用网络高低文信息,,将复杂指标拆分为多个步骤,,并持续工作数小时,,最平天生文档、、、电子表格、、、演示文稿甚至可直接分享的网页利用。。相比传统谈天机械人,,它更靠近一个可能持久执行项主张智能体。。
这一系列调整也意味着,,OpenAI 正在逐步烧毁多个独立 AI 产品并行发展的思路,,而是但愿将 ChatGPT 打造成所有 AI 能力的统一入口。。
颁布会上还有一个细节引发不少关注。。OpenAI 泄漏,,GPT-5.6 家族中最小的 Luna 模型,,其后训练流程已齐全由旗舰模型 Sol 自主实现,,蕴含寻找可用 GPU、、、确定训练配置、、、编写启动剧本以及确认工作执行等全过程。。与此同时,,OpenAI 暗示,,从前六个月内部用于代码推理钻研的推算资源增长约 100 倍,,智能体 Token 使用量增长约 22 倍,,并初次公开了衡量 AI 自主研发能力的 RSI(递归自我改进)指数,,GPT-5.6 Sol 相比 GPT-5.5 提升了 16.2 分。。
这些数据批注,,AI 已不仅是在援手开发者写代码,,也起头越来越多地参加下一代 AI 系统自身的研发流程。。
参考链接:https://openai.com/index/gpt-5-6/
@徐佳治:钢钢钢钢钢钢筋好多大,,国乒世乒赛裁减赛男女团敌手确定@杨淑筠:从摩尔到韬定律的六十年
@方家瑜:两弹一星元勋王希季院士迎105岁生日