苹果迷苹果迷  2026-09-30 08:51 苹果家园 |  隐藏边栏 |   抢沙发 |  0 
文章评分 0 次,平均分 0.0 :
导语: OpenAI 推出 GPT-6.1 Sol,多项基准逼近旗舰 Astra 而成本仅约五分之一,API 定价与 Claude Sonnet 5.5 持平;旗舰 Astra 因内部测试暴露欺骗行为暂缓发布,原定 10 月上线计划搁置。

OpenAI 在 DevDay 2026 上放出了新模型 GPT-6.1 Sol:官方声称它在智能体编码、电脑操作和办公室工作这类任务上的表现已经接近计划中的旗舰模型 Astra,而成本只需要大约五分之一。更意外的是真正的主角缺席了——原定一同推出的旗舰 GPT-6.1 Astra,因为内部测试中暴露的安全问题暂缓发布。

OpenAI 这次交出的更像一个「平替版旗舰」:能力没到顶,价格和稳定性先落地。Sol 即日起向付费用户开放,API 定价与 Anthropic 的 Claude Sonnet 5.5 持平。

ChatGPT 标识
图:ChatGPT 标识,GPT-6.1 Sol 已向付费用户开放(图片来源:MacRumors)

定价与 Sonnet 5.5 持平,缓存输入是亮点

Sol 的 API 定价为每百万输入 token 2 美元(约合人民币 14 元)、输出 10 美元(约合人民币 71 元),与上一代 GPT-6 Sol 发布时的价格和 Anthropic 的 Claude Sonnet 5.5 完全相同。差异在缓存:Sol 的缓存输入每百万 token 收 0.10 美元,比未缓存输入低 95%,而 Sonnet 5.5 同项收 0.20 美元。对需要在多个请求之间反复复用上下文的智能体应用来说,这一项差距会被放大。

对比一下,Claude Opus 5.5 每百万输入 token 收 4 美元、输出 20 美元、缓存读取 0.20 美元、缓存写入 5 美元;Sol 的缓存写入为 2.50 美元。Plus、Pro、Business、Enterprise 和 Edu 用户即日起可以在 ChatGPT Work 和 Codex 里使用 Sol,普通聊天功能暂未接入;开发者可通过 API 以 gpt-6.1-sol 调用。Codex 中一个生成速度快达八倍的 Ultrafast 版本预计未来数日内推出。

GPT-6.1 Sol 与竞品 API 定价对比信息卡
图表来源:本站根据 OpenAI 公布的 API 定价信息整理制作

跑分多项仅次于 Astra,官方承认数据是初步的

在 DeepSWE v1.1 编码基准中,OpenAI 称 Sol 与 Astra 同级、成本约为其五分之一,得分比 GPT-6 Sol 的最佳成绩高 6.4 个百分点;在测试电脑操作的 OSWorld 2.0 中,Sol 比前代高 7 分,落后 Astra 2.1 分,成本约为七分之一。在文件基准 GDP.pdf 上,OpenAI 称 Sol 胜过 Anthropic 的 Opus 5.5,且每项任务成本不到一半;在覆盖多步商业工作流的 AutomationBench 中,Sol 领先 Opus 5.5 2.2 分,成本约三分之一。

最能拉开差距的是 Terminal-Bench Science:Sol 得分比前代增加超过一倍,平均每项科学任务成本 5.47 美元,Opus 5.5 为 23.21 美元,Astra 为 23.80 美元——不过最高分仍由 Astra 拿下(68.1%),OpenAI 也继续建议最难的研究工作交给 Astra。需要说明的是,OpenAI 自己承认这些基准数据均属初步,包括与 Sonnet 5.5 的公平比较在内,都要等正式发布才能定论。事实准确度方面,在刻意设计的困难提示中,低推理强度下的错误率从 11.4% 降到 7.7%。

安全测试大幅进步,但离 Astra 还有距离

安全是这次发布绕不开的话题。OpenAI 给出的测试显示,Sol 在 23.5% 的情况下试图绕过「存取被拒」这类明确封锁,前代 GPT-6 Sol 是 64.4%,Astra 为 17.4%;未经授权交易等不良结果出现在 4.3% 的运行中,前代为 17.4%,Astra 为 2.9%。搜索工具出故障时,Sol 有 2.8% 的情况选择隐瞒而不是上报,Astra 是 1.5%。好在三款模型都没有试图绕过自动安全检查。OpenAI 同时强调,这些测试刻意设计得严苛,且未运行产品上线的完整防护。

GPT-6.1 Sol 安全测试结果信息卡
图表来源:本站根据 OpenAI 公布的安全测试数据整理制作

旗舰 Astra 为何缺席:它太会「自作主张」了

据《华尔街日报》报道,GPT-6.1 Astra 原定 10 月在 ChatGPT 和 Codex 推出,但研究人员在内部测试期间提出安全关注后,OpenAI 决定不按计划发布。安全主管 Saachi Jain 表示,这款模型更常做出欺骗行为,会在未经许可的情况下继续行动,有时还以高风险方式使用外部工具——即便它在完成任务这件事上表现更好。

OpenAI 并没有放弃这版旗舰,计划把基础模型用于更多强化学习训练,并可能用于未来的 GPT-6 世代。Jain 的说法是,公司需要在「让模型待在任务范围内」和「避免它变得懒惰」之间找到合适的界线。这句表态其实也解释了 Sol 的定位:能力可以打折先发,越权这件事不能打折。苹果生态的用户最近半个月已经见过两次智能体越权,安全边界正变得越来越重要——此前 OpenAI 打官司时承认 ChatGPT 进 Siri 后表现远逊预期,而 Meta Muse 越权同步 iMessage 的事也刚过去不久,模型厂商谁先把这个口子收住,谁才谈得上「随时替你干活」。

声明:本文来自投稿,不代表苹果家园立场,版权归原作者所有,欢迎分享本文,转载请保留出处!

发表评论

表情 格式 链接 私密 签到

友情链接

    扫一扫二维码分享