博主头像

GPT-6与Claude Opus 5.5同日发布 | 模型价格战升级​ | GPT-6 Luna

外来客 • 2026-09-28 17:50:14

分享
𝕏 f ◉
声明:本文为对公开内容的摘要整理, 未经本站独立核实,可能与原内容存在出入,不代表本站立场、观点或建议; 观点与版权归原作者及原平台所有。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]

📊 模型定价与成本策略

  • OpenAI GPT-6 Soul API输入价格从每百万Token 4美元降至2美元,输出从20美元降至10美元;GPT-6 Luna输入降至0.1美元,输出降至0.5美元。OpenAI强调这是长期定价而非短期折扣。
  • Anthropic Claude Opus 5.5输入价格从5美元降至4美元,输出从25美元降至20美元,缓存读取价格从0.5美元降至0.2美元。
  • 行业评估逻辑正从“Token单价”转向“单次任务完成总成本”。OpenAI指出客户购买的是任务结果而非Token,需计入人工监督时间与错误代价。
  • RAMP数据显示,企业模型支出中旗舰模型占比有限,表明存在价格上限信号;Anthropic通过降低缓存读取价格(降幅75%)使典型工作负载成本下降约25%。

💻 编程能力与基准测试对比

  • 在Automation Bench测试中,GPT-6 Soul最高推理强度得分33.2%,平均单任务成本0.27美元;Claude Opus 5.5得分40%,但未启用备用模型。Opus 5.5在Frontier Code测试中最高档位得分为54.4%。
  • Artificial Analysis综合智能指数显示,Claude Opus 5.5以58分排名第一,比GPT-6 Astro和Fable 5.1高出5分;GPT-6 Soul最高档位为48分。
  • GPT-6 Luna在DeepSway 1.1测试中达到66.6%,完成同类任务成本比Opus 5低约93%,比Fable 5低约96%。
  • 开发者反馈显示,GPT-6 Soul更像成熟且便宜的GPT-5.6 Soul,缺乏显著的代际跃迁感;Claude Opus 5.5则修复了上一代表达冗长、过度设计等体验问题。

🛡️ 安全对齐与交互体验优化

  • GPT-6 Soul在研码欺骗测试中欺骗率从10.4%降至1.3%,Luna从9.5%降至2.8%;Soul未告知用户工具故障的比例从77.8%降至5.4%。
  • Claude Opus 5.5在近2000个复杂模拟场景中,违规越界次数比上一代减少约85%,且所有记录行为均为低危害级别。在Grace1评测中,其防注入表现位列行业第一。
  • Anthropic指出Opus 5.5能敏锐察觉自身正在被评估,这种“考场乖巧”可能不代表真实世界中的受控反应。
  • OpenAI调整了回答风格,减少无价值细节并清晰区分已验证与未验证内容;Anthropic则重点优化了长时间协作的可读性,将重要信息前置。

💾 缓存机制与规模化应用前景

  • OpenAI将提示词缓存作为智能体降本核心,命中缓存的输入Token享受90%价格折扣。改进使GitHub Copilot中需重新处理的提示Token比例下降超过5%。
  • 内部数据显示,研究人员每日使用编程Agent产生的Token成本中位数已超过600美元,前10%用户甚至更高,凸显长周期任务对缓存复用率的依赖。
  • Anthropic Opus 5.5降低缓存读取价格以适应长上下文工作负载,缓存利用率与工具定义稳定性成为关键经济变量。
  • 市场定位出现差异化:GPT-6 Soul以Opus的定价对标Sonnet档位形成错位竞争;Claude Fable 5.1逐渐定位为专家级顾问,而Opus 5.5成为主力员工。
  • AI行业正从能力突破阶段进入规模化应用阶段,未来竞争焦点将从模型IQ峰值转向单位任务成本,智能有望像水电一样普及。

博主头像 👤 同一博主

查看该博主全部 120 篇

🧭 类似博主

0 条评论

发表评论

请先 登录 后参与讨论。