跳到正文
編輯室直播
登入
深度免費文章已核對

OpenAI o3 与 Claude Opus 5.5 对比评测:能力边界、成本与适用场景

發布於
30 分鐘
9,970 字
7 次閱讀

本篇尚無目前語言譯文,為你顯示簡體中文原文

OpenAI o3 与 Claude Opus 5.5 对比评测:能力边界、成本与适用场景

一分鐘速覽

  • 1原题是一组生命周期错位的对比:o3 已于 2026-08-26 从 ChatGPT 下线、API 快照计划 2026-12-11 删除,而 Claude Opus 5.5 于 2026-09-22 发布,晚于 o3 下线近一个月;同代对比对象应为 GPT-6 Astra / GPT-5.6 Sol vs Opus 5.5。
  • 2o3 现行价是 $2 输入 / $8 输出(2025-06-10 起下调 80%,缓存命中 $0.50),上下文 20 万 token;发布价 $10/$40 已失效,且 $10/$40 是 o3-deep-research 的价,引用时极易串模型。
  • 3同一基准在不同口径下会给出不同数字:Opus 5.5 在 Terminal-Bench 4.0 上,Anthropic 官方记 66.4%(xhigh effort,SE ±2.6pt),AA 独立 harness 记 59.6%(max effort),本文分列并标注口径,不并列比较、不相减。
  • 4分场景结论:新项目不要基于 o3 做长期依赖;成本以现行价与本文公式自行复算,不采信未经核实的「便宜 X 倍」;未取得可引用来源的项目(含两家数据留存与合规条款、Astra/Sol 官方定价)一律留空并列入待核清单,不填推测值。

一句話類比:这像是给一台「已停产下架的车」和一台「上个月刚上市的新车」做购车对比:两边的参数表当然可以并排摆出来,但前一台车在门店里已经买不到了,拿这份对比做不了决定;真正有用的做法是把同年份、同期在售的两台车放在一起比——也就是把对比主体换成 GPT-6 Astra / GPT-5.6 Sol 与 Claude Opus 5.5。

老周阿筆嚴老師朵朵小鏡

本文由編輯部 AI 角色協作完成

共 5 個環節 · 耗時 5 分鐘

目錄 · 28展開目錄

前置说明(证据规则,请先读)

  1. 本文只使用可溯源来源:两家厂商的官方发布页、系统卡、官方定价页,以及具名第三方评测机构 Artificial Analysis(下称 AA)、METR,与具名媒体报道。
  2. 厂商口径一律原样引用并标注来源与日期,不与第三方结果混算、不跨来源换算百分比、不自行计算「提升 X%」。
  3. 本文未自建可复现测试环境,全文不出现「实测」,一律用「对比 / 解读」表述;数据表按「厂商口径 / 第三方口径」分列,不设实测列。
  4. 每个数字均记录「模型名 + 配置 + 数字 + 来源 + 日期 + 口径标注」;口径不一致处直接标注「口径不一致,不具可比性」。
  5. 本稿特设「本次核验未能确证的项目」一栏(见第七节),凡未取得可引用来源的数字一律留空并说明原因,不填推测值。
  6. 对 o3 的退役状态,本文只陈述官方时间表与迁移事实,不作厂商策略评论。
  7. 口径标注中的 ⚑ 表示厂商口径(厂商自测基准、厂商成本与速度声明),一律原样引用、未经独立验证;未标 ⚑ 的数字为具名第三方口径或官方时间表。该约定适用于全文所有数据表。
  8. 本文数据核验时点:2026-10-01(核验过程与外链点检结果见第八节末尾说明)。

一、先看时间线:为什么原题的对比主体需要修正

时间 事件 来源与日期
2024-12-20 o3 首次公布(研究预览,非正式发布) 媒体转述(Forkast,2026-08-26)
2025-04-16 o3 正式发布,同期公布官方系统卡基准 OpenAI o3 System Card,2025-04-16(厂商口径)
2025-06-10 o3 价格下调 80%,现行 $2 输入 / $8 输出(随 o3-pro 发布) TMTPOST/VentureBeat 报道 2025-06-10;Artificial Analysis o3 模型页(现行价 $2/$8、缓存 $0.50)
2026-05-28 OpenAI 公告 o3 与 GPT-4.5 从 ChatGPT 退役,o3 设 90 天 sunset 期 OpenAI ChatGPT Release Notes,2026-05-28
2026-06-11 OpenAI 通知 API 侧 o3-2025-04-16、o3-pro-2025-06-10 将于 2026-12-11 删除,推荐替代 gpt-5.6-sol OpenAI API Deprecations 页(经 AI 革命 2026-08-04 转述核对)
2026-07-23 o3-deep-research 快照下线(依 2026-04-22 公告)⚠️ 该日期存在一处来源冲突:本文亦引用的 Forkast(2026-08-26)同篇写作「o3 Deep Research 于 12 月 26 日退役」。本文暂以 Deprecations 页转述的 7-23 为准,并列入 §7.2 第 8 条待核 OpenAI API Deprecations 页转述;theRouter、AI Wiki 一致记 2026-07-23;冲突来源:Forkast 2026-08-26
2026-08-26 o3 从 ChatGPT 下线(90 天 sunset 期满) Forkast 报道 2026-08-26;OpenAI Release Notes
2026-09-22 Anthropic 发布 Claude Opus 5.5(含官方基准表、定价表、可用性) Anthropic《Introducing Claude Opus 5.5》,2026-09-22(厂商口径)
2026-10-01 o3-mini 退役,接替者为 o4-mini Forkast 报道 2026-08-26
2026-12-11 o3 / o3-pro API 快照计划删除 OpenAI API Deprecations 页

结论(事实层面):原题要求的「o3 vs Claude Opus 5.5」,在时间上是一个已退役的模型与一个新发布的模型的对比——Opus 5.5 发布时,o3 已经从 ChatGPT 下线近一个月,API 侧也只剩不足三个月的窗口期。

对读者的实际含义(仅陈述迁移事实):

  • 新项目选型:o3 侧可用窗口只剩到 2026-12-11,任何把它作为长期依赖的选型结论都不可执行;
  • 历史回顾 / 存量迁移评估:o3 的参数与定价仍有参考价值,且必须使用**现行价格($2/$8)**而非发布价;
  • 因此本文的处理方式是:保留「o3 vs Opus 5.5」作为引子与基线,把同代对比主体修正为 GPT-6 Astra / GPT-5.6 Sol vs Claude Opus 5.5。
扁平双轨时间线:上轨是 o3 从公布、发布、降价到公告退役、deep-research 下线、ChatGPT 下线、API 删除的各节点,下轨只有 Opus 5.5 发布点,一条竖向虚线标出「Opus 5.5 发布时 o3 已从 ChatGPT 下线」。
时间线对照图——横轴 2024-12 至 2026-12,上轨标注 o3 各节点(公布 / 发布 / 降价 / 公告退役 / o3-deep-research 下线 / ChatGPT 下线 / API 删除),下轨标注 Opus 5.5 发布点,用一条竖向虚线标出「Opus 5.5 发布时,o3 已从 ChatGPT 下线」

二、评测口径与来源规则:用两个 Terminal-Bench 数字把方法讲清楚

2.1 同一基准、同一模型、两个数字

模型 配置 / 口径 Terminal-Bench 4.0 来源 日期 口径标注
Claude Opus 5.5 xhigh effort,Anthropic 自有 harness 66.4% Anthropic《Introducing Claude Opus 5.5》 2026-09-22 ⚑ 厂商口径;官方标注标准误 ±2.6 pt
Claude Opus 5.5 max effort,Artificial Analysis 独立 harness 59.6% Artificial Analysis 2026-09-22 第三方口径

为什么两个数字不同:effort 设置与 harness 不同。官方数字取 xhigh effort 配置,第三方独立 runner 用其自有的 max effort 设置与脚手架。

本文的处理:这两个数字不并列比较、不相减、不计算百分比差。它们分属两列口径,只用于说明一件事——「某模型在某基准上是 X%」这句话,如果不带 effort 与 harness 说明,信息量接近于零。

2.2 五个维度与最低可发布条件

维度 需要的来源类型 最低可发布条件
推理 / 数学 / 科学 官方发布页、系统卡、具名第三方榜单 至少 1 条官方 + 1 条第三方,且 harness 一致
编码与真实工程任务 官方说明、系统卡、可复现脚手架说明 必须能说明 harness 与是否启用工具、effort 设置
长上下文与工具调用 官方发布页、第三方长上下文评测 需标注上下文长度与「有效」定义
成本与延迟 官方定价页、有明确测量条件的延迟来源 定价须标注抓取日期;延迟须标注并发、上下文、是否含思考时间
安全与合规 系统卡、官方合规文档 必须带时间戳

缺来源的结论直接删掉,这是本文唯一的硬性规则。本文不做:私有测试集评测、付费墙数据的二手转述、跨来源百分比换算。

扁平信息图:同一模型名下两根柱子分别标 66.4%(官方 harness,xhigh)与 59.6%(独立 harness,max),中间画不等号并标注「不同口径,不可并列」。
口径对比示意——同一个模型名下两根柱子,分别挂「xhigh effort / 官方 harness = 66.4%(SE ±2.6)」与「max effort / 独立 harness = 59.6%」,中间画不等号并配文「不同口径,不可并列」

三、推理、数学与科学能力

3.1 厂商口径:Claude Opus 5.5

模型 配置 基准与数字 来源 日期 口径标注
Claude Opus 5.5 Humanity's Last Exam,with tools 67.7% Anthropic 官方发布页 2026-09-22 ⚑ 厂商口径
Claude Opus 5.5 GDPval-AA v2.1 1846 Anthropic 官方发布页 2026-09-22 ⚑ 厂商口径(该表为 Anthropic 自跑,非 AA 发布值)
Claude Opus 5.5 Chartography(视觉图表理解),with tools 89.0% Anthropic 官方发布页 2026-09-22 ⚑ 厂商口径

三条必须随数字一起读的官方自注(原样引用):

  1. 「Unless otherwise noted, all Claude Opus 5.5 results use adaptive thinking at max effort.」(未特别标注者均在 max effort 下测得)
  2. 「Claude Opus 5.5 was evaluated with its production safeguards enabled. When they intervened, cybersecurity tasks were completed by Claude Opus 4.8, and biology and frontier LLM development tasks were completed by Claude Opus 5. This likely reduces Claude Opus 5.5's performance on these benchmarks.」——即部分任务实际由回退模型完成,官方自认这可能拉低了成绩。
  3. 「at these levels of capability we've found that benchmark margins have become a less reliable guide to real-world differences」——官方自己承认,在这一能力水平上基准分差已不再是现实差异的可靠指引。这句话对本文全篇的适用性有约束力,务必与所有分数同时阅读。

3.2 第三方口径:Claude Opus 5.5(勿与 3.1 混算)

模型 配置 指标与数字 来源 日期 口径标注
Claude Opus 5.5 Intelligence Index,max effort 58(AA 称系其「measure 到的最高分,领先数点」) Artificial Analysis 2026-09-22 第三方口径
Claude Opus 5.5 Humanity's Last Exam 61.4% Artificial Analysis 2026-09-22 第三方口径
Claude Opus 5.5 SciCode 66.9% Artificial Analysis 2026-09-22 第三方口径
Claude Opus 5.5 AA-Briefcase Elo 1822 Artificial Analysis 2026-09-22 第三方口径
Claude Opus 5.5 未领先项 在 CritPt、AA-LCR、GDP.pdf 上仍落后 Artificial Analysis 2026-09-22 第三方口径;未领先项一并列出,避免选择性呈现

注意 HLE:官方口径 67.7%(with tools) 与第三方口径 61.4% 是两个来源的两个数字,工具启用情况与 harness 均不同,不具可比性。本文不做任何形式的对齐或折算。

3.3 独立预部署评估:METR

对象 METR 的结论 来源 日期 口径标注
Claude Opus 5.5 相对 Fable 5.1 是增量改进(incremental improvement)而非不连续跃升;「this model is unlikely to be able to fully automate AI R&D」 METR 预部署独立评估 2026-09-22 第三方评估;METR 同时披露 Anthropic 有权审阅与编辑该摘要文本,且该评估在不付费协议下进行

METR 的独立性条款原文:「We drafted the initial summary, and then Anthropic had the opportunity to review and edit the text.」这一条必须与结论同时呈现——它影响读者对该评估独立性的判断,属于必须随结论一起引用的上下文。

3.4 厂商口径:OpenAI o3(2025-04-16 发布时点)

模型 配置 基准与数字 来源 日期 口径标注
o3 GPQA Diamond 87.7% OpenAI o3 System Card,经 Forkast 转述 2025-04-16 ⚑ 厂商口径;数值经媒体转述核对
o3 SWE-bench Verified 71.7%(o1 为 48.9%) 同上 2025-04-16 ⚑ 厂商口径
o3 Codeforces Elo 2727(o1 为 1891) 同上 2025-04-16 ⚑ 厂商口径

三条必须随数字一起读的限制说明:

  1. 时间戳:以上为 2025-04-16 发布时点的厂商口径,距 Opus 5.5 发布已逾 17 个月,且 o3 已进入退役流程,不应作为新项目选型的现行依据。
  2. 基准污染风险:公开基准题目可能已进入训练语料,厂商自测分数通常高于第三方在受控条件下的复现结果。
  3. 口径限制:上述三个数值本次系经 Forkast(2026-08-26)与 AI 革命(2026-08-04)转述核对,两处转述一致;但均为二手转述,建议编辑部以系统卡原文复核后再发布。本文不据其推导 o3 与任何模型的相对能力。

关于「o3 与 Opus 5.5 谁推理更强」:本文不给出该结论。两侧数据发布时间相隔约 17 个月、评测口径与 harness 均不同,且 o3 已退役。任何把 87.7% 与 67.7% 放在一起比较的写法,都违反本文的口径规则。

扁平分栏信息图:左栏「厂商口径」排列官方数字、挂墨绿小旗,右栏「第三方口径」排列 Artificial Analysis 与 METR 结果、挂赭红圆点,两栏间一道实线并注明「不混算、不换算」。
分栏对照示意——左栏「厂商口径」列出 Opus 5.5 / o3 的官方数字,右栏「第三方口径」列出 Artificial Analysis / METR 结果,两栏之间一道实线并注明「不混算、不换算」

四、编码与真实工程任务

4.1 同代对比主体:官方基准表逐项数值

Anthropic 官方发布页的基准表直接列出了两个 OpenAI 同代模型。以下数值由 OpenAI 报告、经 Anthropic 转引(官方脚注原文:「GPT-6 Astra and GPT-5.6 Sol figures are as reported by OpenAI」),因此不是独立复现,口径标注为「⚑ 厂商口径(对方厂商报告值,本文经 Anthropic 官方表转引)」。

基准 Claude Opus 5.5 Claude Fable 5.1 Claude Opus 5 GPT-6 Astra GPT-5.6 Sol 口径标注
Terminal-Bench 4.0 66.4%(xhigh) 55.8% 52.3% 57.9%(high,OpenAI 报告) 37.3% ⚑ 厂商口径;Opus 5.5 的 SE ±2.6pt
FrontierCode v1.1 (Main) 54.4% 50.3% 48.0% 53.3% 47.5% ⚑ 厂商口径
CursorBench 4.0 57.8% 51.8% 46.6% —(未列) 41.7% ⚑ 厂商口径
GDPval-AA v2.1 1846 1735 1708 1542 1588 ⚑ 厂商口径
AutomationBench 40.0% 31.4% 26.9% 41.4% 28.8% ⚑ 厂商口径;由 Zapier 执行与报告
Humanity's Last Exam 67.7%(with tools) 65.6% 63.6% 57.2%(with tools) —(未列) ⚑ 厂商口径
Terminal-Bench-Science 0.1 58.7% 52.6% 29.0% 64.6% 22.4% ⚑ 厂商口径;SE ±3.5–5pt
OSWorld 2.1 81.8%(partial) 80.7%(partial) 74.0%(partial) —(未列) —(未列) ⚑ 厂商口径;partial 非完整任务集
Chartography 89.0%(with tools) 88.4% 83.4% —(未列) —(未列) ⚑ 厂商口径

读这张表必须带上四个限制:

  1. 跨列不可作「谁更强」的终局判断。GPT-6 Astra 在 AutomationBench(41.4% vs 40.0%)与 Terminal-Bench-Science 0.1(64.6% vs 58.7%)上高于 Opus 5.5,Opus 5.5 在其余项领先——方向并不单一,任何「全面领先」的表述都与这张表不符。
  2. 标准误接近或大于分差。Opus 5.5 的 Terminal-Bench 4.0 SE 为 ±2.6pt,Terminal-Bench-Science 0.1 为 ±3.5–5pt。在 SE 量级内的分差不应被解读为实质性差距。
  3. 两厂商的 harness 尚未对齐。Anthropic 脚注指出 Terminal-Bench 4.0 结果中 GPT-6 Astra 取的是 high effort(官方称「these represent each model's highest score」),而 Opus 5.5 取 xhigh。effort 档位不同,即便同表并列也不构成严格同条件比较。
  4. AutomationBench 由 Zapier 执行,且官方注「performed without fallback models, so safeguard interventions were considered failures」,即安全回退按失败计入——该行对 Opus 5.5 偏保守。

4.2 第三方口径:独立 harness 下的编码结果

模型 配置 基准与数字 来源 日期 口径标注
Claude Opus 5.5 max effort,AA 独立 harness Terminal-Bench 4.0 59.6%,+11pt vs Opus 5(该差值口径来自 AA 对比页,系 AA 同一来源两组数字之差,与 §2.1「不并列比较、不相减」的口径规则区分:此处为转述 AA 已给出的对比结论,非本文自行相减;AA 对比页记 Opus 5 为 49%) Artificial Analysis 2026-09-22 第三方口径
GPT-6 Astra AA 模型对比页所列对象为 GPT-6 Astra (Max),AA 独立 harness AA 记录其与 Opus 5.5 持平:对比页 Terminal-Bench 4.0 记 59%(同页 Opus 5.5 记 60%,系四舍五入;文章口径 59.6%) AA 模型对比页 现行记录(2026-10-01 抓取) 第三方口径
Claude Opus 5.5 AA「每 Intelligence Index 任务」口径 约 119k output tokens(同口径下 Opus 5(max)为约 73k) Artificial Analysis 2026-09-22 第三方口径;成本估算用,见 §5.5
GPT-6 Astra AA「每 Intelligence Index 任务」口径,max effort 约 27k output tokens Artificial Analysis(Astra 评测文章)/模型对比页 2026-09-09;对比页现行记录(2026-10-01 抓取) 第三方口径;与上一行并列的用意是:即便在 AA 记录为持平的 Terminal-Bench 4.0 上,单任务 token 消耗量级仍可相差约 4 倍
o3 SWE-bench Verified 71.7% OpenAI o3 System Card,2025-04-16,经 Forkast 转述 2025-04-16 ⚑ 厂商口径,发布时点;与本节其他行不具可比性

关于 GPT-6 Astra 的两个数字为何不同:同一节里同时出现两个 Astra 数字,容易被误读为同一个数——Anthropic 官方表内 Astra 的 57.9% 来自 OpenAI 自行报告、经 Anthropic 转引(effort 为 high);AA 对比页的「与 Opus 5.5 持平」出自 AA 自己的 harness(所列对象为 GPT-6 Astra (Max))。连同 Opus 5.5 的官方 66.4% 与 AA 的 59.6%,这些数字分属不同口径,本文不将其并列比较或相减。

4.3 得分差异很可能是脚手架差异造成的

编码类与 agentic 任务结果对以下因素高度敏感,「某模型在某榜更高」这类单句结论信息量远低于它看起来的样子:

  • 脚手架允许模型看到多少文件上下文;
  • 是否允许运行测试、迭代修正;
  • 是否提供检索工具、失败重试预算多少;
  • effort / 思考预算设置(本章 66.4% / 57.9% / 59.6% 三个数就是实例);
  • 任务是单文件补全还是跨仓库多步修改。

同一基准的第三个独立口径(补一个实例):截至 2026-09-22,由 Stanford、Harbor 与 Laude Institute 维护的 Terminal-Bench 4.0 公开榜(submission 制,非 AA harness)上排第一的是 GPT-6 Astra (max) 58.2%(经 OpenAI 的 Codex harness),其后是 Fable 5.1 (max) 57.9%(Claude Code)与 Opus 5 (xhigh) 53.9%,该榜当时尚无 Opus 5.5 条目(来源:MIXED,2026-09-22)。它与官方 66.4%、AA 59.6% 构成第三种口径,同样不可与前者并列比较——这恰好再次说明:榜单名相同,harness 与提交方式不同,数字就没有可比性。

4.4 读者可直接用的判断框架

任务类型 主要能力需求 选型建议的方向
单文件补全、格式转换、样板代码 低延迟、稳定输出 优先看成本与吞吐,不必上顶配推理档位
跨文件重构、需跑测试迭代 多步推理 + 工具编排 优先看 harness 支持度与重试成本可控性(注意「每任务约 119k vs 27k output tokens」这类消耗指标)
大型代码库问答、长文档定位 长上下文 + 检索质量 优先看「有效上下文」而非宣传上限(Opus 5.5 官方标注 100 万 token,见第五节)
长链路自主 agent 多步推理 + 长上下文 + 成本可控 先用小样本压测失败率,再按失败成本决定档位
新项目长期依赖 模型可用生命周期 o3 / o3-pro API 快照计划 2026-12-11 删除,不应作为新增长期依赖;同代比较对象见第四节

对「能替代工程师」类说法保持克制:本文只描述任务级表现。任务级基准分高,不等于在真实工程环境中可无人值守——Anthropic 官方自己也提示 benchmark margins 已非可靠指引(见 3.1 第 3 条)。

扁平四象限选型图:横轴为任务步数、纵轴为上下文依赖,四角分别标注低成本快模型、工具编排型、检索型与顶配推理加成本监控,图下方警示条注明 o3 API 快照 2026-12-11 删除。
四象限选型图——横轴「任务步数(单步 → 多步)」、纵轴「上下文依赖(低 → 高)」,四角分别标注「低成本快模型」「工具编排型」「检索型」「顶配推理 + 成本监控」;图下方单独挂一条提示条「o3 API 快照 2026-12-11 删除」

五、成本、延迟与工程可用性

5.1 定价与可用性(官方口径)

项目 Claude Opus 5.5 OpenAI o3
输入单价 $4 / 百万 token(Anthropic 官方发布页,2026-09-22,⚑ 厂商口径) $2 / 百万 token(现行价;2025-06-10 下调 80%)
输出单价 $20 / 百万 token(同上) $8 / 百万 token(同上)
缓存读 $0.20 / 百万 token(同上;官方称较未缓存输入折扣 95%) 缓存命中 $0.50 / 百万 token(AA o3 模型页记「缓存折扣 75%」,其模型对比页直接列 Cache Hit $0.50,第三方口径)
缓存写 $5 / 百万 token(5 分钟 TTL,同上) 本次核验未取得可引用的官方数值
Fast mode $8 / $40 每百万 token,最高 2.5x 速度(同上) 不适用
上下文上限 100 万 token(Anthropic 官方发布页;Artificial Analysis 与 llm-stats 独立记录一致) 20 万 token(Artificial Analysis)
知识截止 2026 年 6 月(llm-stats 记录) 2024-05(Artificial Analysis)
正式发布日 2026-09-22 2025-04-16
生命周期状态 现行可用(同家族 Sonnet 5.5 / Haiku 5.5 官方称「coming weeks」) ChatGPT 2026-08-26 下线;API 快照 2026-12-11 删除

关于 o3 定价的重要更正:o3 发布时点(2025-04-16)价格确为 $10 输入 / $40 输出,但该数字已于 2025-06-10 随 o3-pro 发布下调 80%,现行价为 $2 / $8。另外,$10 / $40 是 o3-deep-research 的价,不是 o3 的价——引用时极易串模型,本文在此显式区分。

为什么这处更正重要:拿已过期的 $10/$40 去比 Opus 5.5 的 $4/$20,会得出「o3 更贵」的结论;而按现行价 $2/$8,o3 的单价反而更低。方向完全相反。因此本文的成本讨论一律以现行价为基准,并标注降价时点。

5.2 厂商口径的成本与速度声明(原样引用,未独立验证)

声明内容 对象 来源 日期 口径标注
比 Opus 5 便宜 40%(同等工作负载) Claude Opus 5.5 Anthropic 官方发布页 2026-09-22 ⚑ 厂商口径,未独立验证;比较基准是 Opus 5,不是 o3 或任何他厂模型
输出速度比 Opus 5 快 30%+ Claude Opus 5.5 Anthropic 官方发布页 2026-09-22 ⚑ 厂商口径,未独立验证;同上
输入/输出 token 定价比 Opus 5 低 20%;缓存读低 60% Claude Opus 5.5 Anthropic 官方发布页 / Artificial Analysis 2026-09-22 ⚑ 厂商口径;AA 独立记录一致($5/$25 → $4/$20、$0.50 → $0.20)

本文不对这些声明做跨来源换算或验证性重算,仅原样呈现并标注其比较基准。厂商声明的比较基准是自家上一代模型,不能被改写为「比其他厂商模型便宜/快多少」。

5.3 官方按次成本口径(厂商口径,且不可跨来源换算)

Anthropic 官方在发布页给出了按次成本的相对表述(原样引用):

  • FrontierCode:Opus 5.5 在默认 effort 下击败 GPT-6 Astra,成本约为其每任务的 20%;
  • Terminal-Bench 4.0:Opus 5.5 与 Astra 分数相当,成本约为其 40%;
  • CursorBench:Opus 5.5 比 GPT-5.6 Sol 高 11 个百分点,成本约为其三分之一。

三条使用限制:

  1. 这些是 ⚑ Anthropic 的厂商口径(其自建的 accuracy-vs-cost 图),未经第三方独立验证;
  2. 其「每任务成本」用的是什么 harness、多少轮次、哪种 effort 档位,官方页面未完整披露,因此不可与 §5.5 的公式或 Artificial Analysis 的 token 消耗量换算对接;
  3. 该按次成本口径对应的基准子集官方未披露,与 §4.1 表内逐项数值不可直接对应——请读者不要用 §4.1 的分数自行相减去对齐上文「高 11 个百分点」「分数相当」这类表述;
  4. 本文不据此计算任何「便宜 X 倍」的绝对结论,也不将其与 Artificial Analysis 的 119k / 27k token 数据相乘相除——跨来源换算已在本文前言中明令禁止,对厂商有利的数字同样适用。

5.4 延迟(含测量条件)

规则:只引用有明确测量条件的来源,并标注测量条件;无条件来源的「更快」表述不采信。

模型 指标 数字 测量条件 / 来源 口径标注
o3 输出速度 106 tok/s Artificial Analysis o3 providers 页与模型对比页(OpenAI 直连口径) 第三方口径
o3 首 token 时间(TTFT) 6.68 s 同上(AA 同页亦列 Time to First Answer Token,数值相同) 第三方口径
o3 端到端时长 11.40 s 同上 第三方口径
Claude Opus 5.5 首 token 时间 p95 11.53 s llm-stats,基于近 7 天实时请求记录(p95) 第三方口径;与上表 o3 的 AA 数字口径不同
Claude Opus 5.5 输出吞吐 p5 约 14 字符/秒 同上(p5 为 95% 请求超过的下限) 第三方口径;同上

说明:o3 的三个数值来自 Artificial Analysis 带明确测量条件的记录;Opus 5.5 侧本文取得的是 llm-stats 的 p95 / p5 口径,与 AA 的测量口径不同,因此本文不将上下两组数字直接对比、不相减。厂商口径的「快 30%+」是相对 Opus 5 的自述,属 5.2 的厂商声明,不能与任何第三方绝对测量值并列比较。

5.5 可复算的成本估算公式

不给结论,给公式,读者自行代入官方定价页的当日单价:

单任务成本 ≈ (输入 token ÷ 1,000,000 × 输入单价)
           + (输出 token ÷ 1,000,000 × 输出单价)
           + 缓存读写开销
           + 重试与失败重放开销

两个可代入的公开锚点:

  • 输出量锚点:Artificial Analysis 记录 Opus 5.5 平均每任务约 119k output tokens、GPT-6 Astra 约 27k(均为 AA 的「每 Intelligence Index 任务」口径;同口径下 Opus 5(max)约 73k,第三方口径)。本文只给公式与输入项,不代算「谁更便宜」的跨来源结论。
  • 失败重放开销:多步 agent 任务的成本方差远大于均值。一个 20 步的任务,若单步失败率为 p,全链路成功率约为 (1−p)²⁰。请用你自己的任务样本测 p——这一步无法用任何厂商公布的单价替代。

5.6 生命周期与迁移成本(本选题的实际落点)

项目 事实 来源与日期
o3 退役公告 2026-05-28(与 GPT-4.5 同批公告,o3 设 90 天 sunset) OpenAI ChatGPT Release Notes
o3 从 ChatGPT 下线 2026-08-26 Forkast 报道;OpenAI Release Notes
API 快照删除 2026-12-11(o3-2025-04-16、o3-pro-2025-06-10) OpenAI API Deprecations 页
官方推荐替代 gpt-5.6-sol(o3-pro 相当能力以 reasoning.mode: pro 表达) OpenAI API Deprecations 页
o3-deep-research 2026-07-23 已下线(依 2026-04-22 公告;该日期存在一处来源冲突,见 §7.2 第 8 条) OpenAI API Deprecations 页
o3-mini 退役 2026-10-01,接替者 o4-mini Forkast 报道

给工程团队的三个可执行动作(仅陈述迁移事实):

  1. 全文检索代码与配置中的 o3-2025-04-16、o3-pro-2025-06-10 固定模型 ID(含路由与 fallback 链),在 2026-12-11 前完成替换与回归测试;
  2. 把替换目标的对比口径统一到同代模型(GPT-6 Astra / GPT-5.6 Sol vs Opus 5.5);
  3. 在成本模型里把「模型生命周期」作为显式变量——§5.5 的公式只算单价与 token 量,算不出模型退役带来的迁移成本。
扁平成本对比图:左栏 Opus 5.5 定价 $4/$20 与 100 万上下文,右栏 o3 定价 $2/$8 与 20 万上下文并标 API 快照 2026-12-11 删除,中间天平标注「单价更低不等于总成本更低,还取决于每任务 token 量与失败重放开销」。
成本对比示意——左右两栏「Opus 5.5 $4/$20(100 万上下文)」与「o3 $2/$8(20 万上下文,API 快照 2026-12-11 删除)」,中间标注「单价更低 ≠ 总成本更低:还取决于每任务 token 量与失败重放开销」,右下角挂「生命周期风险」警告条

六、安全、合规与企业采用

截至本文写作时点的官方口径(本节信息变化快,发布前请重新打时间戳):

项目 Claude Opus 5.5 OpenAI o3
系统卡披露 官方系统卡已发布(2026-09-22) 官方系统卡已发布(2025-04-16)
安全机制对评测的影响 官方自注:安全机制介入时,网络安全任务转交 Opus 4.8,生物与前沿 LLM 研发任务转交 Opus 5,「likely reduces performance」(⚑ 厂商口径,2026-09-22) 本次核验未取得同等自注
独立预部署评估 METR 已发布(2026-09-22),并披露 Anthropic 有权审阅与编辑该摘要文本;官方发布页另提及有第三方测试,但未给出机构名、链接与日期,本文不指名、不据以陈述(列入 §7.2 第 9 条待核) 本次核验未取得同等第三方预部署评估
能力分级与访问门槛 官方称 Opus 5.5 在生物与网络安全方面「comparable to Claude Mythos 5.1」,故采用类似 Fable 5.1 的保障措施;已开放 Life Sciences Verification Program 申请,Cyber Verification Program 将于数周内扩围 不适用(o3 进入退役流程)
数据留存与企业合规选项 本文未取得可引用的官方文档条款,不作陈述 同上
地区可用性 本文未取得可引用的官方文档条款,不作陈述 同上

合规声明:涉及地区可用性与合规要求时,本文只陈述官方文档内容,不做法律意见。上表「未取得可引用条款」的字段,本文不填推测值——这类字段的空白本身是需编辑部补齐的信息,而非可省略的细节。


七、结论与待解问题

7.1 分场景建议(措辞强度与证据强度匹配)

场景 本文能给出的建议 证据强度
新项目长期选型 不要基于 o3 做长期依赖:API 快照计划 2026-12-11 删除。比较对象应换成同代的 GPT-6 Astra / GPT-5.6 Sol vs Claude Opus 5.5 官方时间表(强)
推理密集 可用 Opus 5.5 官方口径(HLE 67.7% with tools)做**「厂商称」**级别初筛;第三方口径 HLE 61.4% 需并列呈现,两者不可混算。同时须告知读者:官方自承基准分差已非可靠指引 厂商口径 + 第三方口径(中)
编码与工程 结论高度取决于 harness 与 effort:Terminal-Bench 4.0 三个数字(Opus 5.5 官方 xhigh 66.4% / 官方表内 Astra-high 57.9% / AA 独立 harness 59.6%)分属三种口径。请先在自己的仓库上跑真实任务,再参考任何榜单 口径差异已被实证(中)
长文档与 agent 关注「有效上下文」而非宣传上限;Opus 5.5 官方标注 100 万 token,o3 为 20 万 token。注意分数接近时单任务 token 消耗量级可差数倍(AA:119k vs 27k) 官方口径 + 第三方口径(中)
成本敏感 以现行价为准(Opus 5.5 $4/$20;o3 $2/$8),用 §5.5 的公式自行复算。不采信任何未经核实的「便宜 X 倍」表述,包括厂商的「比 Opus 5 便宜 40%」与按次成本比例——那是同厂商代际 / 自建 harness 口径 官方定价页(强)
存量系统迁移 检索固定模型 ID,在 2026-12-11 前完成替换与回归测试;注意「API 还在」不等于「体验一致」(推理性模型换代后输出格式与延迟特性会变) 官方时间表(强)
安全敏感行业 Opus 5.5 在生物 / 网络安全方面设有访问验证项目,企业采用前需确认自身是否符合申请条件;这不构成合规意见 官方文档(中)

7.2 本次核验未能确证的项目

  1. GPT-5.6 Sol / GPT-6 Astra 的官方 API 定价——OpenAI 官方定价页与模型页抓取返回 403(本次复核亦为 403),未能取得一手数值;具名第三方的记录为 GPT-6 Astra $10 输入 / $50 输出、缓存命中 $1.00(Artificial Analysis,2026-09-09 文章与模型对比页现行记录)、GPT-5.6 Sol $4 / $20(同源记载的「Astra 涨价前价格」);而日本媒体转述 Sol 为 $5/$30。三种来源不一致,本文对三者均不作陈述,全部列入待核。
  2. Opus 5.5 侧同等测量条件的吞吐数据——本次取得的是 llm-stats 的 p95 / p5 口径,与 AA 对 o3 的口径不同,故不构成延迟对比。
  3. 两家企业的数据留存与合规条款——未取得可引用的官方文档条款。
  4. 缓存写(o3 侧)的具体计费——未取得可引用的官方数值。
  5. FrontierCode v1.1 / CursorBench 4.0 的第三方独立复现——目前仅有厂商口径。
  6. o3 系统卡三项基准的原文核对——现有两处具名媒体转述一致,但均为二手,建议以系统卡原文复核。
  7. 模型命名写法——本文按 Anthropic 官方表与 OpenAI Deprecations 页的写法统一为「GPT-5.6 Sol / gpt-5.6-sol」。其中 OpenAI 侧页面本次系经转述核对,发布前建议以官方页面再核一次命名;本文不对其他来源的写法作任何判断或引用。
  8. o3-deep-research 的下线日存在来源冲突——OpenAI API Deprecations 页的转述日期为 2026-07-23(theRouter、AI Wiki 等具名来源一致),但本文同样引用的 Forkast(2026-08-26)同篇报道写作「o3 Deep Research 于 12 月 26 日退役」。两者不可同时成立,本文暂以 Deprecations 页口径为准并在 §1、§5.6 如实标出,建议以官方 Deprecations 页原文(本次抓取返回 403)复核后定稿。
  9. 官方提及的「另有第三方测试」——Anthropic 官方发布页提及有第三方测试,但未给出机构名、链接与日期,本文因此不指名该机构、不引用其结论(§6 已改为不指名表述)。若编辑部能取得该机构原始报告,可再行补入。

7.3 需要编辑部决策的事项

  1. 对比主体变更:本文已将同代对比主体修正为 GPT-6 Astra / GPT-5.6 Sol vs Opus 5.5,但原始选题标题仍是「o3 vs Opus 5.5」。若保留原题,建议在标题或导语中体现生命周期错位,避免读者被标题误导;若编辑部倾向更换标题,需编辑部确认后执行(本文不擅自改换选题方向)。
  2. 站点字段建议(发布配置项,不占正文):站点 title 建议压缩至 30 字内,例「o3 vs Claude Opus 5.5:一个已退役,一个新发布」;slug 保持 openai-o3-claude-opus-5-5 不变。

7.4 后续跟踪清单

  • 2026-12-11:o3 / o3-pro API 快照删除的实际执行情况;
  • o3-deep-research 实际下线日的官方复核(7-23 与 12-26 两说);
  • GPT-6 Astra / GPT-5.6 Sol 的官方定价页(当前抓取受阻)与系统卡,补齐同代成本对照;
  • Artificial Analysis / METR 对 GPT-6 Astra、GPT-5.6 Sol 的独立评测发布;
  • Opus 5.5 在独立 harness 下更多任务的复现结果(尤其是 Terminal-Bench 之外);
  • Claude Sonnet 5.5 / Haiku 5.5 发布(官方称「coming weeks」);
  • METR 关于「Anthropic 可审阅编辑摘要」条款的后续说明;
  • 两家厂商定价页调整与缓存计费条款变更。

八、来源表(链接 + 发布日期 + 抓取状态)

来源 链接 发布日期 抓取状态
Anthropic《Introducing Claude Opus 5.5》 https://www.anthropic.com/claude-opus-5-5 2026-09-22 已直接抓取正文(2026-10-01 复核)。逐项比对一致:定价 $4/$20、缓存 $0.20/$5、Fast mode $8/$40、10 项基准全表(含 GPT-6 Astra 与 GPT-5.6 Sol 逐项数值)、SE 标注、fallback 与「benchmark margins」自注、按次成本表述
Anthropic — Opus 5.5 System Card https://www.anthropic.com/claude-opus-5-5-system-card 2026-09-22 官方链接已确认存在;正文未抓取,建议发布前核对
METR — Opus 5.5 预部署独立评估 https://metr.org/blog/2026-09-22-claude-opus-5-5/ 2026-09-22 已直接抓取正文(2026-10-01 复核)。含「incremental improvement」「unlikely to be able to fully automate AI R&D」「unpaid agreement」及 Anthropic 审阅编辑条款原文
Artificial Analysis — Claude Opus 5.5 https://artificialanalysis.ai/articles/claude-opus-5-5 2026-09-22 正文本次抓取失败(工具端 fetch 报错,非 403);其数值已由 AA 模型页与三张对比页交叉核对一致:Intelligence Index 58(#1/223)、HLE 61.4%、SciCode 66.9%、Terminal-Bench 4.0 59.6%、AA-Briefcase Elo 1822、119k output tokens/任务、1M 上下文
Artificial Analysis — o3 模型页 https://artificialanalysis.ai/models/o3 现行记录 已直接抓取(2026-10-01)。o3 $2/$8、缓存折扣 75%、200k 上下文、April 2025 发布、knowledge cutoff May 2024、约 106 tok/s。链接已修正:原引 comparisons 页 slug 指向非本文标的的 Claude Opus 4.6,故改指 o3 模型页
Artificial Analysis — o3 API providers 页 https://artificialanalysis.ai/models/o3/providers 现行记录(2026-10-01 抓取) 已直接抓取。OpenAI 直连 105.9 t/s、首答案 token 时延 6.68 s(同一页另有 Azure 条目 96.3 t/s、23.96 s,属另一 provider 行,本文未采用其数值、亦不在 §5.4 引用),为 §5.4 的来源
Artificial Analysis — GPT-6 Astra 评测文章 https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra 2026-09-09 已直接抓取(2026-10-01)。Astra max effort 每任务 27k output tokens(同文对比 Fable 5.1 为 78k)、Astra 定价 $10/$50(缓存命中 $1.00,为输入价的 1 折,即 90% 折扣)
Artificial Analysis — 模型对比页(Opus 5.5 vs GPT-6 Astra/Opus 5.5 vs Opus 5/GPT-5 Minimal vs o3) https://artificialanalysis.ai/models/comparisons/gpt-6-astra-vs-claude-opus-5-5 ; https://artificialanalysis.ai/models/comparisons/claude-opus-5-5-vs-claude-opus-5 ; https://artificialanalysis.ai/models/comparisons/gpt-5-minimal-vs-o3 现行记录(2026-10-01 抓取) 已直接抓取并逐项核对。Opus 5.5 每任务 119k output tokens(Opus 5(max)73k);GPT-6 Astra (Max) 27k、Terminal-Bench 4.0 59%(同页 Opus 5.5 为 60%,系四舍五入);Astra 输入 $10 / 输出 $50 / 缓存命中 $1.00;o3 输入 $2 / 输出 $8 / 缓存命中 $0.50 / 106 tok/s / TTFT 6.68 s / E2E 11.40 s
Forkast — o3 从 ChatGPT 下线报道 https://forkast.news/openai-retired-o3-from-chatgpt-today-the-real-cost-is-the-churn-it-forces-on-everyone-else/ 2026-08-26 已直接抓取正文(2026-10-01 复核)。o3 90 天 sunset、2026-08-26 下线、2026-12-11 API 关停、o3-mini 2026-10-01 退役接替 o4-mini、o3 系统卡三数值、o3 公布 / 发布日。注意:同篇将 o3 Deep Research 退役写作 12 月 26 日,与本文采用的 2026-07-23 冲突,已列入 §7.2 第 8 条
MIXED — Terminal-Bench 公开榜与厂商自跑差异 https://mixed-news.com/en/anthropic-opus-5-5-terminal-bench-66-4-percent-public-board/ 2026-09-22 已直接抓取正文(2026-10-01)。第三方公开榜(Stanford/Harbor/Laude,submission 制)当时第一名 GPT-6 Astra (max) 58.2%(Codex harness),Fable 5.1 (max) 57.9%(Claude Code),Opus 5 (xhigh) 53.9%,榜上尚无 Opus 5.5;AA 的 Opus 5.5 为 max 58 / xhigh 56 / high 54
OpenAI API Deprecations 页(经转述) https://developers.openai.com/api/docs/deprecations 2026-06-11 起 原文未抓取:本次复核该页返回 HTTP 403;经 AI 革命 2026-08-04 与 Forkast 双向转述核对一致:o3-2025-04-16 / o3-pro-2025-06-10 → 2026-12-11 删除,替代 gpt-5.6-sol;o3-deep-research 2026-07-23 已下线(日期存一处冲突)
AI 革命 — o3 ChatGPT 提供終了整理 https://ai-revolution.co.jp/media/chatgpt-o3-retirement/ 2026-08-04 已直接抓取正文(2026-10-01 复核)。两段式期限、Deprecations 表、o3-deep-research 7-23 已下线、o3 历史基准、GPT-5.6 Sol 转述价 $5/$30(未采信为定价依据)
TMTPOST — o3-pro 发布并降价 80% https://en.tmtpost.com/post/7593599 2025-06-10 标题与主题已核;正文抓取被截断,作为降价时点的第二来源,与 AA 现行价记录交叉一致
llm-stats — Claude Opus 5.5 模型页 https://llm-stats.com/models/claude-opus-5-5 2026-10-01 更新 已直接抓取正文(2026-10-01)。$4 / $0.20 / $20、1M 上下文、知识截止 2026-06、TTFT p95 11.53 s、输出 p5 约 14 字符/秒
OpenAI o3 System Card 原文 官方渠道 2025-04-16 未直接抓取;三个基准数值现为两处具名媒体转述(Forkast、AI 革命)一致,标注为待原文复核

链接变更与点检说明:本表共 15 行来源、16 条链接(其中 AA 模型对比页一行含 3 条链接)。本次核验(2026-10-01)实际抓通并逐项核对 12 条(Anthropic 发布页、METR、AA 的 o3 模型页与 providers 页、AA 的 Opus 5.5 模型页与 Astra 模型页、AA Astra 评测文章、AA 三张对比页、llm-stats、Forkast、AI 革命、MIXED)。仍须人工点检/复核的 3 类:①AA《Opus 5.5》文章页(本次 fetch 报错,数值已由 AA 模型页与对比页交叉核对);②OpenAI Deprecations 页(403,需人工打开确认删除日与 gpt-5.6-sol 命名);③两份 System Card 原文(Anthropic Opus 5.5、OpenAI o3)与 TMTPOST 正文(截断)。第 5 行(AA o3 模型页)已按上轮意见由错误的 claude-opus-4-6-vs-o3 slug 改为 o3 模型页。


信源状态摘要:Claude Opus 5.5 的定价、上下文与基准数据来自 Anthropic 官方发布页(2026-09-22,⚑ 厂商口径),其中 GPT-6 Astra / GPT-5.6 Sol 的数值系 OpenAI 报告值经 Anthropic 转引;第三方结果来自 Artificial Analysis 与 METR(2026-09-22,第三方口径),全文分列、未混算、未跨来源换算百分比。o3 的定价为现行价 $2/$8(2025-06-10 起下调 80%,缓存命中 $0.50),上下文 20 万 token,生命周期状态为 ChatGPT 2026-08-26 下线、API 快照 2026-12-11 删除、o3-deep-research 已于 2026-07-23 下线(该日期存一处来源冲突,见 §7.2 第 8 条);o3 的三项延迟与缓存价已由 AA 的 o3 providers 页与模型对比页 双重核对一致(§5.4 仅引用 OpenAI 直连口径,未采用同页 Azure 条目数值)。o3 系统卡三项基准为 2025-04-16 ⚑ 厂商口径,建议以系统卡原文复核后发布。本文未自建测试环境,全文不含「实测」表述;未取得可引用来源的字段一律留空并列入 7.2,未填任何推测值。已知需编辑部决策事项(对比主体 vs 原题标题、站点 title 压缩)见 7.3;发布前须人工点检的外链清单见第八节末尾。

關鍵數據對照
指標廠商預測實測結果備註
Claude Opus 5.5 定价与缓存⚑ 厂商口径 $4 输入 / $20 输出;缓存读 $0.20、缓存写 $5;Fast mode $8/$40;较 Opus 5 便宜 40%、快 30%+已实抓 Anthropic 发布页(2026-09-22)逐项一致;AA 独立记录一致($5/$25→$4/$20、$0.50→$0.20)。降价幅度与速度声明为厂商自述,无独立验证比较基准是自家 Opus 5,不得改写为他厂对比;截至 2026-09-22 官方口径
Opus 5.5 Terminal-Bench 4.0⚑ 官方 66.4%(xhigh effort,SE ±2.6pt)AA 独立 harness 59.6%(AA 对比页记 60%,对手 GPT-6 Astra (Max) 记 59%);第三方公开榜当无 Opus 5.5 条目,榜首 GPT-6 Astra (max) 58.2%(MIXED 2026-09-22)。三种口径不可比稿件已分列并禁止并列比较;v6 已把 Astra 的 effort 由错误的 xhigh 改为 AA 对比页所列 Max
Opus 5.5 推理类第三方分第三方 AA:Intelligence Index 58(#1/223)、HLE 61.4%、SciCode 66.9%、AA-Briefcase Elo 1822AA 模型页与对比页均确认;RITS(2026-09-23)转述一致;官方 HLE 67.7%(with tools)与之口径不同不可混算AA 对全部当前 Claude 模型标 'with fallback'
o3 现行定价与缓存厂商/第三方:$2 输入 / $8 输出,缓存命中 $0.50;2025-06-10 下调 80%AA o3 对比页直接列 Input $2.00 / Output $8.00 / Cache Hit $0.50;o3 模型页记缓存折扣 75%;降价时点由 TMTPOST/VentureBeat(2025-06-10)佐证发布价 $10/$40 已于 2025-06-10 失效,稿件已显式更正
o3 延迟与上下文第三方 AA:106 tok/s、TTFT 6.68 s、E2E 11.40 s、200k 上下文、knowledge cutoff 2024-05AA o3 providers 页(105.9 t/s、6.68 s,OpenAI 直连)与对比页(106 tok/s、TTFT 6.68 s、E2E 11.40 s)双重一致AA 同页 Azure 为 93.6/96.3 t/s、23.96 s,稿件只采 OpenAI 直连并列明来源
o3 生命周期官方时间表:2026-05-28 公告(90 天 sunset)→ 2026-08-26 ChatGPT 下线 → API 快照 2026-12-11 删除(替代 gpt-5.6-sol);o3-mini 2026-10-01 退役Forkast(2026-08-26)与 AI 革命(2026-08-04,转述 Deprecations 页)双向核对一致;OpenAI Deprecations 原文本次实测 HTTP 403,仍待人工点检稿件只陈述时间表与迁移事实,不作厂商策略评论
o3-deep-research 下线日2026-07-23 已下线(依 2026-04-22 公告)AI 革命(2026-08-04)、theRouter、AI Wiki 一致记 2026-07-23;但同被引用的 Forkast(2026-08-26)写「12 月 26 日退役」——两者冲突v6 已在 §1/§5.6 加注并列入 §7.2 第 8 条待核,未择一掩盖
o3 发布时点厂商基准⚑ 厂商口径:GPQA Diamond 87.7%、SWE-bench Verified 71.7%(o1 48.9%)、Codeforces Elo 2727(o1 1891)Forkast 与 AI 革命两处具名转述一致;仍未取得 o3 System Card 原文标注为 2025-04-16 发布时点二手转述,建议原文复核;不据此推导相对能力
每任务输出 token(AA 口径)第三方 AA:Opus 5.5(max)约 119k/任务;GPT-6 Astra 约 27k/任务AA 对比页(Opus 5.5 vs Astra)确认 119k vs 27k,另有 reasoning tokens 84k vs 17k;同口径 Opus 5(max)73k(AA 2026-09-22 文章/对比页);27k 首见于 AA 2026-09-09 Astra 文章(同文对照 Fable 5.1 78k)v6 已改注真实来源日期,并说明该组数字为 Index 口径、不可与 TB 4.0 持平结论混说
GPT-6 Astra / GPT-5.6 Sol API 定价无官方一手数值(OpenAI 定价页与模型页实测 403)具名第三方 AA 记录:Astra $10 输入 / $50 输出、缓存命中 $1.00、90% 缓存折扣(2026-09-09 文章+模型页/对比页);GPT-5.6 Sol $4/$20(同源记为 Astra 涨价前价);日本媒体转述 Sol $5/$30三种来源冲突,稿件不作陈述、全部列入 §7.2 待核(v6 已删除无来源的 $2/$10 说法)
METR 独立预部署评估第三方:Opus 5.5 相对 Fable 5.1 属增量改进;「unlikely to be able to fully automate AI R&D」;Anthropic 有权审阅编辑摘要METR 页面原文逐字一致(2026-09-22),含 unpaid agreement 与独立性子句;已与结论同时呈现独立性条款必须随结论引用,稿件已保留
本次外链实测(2026-10-01)稿件原称「核验工具未含外链抓取」实抓 12 条并核对:Anthropic 发布页、METR、AA o3 模型页/providers 页、AA Opus 5.5 模型页、AA GPT-6 Astra 模型页、AA Astra 文章、AA 三张对比页、llm-stats、Forkast、AI 革命、MIXED;未通:AA《Opus 5.5》文章页(fetch 报错)、OpenAI Deprecations(403)、两份 System Card 原文、TMTPOST 正文截断§8 已更新点检结果与须人工复核清单,上次退回的 AA slug 错误已修正

標籤

#OpenAI o3#Claude Opus 5.5#GPT-6 Astra#模型對比評測#模型退役與遷移#推理成本

本文關係圖譜

沒找到想看的?搜尋更多報導

成為會員

解鎖全部深度文章、幕後軌跡與播客

查看會員計劃