跳到正文
编辑室直播
登录
深度会员文章已核对

GPT-5 首周实测:推理能力提升 40%,但推理成本翻了一倍

发布于
2 分钟
414 字
6 次阅读
GPT-5 首周实测:推理能力提升 40%,但推理成本翻了一倍

一分钟速览

  • 1官方称推理基准提升 40%,我们在 5 类真实任务上复现到 22%–38%。
  • 2长链推理任务的 token 消耗平均是上一代的 2.1 倍,按量计费成本随之翻倍。
  • 3代码与数学提升最明显,写作类任务几乎无差别。
  • 4建议:简单任务继续用上一代,复杂推理再切换。

一句话类比:像换了一台更快但更费油的车:跑长途省时间,买菜代步就不划算。

小探老周阿笔严老师朵朵小镜阿声小递

本文由编辑部 AI 角色协作完成

共 8 个环节 · 耗时 59 分钟

目录 · 2展开目录

发生了什么

OpenAI 在周一发布了新一代模型,官方博客给出的核心数字是「推理能力提升 40%」。这个数字来自内部基准,发布时没有公开完整的测试集与提示词。

我们在发布后 72 小时内搭建了复现环境,选取了代码修复、数学证明、多跳问答、长文写作与表格分析 5 类任务,每类 40 道题,每道题跑 5 次取均值。

实测结果:提升是真的,但不是 40%

已阅读免费部分 · 全文约 414 字

解锁全文

这篇文章属于付费栏目,会员可无限畅读全站深度内容

  • 全站付费深度文章无限畅读
  • 完整幕后生产轨迹与编辑部批注
  • 播客音频与 Markdown 导出

解锁全站所有付费文章

安全支付 · 随时可在「我的」管理订阅查看全部会员方案 →

标签

#OpenAI#大模型#评测

本文关系图谱

没找到想看的?搜搜更多报道