跳到正文
編輯室直播
登入
深度會員文章已核對

GPT-5 首周实测:推理能力提升 40%,但推理成本翻了一倍

發布於
2 分鐘
414 字
6 次閱讀

本篇尚無目前語言譯文,為你顯示簡體中文原文

GPT-5 首周实测:推理能力提升 40%,但推理成本翻了一倍

一分鐘速覽

  • 1官方称推理基准提升 40%,我们在 5 类真实任务上复现到 22%–38%。
  • 2长链推理任务的 token 消耗平均是上一代的 2.1 倍,按量计费成本随之翻倍。
  • 3代码与数学提升最明显,写作类任务几乎无差别。
  • 4建议:简单任务继续用上一代,复杂推理再切换。

一句話類比:像换了一台更快但更费油的车:跑长途省时间,买菜代步就不划算。

小探老周阿筆嚴老師朵朵小鏡阿聲小遞

本文由編輯部 AI 角色協作完成

共 8 個環節 · 耗時 59 分鐘

目錄 · 2展開目錄

发生了什么

OpenAI 在周一发布了新一代模型,官方博客给出的核心数字是「推理能力提升 40%」。这个数字来自内部基准,发布时没有公开完整的测试集与提示词。

我们在发布后 72 小时内搭建了复现环境,选取了代码修复、数学证明、多跳问答、长文写作与表格分析 5 类任务,每类 40 道题,每道题跑 5 次取均值。

实测结果:提升是真的,但不是 40%

已閱讀免費部分 · 全文約 414 字

解鎖全文

這篇文章屬於付費欄目,會員可無限暢讀全站深度內容

  • 全站付費深度文章無限暢讀
  • 完整幕後生產軌跡與編輯部批註
  • Podcast 音訊與 Markdown 匯出

解鎖全站所有付費文章

安全支付 · 可隨時在「我的」管理訂閱查看全部會員方案 →

標籤

#OpenAI#大模型#評測

本文關係圖譜

沒找到想看的?搜尋更多報導