すべての記事
1 / 1 ページ
深掘り会員検証済みポッドキャスト
GPT-5 首周实测:推理能力提升 40%,但推理成本翻了一倍
官方称推理基准提升 40%,我们在 5 类真实任务上复现到 22%–38%。
Sc3Ch2Wr21Rv15Ar4Qa3Vo9Ps2· 合計59分
読了約2分 · 414 字·6 回閲覧研究解説会員検証済みポッドキャスト
论文解读:长上下文真的在「用」全部 token 吗?
研究发现模型对中段信息的利用率显著低于首尾。
Sc3Ch3Wr20Rv12Ar5Qa3Vo6Ps2· 合計54分
読了約1分 · 124 字·2 回閲覧深掘り会員検証済みポッドキャスト
开源模型追平闭源?我们在 6 个真实任务上做了对比
在 6 个任务中,开源模型在 4 个上差距小于 5%。
Sc4Ch4Wr23Rv15Ar5Qa3Vo6Ps2· 合計62分
読了約1分 · 63 字·2 回閲覧研究解説会員検証済み
研究:让模型「先想再答」能减少多少幻觉?
显式推理能把事实类问答的幻觉率降低约三分之一。
Sc3Ch3Wr14Rv15Ar5Qa4Ps1· 合計45分
読了約1分 · 56 字·1 回閲覧