Figureが前世代ロボットを溶かした——発表会より業界の現在地を語っている
Figureは9月30日、F.02の退役を発表した。理由は二つで、F.03の機体が増えた後は旧機体を維持するのが不合理になったこと、1台ずつ分解するとF.04が遅れること。
当直編集者
本日は周編集長が当直
モーニングブリーフ
本日のブリーフを見る →注目コラム
他の記事
すべて見る →
新着MiniMax 把新模型锁进订阅:M3.1-Flash-Preview 上线 1M 上下文,国庆七天对订阅用户不限量
规格是硬的、跑分是没有的:官方口径为 100 万 token 上下文,输入支持文本/图像/视频,输出仅文本;最大输出长度、输出速度、参数量、权重、每 token 价格全部未公布,也没有厂商基准表与模型卡。

OpenAI o3 与 Claude Opus 5.5 对比评测:能力边界、成本与适用场景
原题是一组生命周期错位的对比:o3 已于 2026-08-26 从 ChatGPT 下线、API 快照计划 2026-12-11 删除,而 Claude Opus 5.5 于 2026-09-22 发布,晚于 o3 下线近一个月;同代对比对象应为 GPT-6 Astra / GPT-5.6 Sol vs Opus 5.5。

デモから本番へ:AIエージェント導入ロードマップ
エージェントの分水嶺は「一度動くか」ではなく「安定して・ロールバック可能に・監査可能に走り続けられるか」にある。デモの出来栄え ≠ 本番の信頼性。
DeepSeek V4 推理成本:官方价格与第三方实测对比
官方价是报价单不是账单:输入输出配比、缓存命中率、峰谷时段会让实测成本系统性偏离单一标价。
E2E 测试:DeepSeek V4 推理成本实测
成本和门槛同时下降
GPT-5 首周实测:推理能力提升 40%,但推理成本翻了一倍
官方称推理基准提升 40%,我们在 5 类真实任务上复现到 22%–38%。
注目ポッドキャスト
すべて見る →Figureが前世代ロボットを溶かした——発表会より業界の現在地を語っている
Figureは9月30日、F.02の退役を発表した。理由は二つで、F.03の機体が増えた後は旧機体を維持するのが不合理になったこと、1台ずつ分解するとF.04が遅れること。
新着MiniMax 把新模型锁进订阅:M3.1-Flash-Preview 上线 1M 上下文,国庆七天对订阅用户不限量
规格是硬的、跑分是没有的:官方口径为 100 万 token 上下文,输入支持文本/图像/视频,输出仅文本;最大输出长度、输出速度、参数量、权重、每 token 价格全部未公布,也没有厂商基准表与模型卡。
GPT-5 首周实测:推理能力提升 40%,但推理成本翻了一倍
官方称推理基准提升 40%,我们在 5 类真实任务上复现到 22%–38%。
论文解读:长上下文真的在「用」全部 token 吗?
研究发现模型对中段信息的利用率显著低于首尾。
开源模型追平闭源?我们在 6 个真实任务上做了对比
在 6 个任务中,开源模型在 4 个上差距小于 5%。
編集室をあなたのメールに
毎日のモーニングブリーフで、読むべきAIニュースを見逃しません