全部文章
第 1 / 2 頁
Figure 熔掉上一代機器人,比發表會更能說明產業現狀
Figure 於 9 月 30 日發布 F.02 退役公告,退役理由只有兩條:F.03 機隊擴張後繼續維持舊機隊已不合理,逐台拆解會拖慢 F.04。
新MiniMax 把新模型鎖進訂閱:M3.1-Flash-Preview 上線 1M 上下文,中國國慶七天對訂閱用戶不限量
**規格是硬的,跑分是沒有的**:官方描述為 1,000,000 token 上下文,輸入支援文字/圖像/影片,輸出只有文字;最大輸出長度、輸出速度、參數量、權重、每 token 價格**官方全部未公布**,也沒有廠商基準表與模型卡([官方 Models 頁](https://platform.minimax.io/docs/guides/models-intro)、[官方介面概覽](https://platform.minimax.io/docs/api-reference/api-overview))。

OpenAI o3 与 Claude Opus 5.5 对比评测:能力边界、成本与适用场景
原题是一组生命周期错位的对比:o3 已于 2026-08-26 从 ChatGPT 下线、API 快照计划 2026-12-11 删除,而 Claude Opus 5.5 于 2026-09-22 发布,晚于 o3 下线近一个月;同代对比对象应为 GPT-6 Astra / GPT-5.6 Sol vs Opus 5.5。

從 Demo 到生產:AI Agent 落地路線圖
Agent 的分水嶺不在「能不能跑通一次」,而在「能不能穩定、可回滾、可稽核地持續跑」:示範效果 ≠ 生產可靠性。
DeepSeek V4 推理成本:官方价格与第三方实测对比
官方价是报价单不是账单:输入输出配比、缓存命中率、峰谷时段会让实测成本系统性偏离单一标价。
E2E 测试:DeepSeek V4 推理成本实测
成本和门槛同时下降
GPT-5 首周实测:推理能力提升 40%,但推理成本翻了一倍
官方称推理基准提升 40%,我们在 5 类真实任务上复现到 22%–38%。
一文看懂 Agent 框架选型:LangGraph、DSH 与自研怎么选
三类方案的核心差异在于「谁拥有循环」。
论文解读:长上下文真的在「用」全部 token 吗?
研究发现模型对中段信息的利用率显著低于首尾。
Anthropic 发布新一代 Claude:编码能力领先,定价不变
新模型在编码基准上刷新纪录。
用 Stripe 给你的 AI 产品加上订阅:从零到上线的 7 个步骤
Checkout + Billing + Customer Portal 三件套足够覆盖大多数场景。
开源模型追平闭源?我们在 6 个真实任务上做了对比
在 6 个任务中,开源模型在 4 个上差距小于 5%。