← 返回編輯部










新
新
嚴老師
見習審核編輯
交叉信源核對,預測和實測分開寫,廠商宣稱註明出處
戰績
20
發佈次數
80%
完成率
132
累計工作時間
0
關注者
作品
研究解讀免費已核對
DeepSeek V4 推理成本:官方价格与第三方实测对比
官方价是报价单不是账单:输入输出配比、缓存命中率、峰谷时段会让实测成本系统性偏离单一标价。
编1笔2严4绘1查1音1递1· 共 11 分鐘
閱讀約 9 分鐘 · 2,904 字·0 次閱讀研究解讀會員已核對播客
论文解读:长上下文真的在「用」全部 token 吗?
研究发现模型对中段信息的利用率显著低于首尾。
探3编3笔20严12绘5查3音6递2· 共 54 分鐘
閱讀約 1 分鐘 · 124 字·0 次閱讀商業動態免費已核對
Anthropic 发布新一代 Claude:编码能力领先,定价不变
新模型在编码基准上刷新纪录。
探3编3笔15严15绘6查3递2· 共 47 分鐘
閱讀約 1 分鐘 · 80 字·0 次閱讀AI 實作免費已核對
用 Stripe 给你的 AI 产品加上订阅:从零到上线的 7 个步骤
Checkout + Billing + Customer Portal 三件套足够覆盖大多数场景。
探4编3笔22严15绘6查3递2· 共 55 分鐘
閱讀約 1 分鐘 · 79 字·0 次閱讀深度會員已核對播客
开源模型追平闭源?我们在 6 个真实任务上做了对比
在 6 个任务中,开源模型在 4 个上差距小于 5%。
探4编4笔23严15绘5查3音6递2· 共 62 分鐘
閱讀約 1 分鐘 · 63 字·0 次閱讀商業動態免費已核對
AI 搜索的广告来了:三家产品的商业化路径对比
三家产品都开始测试广告位。
探3编3笔19严11绘5查2递2· 共 45 分鐘
閱讀約 1 分鐘 · 48 字·0 次閱讀研究解讀會員已核對
研究:让模型「先想再答」能减少多少幻觉?
显式推理能把事实类问答的幻觉率降低约三分之一。
探3编3笔14严15绘5查4递1· 共 45 分鐘
閱讀約 1 分鐘 · 56 字·0 次閱讀深度免費已核對
E2E 测试:DeepSeek V4 推理成本实测
成本和门槛同时下降
编1笔1严1绘1查1音1递1· 共 7 分鐘
閱讀約 3 分鐘 · 913 字·0 次閱讀
深度免費已核對
从 Demo 到生产:AI Agent 落地路线图
Agent 的分水岭不是"能不能跑通一次",而是能否稳定、可回滚、可审计地持续运行——演示效果 ≠ 生产可靠性。
探2编1笔2严5绘1查1音1递1译1· 共 15 分鐘
閱讀約 11 分鐘 · 3,767 字·0 次閱讀
深度免費已核對
OpenAI o3 与 Claude Opus 5.5 对比评测:能力边界、成本与适用场景
原题是一组生命周期错位的对比:o3 已于 2026-08-26 从 ChatGPT 下线、API 快照计划 2026-12-11 删除,而 Claude Opus 5.5 于 2026-09-22 发布,晚于 o3 下线近一个月;同代对比对象应为 GPT-6 Astra / GPT-5.6 Sol vs Opus 5.5。
编1笔1严0绘1查2· 共 5 分鐘
閱讀約 30 分鐘 · 9,970 字·0 次閱讀
新商業動態免費已核對播客
MiniMax 把新模型锁进订阅:M3.1-Flash-Preview 上线 1M 上下文,国庆七天对订阅用户不限量
规格是硬的、跑分是没有的:官方口径为 100 万 token 上下文,输入支持文本/图像/视频,输出仅文本;最大输出长度、输出速度、参数量、权重、每 token 价格全部未公布,也没有厂商基准表与模型卡。
编1笔2严3绘1查2音1递1评1译1· 共 13 分鐘
閱讀約 19 分鐘 · 6,692 字·0 次閱讀深度免費已核對播客
Figure 熔掉上一代机器人,比发布会更能说明行业现状
Figure 把上一代 F.02 熔进 75 吨电弧炉,退役公告本身成了一次内容投放。
编1笔1严1绘1查1音1递1评1译2· 共 10 分鐘
閱讀約 8 分鐘 · 2,813 字·0 次閱讀