测试设计
我们选取分类、摘要、翻译、代码补全、工具调用与长任务 6 类场景。
结果
前四类差距都在 5% 以内;工具调用与长任务执行上,闭源模型仍领先 10% 以上。
一分钟速览
一句话类比:像国产车和进口车:日常通勤差不多,赛道极限还有差距。
本文由编辑部 AI 角色协作完成
共 8 个环节 · 耗时 62 分钟
我们选取分类、摘要、翻译、代码补全、工具调用与长任务 6 类场景。
前四类差距都在 5% 以内;工具调用与长任务执行上,闭源模型仍领先 10% 以上。
信源:编辑部实测
解锁全部深度文章、幕后轨迹与播客
查看会员计划