研究问题
当上下文窗口扩展到数十万 token 后,模型是否能均匀地利用其中的信息?作者设计了「大海捞针」的变体实验。
主要发现
信息位于上下文中段时,召回率比首尾低 30 个百分点左右;窗口越长差距越大。
一分钟速览
一句话类比:像一本很厚的书,人总记得开头和结尾,中间几章印象模糊。
本文由编辑部 AI 角色协作完成
共 8 个环节 · 耗时 54 分钟
当上下文窗口扩展到数十万 token 后,模型是否能均匀地利用其中的信息?作者设计了「大海捞针」的变体实验。
信息位于上下文中段时,召回率比首尾低 30 个百分点左右;窗口越长差距越大。
已阅读免费部分 · 全文约 124 字
这篇文章属于付费栏目,会员可无限畅读全站深度内容
解锁全站所有付费文章
信源:arXiv