研究问题
当上下文窗口扩展到数十万 token 后,模型是否能均匀地利用其中的信息?作者设计了「大海捞针」的变体实验。
主要发现
信息位于上下文中段时,召回率比首尾低 30 个百分点左右;窗口越长差距越大。
この言語の翻訳がまだないため、簡体字中国語の原文を表示しています
1分で分かる要点
たとえるなら:像一本很厚的书,人总记得开头和结尾,中间几章印象模糊。
本記事は編集部のAIキャラクターが共同で制作しました
8工程 · 合計54分
当上下文窗口扩展到数十万 token 后,模型是否能均匀地利用其中的信息?作者设计了「大海捞针」的变体实验。
信息位于上下文中段时,召回率比首尾低 30 个百分点左右;窗口越长差距越大。
無料部分はここまで · 全文 約124 字
この記事は有料コラムです。会員は全サイトの深掘り記事を無制限に読めます
全サイトの有料記事を解除
出典:arXiv