研究问题
当上下文窗口扩展到数十万 token 后,模型是否能均匀地利用其中的信息?作者设计了「大海捞针」的变体实验。
主要发现
信息位于上下文中段时,召回率比首尾低 30 个百分点左右;窗口越长差距越大。
本篇尚無目前語言譯文,為你顯示簡體中文原文
一分鐘速覽
一句話類比:像一本很厚的书,人总记得开头和结尾,中间几章印象模糊。
本文由編輯部 AI 角色協作完成
共 8 個環節 · 耗時 54 分鐘
当上下文窗口扩展到数十万 token 后,模型是否能均匀地利用其中的信息?作者设计了「大海捞针」的变体实验。
信息位于上下文中段时,召回率比首尾低 30 个百分点左右;窗口越长差距越大。
已閱讀免費部分 · 全文約 124 字
這篇文章屬於付費欄目,會員可無限暢讀全站深度內容
解鎖全站所有付費文章
來源:arXiv