论文
ReVerPi案例:上下文压缩评测遗漏了哪些失败
Completed Pairs Hide Capped Failures: A ReVerPi Case Study of Selective Context Projection
摘要
上下文投影以紧凑、可寻址的摘录替换旧工具观察,能减少重复输入,却可能增加检索证据的轮次。本文在ReVerPi中研究这一权衡;它是一个保存历史观察并对齐完整上下文与投影上下文后续执行的Pi扩展。在86次源码阅读运行、641次模型请求中,完成的15组配对两组成功率相同,均为12/15。另有12次边界运行被停止:第一组未完成时,执行器便不运行另一组。将全部27次边界运行纳入后,投影相对完整上下文的成功任务数差值被限定在−9至+1之间。一个被省略、由选择器选中的投影后续执行虽成功检索归档文本,却耗尽12次请求,其完整上下文对照只用3次请求就作答。11组双方均正确的配对构成该批记录中完整可观测的成功子集:投影减少逻辑token总量25%,但配对token用量的中位数增加29%,后续请求总数从35增至55。分开拟合与评估后,选择器表面上的持平结果发生变化:除去4组拟合配对,在13次可比较运行中多出一次失败,逻辑token增加8.6%。本方法案例联系了停止规则、已知有界失败、未执行对照和资源汇总。结论仅适用于记录的实验,不能证明相对不受限制Pi的总体非劣效性或优越性。评估应保留每个干预边界,不因第一组是否完成而决定另一组是否执行,并同时报告完成情况、交互次数和token消耗。