论文
证据阅读诊断是否可以改善小型 LLM 推荐系统的界面选择?
Do Evidence-Reading Diagnostics Improve Interface Selection in Small LLM Recommenders?
摘要
行为测试衡量语言模型如何读取证据。我们询问这些测量是否有助于选择推荐界面。我们通过时间顺序评估和 3,426 个评估用户来评估跨四个推荐领域的 6 个小型指令调整检查点。每个请求排名八位候选人。基线选择器在仅历史提示、协作证据提示和分数融合之间进行选择。它使用可观察的特征和六个不同措辞和候选顺序的稳定性提示。增强选择器添加了六个证据阅读提示的功能,要求模型比较支持计数。在每个域和检查点的开发(验证)数据上选择一次的接口得分为 0.5524 NDCG@5,而基线选择器为 0.5447,增强选择器为 0.5428。添加诊断功能会将 NDCG@5 更改为 -0.0019(95% 区间 [-0.0046, 0.0004])。该区间包括零,其上限低于分析计划的 0.005 改进目标。匹配选择器的超参数也会使间隔上限低于该目标。与使用随机选择的活动匹配用户的对照相比,检索到的相似用户的证据将提示提高了 0.0999 NDCG@5。证据阅读测试还揭示了答案位置和平局反应偏差。这些结果涉及经过测试的选择器和候选集。它们说明了为什么应该通过诊断测量是否改进现有功能和固定界面之外的推荐选择来评估诊断测量。