论文

BITEM参与NTCIR-19 R2C2:由Agentic RAG流水线信号预测置信度

BITEM at the NTCIR-19 R2C2 Task: Predicting Confidence from Agentic RAG Pipeline Signals

上下文与知识检索增强

摘要

BITEM 团队使用单个 Agentic 管道输入 NTCIR-19 R2C2 任务的两个子任务,其中模型搜索、读取和记录电影语料库中的证据,而编排器则保存可提交内容的记录和规则。只有当蕴含级联对其引用的段落进行检查后,一个主张才会被承认,并且只有在有足够的检查证据支持它时,才会发布答案。每个问题都会运行三到四次,每一次从语料库中检索的内容都会被剥夺之前通过的内容。每个答案提交的置信度是由协调器根据运行留下的内容计算出来的,并且不会询问模型,也无法对模型进行自我评级。两次检索运行分别位于 22 项中的第 4 名和第 5 名,汇集通行证的价值为 0.0709 nDCG@20,并且在多跳和后处理繁重的问题上收益最大,组织者将汇集运行排名在该领域的顶部。 25 个答案运行中有 16 个是基于这两个运行提供的段落,其中 12 个是由其他团队提交的。 HMR 奖励的系统在回答正确时置信度较高,在回答错误时置信度较低。管道的准确度达到了 0.9219,在 25 项中排名第 6,而这些答案提交的置信度给出的 HMR 为 0.4915,在 25 项中排名第 13。针对这些相同的记录信号制定了一些规则,无需进一步的模型调用和进一步的检索,将其精度提高到 0.9375(第 5),HMR 提高到 0.6985(第 9)。仅根据 HMR 进行排名就可以奖励低置信度错误回答的系统,因此我们提出了 accHMR,即准确率乘以 HMR,它按照与准确率成比例的方式报告奖励,修订后的规则将获得 0.6549 分,排名第五。对于未来的工作,根据管道已经产生的数字拟合模型,而不是手动编写此类规则,将是真正的进步。