论文

WikiLoop:通过下游反馈联合学习构建和导航代理原生 Wiki

WikiLoop: Jointly Learning to Build and Navigate Agent-Native Wikis with Downstream Feedback

摘要

知识库构建和查询通常是单独优化的:检索增强代理在固定的、外部维护的索引上运行,而构建不接收来自下游使用的信号。我们提出了 WikiLoop,这是一个反馈耦合框架,可以共同学习构建和导航代理原生 Wiki,这是一个专为机器导航而设计的持久链接页面知识库。角色条件共享策略支持两个接口:导航器从 Wiki 检索证据来回答查询,构建器提出通过下游导航评估的结构化编辑。导航器遵循先充足后效率的目标,仅在收集完整证据后才应用检索成本惩罚。构建器从效用差异中学习:冻结的导航器通过下游性能的变化对每个候选编辑进行评分,而保护惩罚则阻止对不相关查询的回归。训练将顺序特定于角色的优化与角色同质批次的最终联合阶段相结合。以 Qwen3.5-9B 作为共同主干,WikiLoop 在 AuthTrace 上达到了 62.6 的聚合答案正确性,比 LLM-Wiki 基础高 6.3 分,在多文档查询上收益最大。受控比较支持两个目标的预期效果,并且学到的编辑对于坚持不懈的导航员仍然有用。配对比较表明,最终的共享策略在很大程度上保留了特定于角色的功能,相对于相应的专家参考,将导航器和端到端答案正确性提高了 0.4 个点,并将两个接口合并为一个模型。在没有特定于数据集的训练的情况下,WikiLoop 还基于 HotpotQA 和 MuSiQue 改进了相同主干 LLM-Wiki。