论文
VIGIL:用于电子表格问答的验证者通知的门控改进循环
VIGIL: Verifier-Informed Gated Improvement Loop for Spreadsheet Question Answering
摘要
企业智能体应该从延迟反馈中进行改进,而不是允许每次修正都重写系统行为。我们研究持续的Harness学习以实现语料库级别的电子表格问答。在静态检索和执行骨干模型 FiCo(查找然后计算)的基础上,我们引入了 VIGIL(验证者通知的门控改进循环)。在问题中,VIGIL 会验证和修复不同提示的结构化查询语言 (SQL) 候选者。在各个情节中,延迟标签仅更新合同校准器和查询/结果列选择器。基本模型、提示、检索器和记录的候选池在持续学习协议中保持固定。通过提供正确工作簿和预期类型,非门控和双门控完整重放变体在 79 个文档中的转发准确度从 75.8% 的静态基线达到 82.4% 和 82.0%。双门具有较大的回溯增益(2.7 点与 2.3 点),其 6.3 点的前向增益具有 5.6-6.9 的 95% t 区间。在从拟合和在线推广中排除 16 个文档和 380 个问题的单独更严格的分割中,仅准确度门将 10 个最终Harness的平均留出准确度从 80.3% 提高到 86.7%。仅校准器适应增益 5.9 点,接近组合增益 6.4 点。然而,26 个门批准的更新中的 3 个相对于现有更新降低了留出的准确性,因此重播缓冲区不回归并不意味着留出不回归。 MiMoTable 和外部任务案例研究测试任务内验证并重复使用相同的提升或保留规则。总体而言,结果支持有界的、可审计的Harness适应,同时揭示了有限重放门无法推广到其升级缓冲区之外的地方。
