论文
SAGE:从直接回答到中国古代文献理解的循证推理
SAGE: From Direct Answering to Evidence-Grounded Inference for Chinese Ancient Document Understanding
摘要
中国古代文献的理解需要复杂的视觉、语言和历史推理。当前的大型视觉语言模型 (LVLM) 通常依赖于不透明的单遍生成范式,通常会产生过度自信且基础薄弱的响应。为了解决这个问题,我们提出了 SAGE,一种基于证据的多主体框架,它将中国古代文献理解重新表述为基于证据的推理,而不是直接生成答案。 SAGE 协调专门的代理,以在受限的共享状态运行时下进行任务感知规划、工具介导的证据获取、声明级验证和有界重新规划。这种设计支持有界证据寻求、答案修改以及基础不足时的弃权。 AncientDoc 基准测试表明,SAGE 在三个 LVLM 主干上始终优于匹配的直接回答基线。值得注意的是,SAGE 与 Qwen3.5-9B 在大多数评估指标上都超越了更大的整体 LVLM,凸显了模型扩展之外的结构化、基于证据的推理的重要性。