论文

LEDGERMIND:具有结构化证据分类账的来源约束多模式代理推理

LEDGERMIND: Provenance-Constrained Multimodal Agentic Reasoning with a Structured Evidence Ledger

智能体系统Agent 架构与控制循环

摘要

用于视觉问答的多模态代理越来越多地作为多步骤轨迹运行,交织感知、检索和推理,但评估仍然在很大程度上降低了最终答案的准确性。这个聚合信号无法判断是否通过有根据的证据、语言先验或意外错误消除得出了正确答案。我们建议将多模式代理轨迹视为出处受限的状态机:工具输出被标准化为充当轨迹状态的结构化证据账本,下游推理和决策声明可能仅引用活动账本条目,在实体和数字级别检查基础,并且修复被实现为类型化状态转换,如果没有工具生成的出处,则无法引入内容。我们将此设计实例化为 LedgerMind(具有结构化证据分类帐的来源约束多模式代理推理),并通过三层证据对齐协议、将推理深度与问题复杂性相匹配的自适应双路径调度程序以及具有正式来源非放大保证的事件触发验证和修复引擎进行了增强。我们使用 LedgerMind 来针对最终答案准确性往往会模糊的四种重复出现的故障模式:不支持的中间推理、引用支持的实体幻觉(虚假证据对齐)、对简单查询的过度推理以及修复时间放大。跨多个多模态推理基准和主干 MLLM 的实验表明,LedgerMind 提高了答案准确性和轨迹级别 忠实性。