论文
Forethought:来自神经符号原语编程的可验证推理
Forethought: Verifiable Reasoning from Neurosymbolic Primitive Programming
摘要
当前智能体工作流通常涉及将用户请求分解为参数正确解析的工具调用序列——其结果经语言模型上下文窗口中的推理踪迹处理。改进此类推理的主流路线是测试时扩展——训练模型搜索长思维链;但由此产生的能力纠缠在模型权重中——无法逐步验证——且推理成本高昂。我们提出Forethought——神经符号推理系统——转而将推理视为显式、可验证的程序——由经领域特定语言组合的符号与神经原语库构建。其结果是推理程序——模型工作的具体表示——因此可在部署前被检查与修改。实例化为工具调用执行内核并在五个基准上评估——Forethought将基座模型准确率相对提升约30%——超越原始提示、强化学习脚手架与提示演化方法——使小模型能够匹敌或超越前沿模型能力。在直接比较中——经Forethought增强的非推理模型与专用推理模型竞争——而后训练投入少约三个数量级——且保持模型无关与可审计。