论文
可重放的金融智能体:面向工具使用 LLM 智能体的确定性-忠实性保障测试装置
Replayable Financial Agents: A Determinism-Faithfulness Assurance Harness for Tool-Using LLM Agents
摘要
LLM 代理在监管审计重放方面遇到困难:当要求使用相同的输入重现标记的交易决策时,大多数部署无法返回一致的结果。本文介绍了确定性-忠诚保证框架 (DFAH),这是一个用于衡量金融服务中部署的工具使用代理的轨迹确定性和证据条件忠诚度的框架。在非代理基线实验中的 74 个配置(12 个模型、4 个提供商、8-24 个运行,每个运行 T=0.0)中,7-20B 参数模型实现了 100% 确定性,而 120B+ 模型需要 3.7 倍大的验证样本才能实现同等的统计可靠性。代理工具的使用引入了额外的差异(参见表 4-7)。与假设的可靠性-能力权衡相反,决定论和忠诚度之间出现了正皮尔逊相关性(r = 0.45,p < 0.01,n = 51,T=0.0);产生一致输出的模型也往往更符合证据。提供了三个财务基准(合规性分类、投资组合约束、DataOps 例外;每个 50 个案例)以及开源压力测试工具。在这些基准测试和 DFAH 评估设置下,具有模式优先架构的第 1 层模型达到了与审计重放要求一致的确定性级别。