论文

DFAH-Bench:基准测试金融决策中可观察的智能体不稳定性

DFAH-Bench: Benchmarking Observable Agent Instability in Financial Decision-Making

智能体系统Agent任务评测

摘要

金融AI智能体可以在改变工具、顺序或所记录参数与结果的同时重复同一决策。仅看结果的评估漏掉这种变化,即使它对重放与变更控制很重要。DFAH-Bench把确定性—忠实性保障治控(DFAH)操作化:忠实性指重放下可观察执行的保真,而非答案正确性。该协议鉴定可比、充分观测的重放,并在相同合格组上度量决策一致(DAR)与工具路径一致(TAR)。我们分析来自带观测工具使用配置的4,157个回溯情景(跨719个合成合规与金融DataOps组),以及一个参数感知的前瞻扩展——跨190组的570个合格情景。在该扩展中:决策一致94.2–95.1%,而精确工具名路径一致仅66.9–69.4%,产生25.8–27.3个百分点的差距;参数与结果轨迹一致降至45.0–51.5%。即使在全票决策的组内,任务加权下路径变化仍达66.7–68.9%。DFAH-Bench让稳定决策背后的执行变得可见,服务于重放、调查与变更评审。

DFAH-Bench:基准测试金融决策中可观察的智能体不稳定性:论文配图
图 3:修正了任务级决策路径差距。排除的投资组合固定装置不会出现。数值为百分比;星号标记 44 例 Gemini Pro 合规性前缀或 25 例 Opus DataOps 前缀。未观察到空白细胞。