论文

FinalityBench:一种针对延迟与冲突金融最终性下智能体决策的效应级基准

FinalityBench: An Effect-Level Benchmark for Agent Decisions Under Delayed and Conflicting Financial Finality

智能体系统Agent任务评测

摘要

商户的支付处理器、账本、ERP系统和银行数据流会因消息延迟、重复、丢失和重排而产生不一致,导致在几分钟内四个系统对同一订单持有相互矛盾的信念。智能体需在是否发货、重新提交捕获、退款或等待等决策中选择,且部分操作不可逆。我们提出了FinalityBench,这是一个可执行的决策基准。它维护一个隐藏的规范事件日志,并从独立故障的交付流中推导出各系统的视图,因此分歧源于预设的故障语义,而非人为设计。评分基于实际发生的货币效应:每个episode的得分由商户终端的经济状态与在待捕获交易最终确认时提供的特权参考值相比得出。该基准包含321个任务,其中45对双胞胎任务(90个任务):在决策时刻四个系统视图完全一致,权威探针均返回未知,且最终正确处置结果不同。这种瞬时视图不可区分性在每次评估种子下均被验证,而非假设;并不声称在所有交互轨迹上等价。来自九种策略的14,445个评分episode中,按单任务准确率和配对损失排名在7个位置存在分歧:优先发货策略准确率第二(65.7%),但配对损失最差,因为它无法区分双胞胎任务。在运行时通过权威最终性探针门控不可逆操作,准确率达到85.4%,且不同于所有轮询策略,其性能不会因pass^5而下降;残差损失几乎完全由一个典型场景导致,该场景直接对最终性信息定价。语言模型在分层子集上达到与手工编写门控相同的准确率,损失约为其两倍,且在未被告知的情况下自主发现了最终性门控策略。