论文

ReguSim:评估LLM智能体在金融合规中的规则落地能力

ReguSim: Evaluating LLM Agent Rule Grounding in Financial Compliance

智能体系统Agent任务评测

摘要

金融市场中的 LLM 智能体可能引用规则,却仍提交违反可执行约束的订单,或误读监控证据。我们引入 ReguSim,一个受控的金融合规环境,以及 ReguBench,一个带目标标记的监控基准,用于分离四种产物:陈述性推理、尝试性动作、执行强制与监控证据。在使用 DeepSeek V4 Pro 和 Gemini 3.5 Flash 的交易员运行中,可见规则减少了但并未消除被拒绝的动作,激励或人设设定会改变行为。一项桥接研究表明,除非展示执行证据,交易员的推理陈述可能误导独立监控方。在监控方面,简单的结构化基线要么持平要么超过仅用提示词的 LLM。这些结果把金融合规评估界定为对“规则落地动作与证据使用”的审计,而非单一的合规分数。

ReguSim:评估LLM智能体在金融合规中的规则落地能力:论文配图
图1:ReguSim与ReguBench流程。ReguSim记录提示状态、交易者理由/动作、执行结果和追踪证据;ReguBench据此证据评估带目标标记的监控判断。