论文

APEXA:同步辐射数据缩减多Agent LLM自动化的执行完整性强制

APEXA: Execution-Integrity Enforcement for Multi-Agent LLM Automation of Synchrotron Data Reduction

智能体系统Agent 动作执行与治理Agent Harness

摘要

同步辐射数据缩减——探测器校准加上对太字节级衍射序列的方位角积分——是一个多步骤、依赖专家的瓶颈,日益限制用户设施的科学产出率。LLM 智能体有望消解它,但用随机模型驱动真实管线会带来聊天基准无法察觉的失败模式:智能体可能报告一个从未被计算过的校准结果。这里的正确性是“执行了什么”的属性,而非对话记录的属性。我们提出 APEXA,一个已部署的多智能体框架(横跨异构算力的 61 个工具,作为单一推理循环运行),在大型光源设施上用自然语言自动化校准与积分。我们做出三项贡献。第一,执行完整性强制:一个确定性的工具层守卫,拒绝呈现任何没有已执行工具调用支撑的结果,其解析器能容忍跨模型的工具调用格式漂移。部署中,一个前沿模型为从未运行的命令编造了完整的校准对比报告,守卫将其转换为显式的“非结果”;同一代码为可选的马达控制面设置门控,在对抗模拟 IOC 时 200 次攻击零违规,而等效安全提示为 15/200。第二,我们发布 APEXA-Bench,一个包含 58 个设施任务(50 个基础任务加 8 任务跨探测器切片)的评测工具,按四类物理后果分类组织,是我们所知首个区分“浪费一个计算周期”与“损坏仪器”的基准轴;其对照 NIST 可溯源晶格常数的跨探测器评分暴露了两个潜在管线缺陷。大规模智能体打分留待全长研究。第三,我们在真实束线数据上验证 APEXA:从一句自然语言提示即可恢复探测器几何并对完整的衰减/曝光扫描进行积分。框架、评测工具与轨迹均已发布。

APEXA:同步辐射数据缩减多Agent LLM自动化的执行完整性强制:论文配图
图1:Apexa 根据一条自然语言提示,端到端处理真实高能衍射数据。各面板来自 ai_tune 光束线数据集中的同一次 CeO₂ 校准采集(63 keV,样品到探测器距离约900 mm,2880×2880像素,像素尺寸150 μm):(a)原始探测器图像;(b)暗电流扣除与坏像素遮罩后的图像;(c)自主 MIDAS 校准,含拟合的 CeO₂ 德拜—谢乐环和恢复的几何参数(距离895.80 mm,束心(1410,1447)像素,波长0.1968 Å,残余伪应变1.3×10⁻⁶);(d)方位角积分的2θ—η图;(e)带已索引反射的一维曲线。图3展示完整衰减与曝光扫描中几何恢复的稳健性。全部值均读取自运行清单,未人工调参。