论文

先编译后分页:面向程序化LLM智能体的可执行SOP与能力门控运行时

Compile, Then Page: Executable SOP Programs and a Capability-Gated Runtime for Procedural LLM Agents

智能体系统Agent HarnessAgent Runtime

摘要

企业智能体必须遵循长程、条件化、安全攸关的标准作业程序(SOP)。我们把机器可读的SOP约束编译为可执行伪代码,用程序引导(PG)栈机运行:在LLM执行语义执行的同时分页活动帧。跨六个模型的三臂SOPBench研究分离表示与运行时:编译文本从不显著有害,且在官方散文表现不佳处最多增益16.0分。运行时引导是能力门控的:两个强模型独立呈现正的七域PG对比(58:19与75:31的不一致对),而弱模型受损。全程序光标消融(活动帧优先、保留完整程序)收回强模型拒绝增益的大部分;选择性可见性增加较小改进。配对探针与审计测量把这一分野追溯到自发状态纪律而非重建能力。在Bank上三个主臂从70.4升至86.4再到92.8,拒绝正确率100%。实践建议:先编译;仅在模型级纪律检查通过后启用活动帧分页。

先编译后分页:面向程序化LLM智能体的可执行SOP与能力门控运行时:论文配图
图 1:概述。 (1) 离线、LLM-free 编译器将 SOP 依赖树变成两层程序(调用返回 {h​o​l​d​s,e​v​i​d​e​n​c​e}\{holds,evidence\} 的规则子例程的处理函数;所有 830 个任务编译)。 (2) 堆栈 VM 仅对活动帧进行分页(∼570{\sim}570 与 ∼104{\sim}10^{4} 驻留字符),而 LLM 通过一个簿记工具在语义上执行它。 (3) 福利是有能力限制的;每个验证都是一个可审计的堆栈转换;偏差会被执行(软执行),但会被标记。