论文
谁执笔定案?让规范而非智能体签发完成
Who Holds the Pen? Let Specifications, Not Agents, Sign Off
摘要
大型语言模型智能体日益在单一智能体循环中结合生成、决策、执行和自我评估。尽管它们在任务指令、指南、输出模式和可复用技能等外部规范下运行,这些规范通常仍作为同一个既行动又宣布完成的模型的上下文存在,没有独立的规范权威边界。我们识别由此产生的两个缺口。理解-执行缺口出现在需求被理解但未在执行中满足时;状态-权威缺口出现在智能体的解释或完成声明未能建立所需状态时。在SkillsBench上,仅使用智能体可见的提示、工作区信息和注入的技能规范,我们抽取了509条有源依据的任务方向。跨七个模型,仅79.6%-86.4%被满足,而完成声明率超出官方评测器通过率28.7-37.9个百分点。因此我们把智能体提案与权威状态分离。智能体可以规划、行动和请求完成,但只有来自合格提供者的可采信证据才能建立受规范治理的状态。SpecHarness把这一原则落地:将可见规范编译为带源链接的义务,并通过版本化的义务状态治理执行与终结。可验证要求在运行时被中介或验证,而模糊或主观要求保持咨询性质。在指南遵循和产物生成任务上的实验表明,规范不仅可以作为行为指导,还可以作为对合规执行与完成的权威。
