论文

压缩、结构和执行器能力:语言模型代理技能优化的受控实际成本分解

Compression, structure, and executor capability: a controlled real-cost decomposition of language-model agent skill optimisation

智能体系统Agent任务评测

摘要

代理技能,即提供给使用工具的语言模型的可重用指令制品,通过缩短、结构重写、更强的模型编译和范围加载而日益优化,假设更小或组织更好的技能可以降低成本,同时保持成功。这种假设很少用在相同运行中测量的质量和实际货币成本以及分离的影响因素来检验。这项研究报告了对 10 个技能交付条件、40 个软件工程任务和每个单元 3 次重复(1,200条执行轨迹)的受控分解,将无技能执行、原始技能、确定性缩短、来自共享语义分类账的线性和结构化渲染、范围加载以及编译器和执行器模型层分开。质量是任务级别的验证者通过率;成本是按标准提供商价格计算的解决阶段词元成本,具有稳健性的词元数量标准化视图和单独摊销的编译成本。任务是推理的单位,间隔是任务聚类的,对比族是多重控制的。确定性缩短接近原始基线,但未在预设范围内建立非劣效性。结构化渲染和范围加载降低了紧凑执行器上的通过率,而不会降低成本,并且结构化渲染与匹配内容处的线性文本无法区分。唯一幸存的对比修正是执行器功能,它以大约是实际成本的五倍的价格将通过率提高了 27 个百分点,而编译器层没有显示出稳健的效果。在实际价格下,没有任何优化的表示能够达到实际的收支平衡。证据表明,执行者能力是主导杠杆,并且没有任何代表策略能够比任一执行者层的原始技能有所提高。