论文

MOCHA:面向智能体技能优化的多目标Chebyshev退火

MOCHA: Multi-Objective Chebyshev Annealing for Agent Skill Optimization

智能体系统Agent Skills

摘要

LLM智能体通过技能来组织行为——技能是结构化的自然语言规范,约束智能体如何推理、检索和响应。与单体式提示不同,技能是受硬性平台约束的多字段工件:描述字段在路由时会被截断,指令主体通过渐进式披露被压缩,共存的技能还要争夺有限的上下文窗口。这些约束使技能优化本质上是多目标的:技能必须同时最大化任务性能并满足平台限制。然而现有的提示优化器要么忽视这些权衡,要么将其坍缩为加权和,从而错失非凸目标区域中的Pareto最优变体。我们提出MOCHA(Multi-Objective Chebyshev Annealing,多目标Chebyshev退火),它用Chebyshev标量化取代单目标选择——覆盖包括非凸区域在内的完整Pareto前沿——并结合从探索过渡到利用的指数退火。在横跨六种不同智能体技能的实验中——所有方法共享相同的多目标变异算子,且基线获得相同的按目标文本反馈——现有优化器在6个任务中的4个上未能改进种子技能:1000次rollout零进展。MOCHA在所有任务上都取得突破,平均正确率相对最强基线提升7.5%(FEVER上最高达14.9%,TheoremQA上10.4%),同时将发现的Pareto最优技能变体数量翻倍。

MOCHA:面向智能体技能优化的多目标Chebyshev退火:论文配图
图 1:(a) 技能优化产生正确性与合规性的权衡:优化后的技能 p*p^{*} 获得正确性,但可能违反合规性限制。 (b) MOCHA 通过两个阶段来实现这种权衡:探索(绿色)扩大帕累托前沿,然后利用(紫色)完善极端。