论文
MOCHA:面向智能体技能优化的多目标Chebyshev退火
MOCHA: Multi-Objective Chebyshev Annealing for Agent Skill Optimization
摘要
LLM智能体通过技能来组织行为——技能是结构化的自然语言规范,约束智能体如何推理、检索和响应。与单体式提示不同,技能是受硬性平台约束的多字段工件:描述字段在路由时会被截断,指令主体通过渐进式披露被压缩,共存的技能还要争夺有限的上下文窗口。这些约束使技能优化本质上是多目标的:技能必须同时最大化任务性能并满足平台限制。然而现有的提示优化器要么忽视这些权衡,要么将其坍缩为加权和,从而错失非凸目标区域中的Pareto最优变体。我们提出MOCHA(Multi-Objective Chebyshev Annealing,多目标Chebyshev退火),它用Chebyshev标量化取代单目标选择——覆盖包括非凸区域在内的完整Pareto前沿——并结合从探索过渡到利用的指数退火。在横跨六种不同智能体技能的实验中——所有方法共享相同的多目标变异算子,且基线获得相同的按目标文本反馈——现有优化器在6个任务中的4个上未能改进种子技能:1000次rollout零进展。MOCHA在所有任务上都取得突破,平均正确率相对最强基线提升7.5%(FEVER上最高达14.9%,TheoremQA上10.4%),同时将发现的Pareto最优技能变体数量翻倍。
