论文
HeavySkill:把重思考作为智能体Harness的内技能
HeavySkill: Heavy Thinking as the Inner Skill in Agentic Harness
摘要
配备记忆、技能与工具使用的编排框架类智能体harness在复杂推理任务上成就显著,但真正驱动性能的底层机制仍被复杂的系统设计所遮蔽。本文提出HeavySkill视角:重思考不仅是编排harness中的最小执行单元,更是内化于模型参数、驱动编排器解决复杂任务的内技能。我们识别该技能为两段流水线——先并行推理再总结——可在任何智能体harness之下运行。我们对HeavySkill做了跨领域的系统实证研究。结果显示该内技能一致优于传统Best-of-N(BoN)策略;值得注意的是,更强的LLM甚至能逼近Pass@N性能。关键在于,我们证明重思考的深度与宽度作为可学习技能可经强化学习进一步扩展,为无需脆弱编排层即内化复杂推理的自进化LLM指出了一条有希望的道路。
