论文
贝叶斯代理:跨 LLM 代理Harness的后向引导技能进化
Bayesian-Agent: Posterior-Guided Skill Evolution Across LLM Agent Harnesses
摘要
LLM 代理越来越依赖提示、工具、内存、SOP、技能和利用反馈,但当前的自我进化管道通常通过启发式反思或原始成功计数来更新这些资产。当轨迹稀疏、昂贵且依赖于上下文时,此类更新很脆弱。我们引入了贝叶斯代理,这是一个原生的跨框架框架,它将可重用的代理技能视为贝叶斯证据对象。贝叶斯代理记录经过验证的轨迹,维护对技能可靠性和故障模式的后验信念,并将这些信念转化为可审核的技能动作和面向模型的护栏。这种后视图提供了原始经验率技能更新的有限样本替代方案,并框架提示、上下文和利用工程作为对外部决策环境的推理。在 RealFin-Bench 上,贝叶斯技能进化匹配或改进了原始经验速率控制,并在本地运行中产生了巨大的收益。在增量模式下,增量修复将SOP-Bench从80%提高到95%,Lifelong AgentBench从90%提高到100%,RealFin-Bench从45%提高到65%。后端和模型缩放消融进一步表明,只要该工具生成可验证的任务工件,后向引导修复就可以在 BA Native、MiniSWEAgent 和 Claude Code 上运行。源代码可在 https://github.com/DataArcTech/Bayesian-Agent 获取。