更好地与您合作:将用户更正编译到 编码智能体 的运行时实施中
Getting Better at Working With You: Compiling User Corrections into Runtime Enforcement for Coding Agents
摘要
交互式 LLM 代理正在成为日常工作的一部分,但随着时间的推移,它们并不会变得更容易使用:在一个会话中记住的更正可能在下一个会话中仍然会被违反。我们研究偏好访问和偏好遵从之间的差距。在源自匿名真实用户摩擦案例的任务中,Mem0 内存仍然导致 57.5% 的适用偏好检查遭到违反。我们引入了测试时规则获取和编译执行(TRACE),这是一个用于编码代理运行时的插入式技能层管道,它挖掘用户更正,将它们重写为原子规则,并将它们编译成运行时检查,这些检查必须在代理完成未来任务之前通过。与开发人员提前编写的运行时检查不同,TRACE 技能来自用户自己的聊天更正。我们通过 ClawArena 编码代理任务和 MemoryArena 衍生的内存密集型任务的模拟用户循环实验来评估 TRACE。在 ClawArena 上,TRACE 将分布内任务的保留偏好违规从 100.0% 减少到 37.6%,将分布外任务的保留偏好违规从 100.0% 减少到 2.0%。在 MemoryArena 派生的任务上,TRACE 将分布违规从 100.0% 减少到 60.5%,同时匹配或超过任务传递时最强的内存基线。这些结果表明,将修正编译到运行时强制中可以解决仅靠内存无法可靠解决的重复摩擦故障模式,从而减少用户在未来会话中重述相同修正的需要。实验代码可在 https://github.com/YujunZhou/TRACE_exp 获取,可部署技能可在 https://github.com/YujunZhou/tellonce 获取。