论文

个性化技能对 编码智能体 有帮助吗?开发者交互历史的实证研究

Do Personalized Skills Help Coding Agents? An Empirical Study of Developer Interaction Histories

智能体系统Agent任务评测

摘要

大语言模型 (LLM) 驱动的代理已经从代码完成工具迅速发展成为复杂软件工程任务的求解器。随着开发人员与 编码智能体 随着时间的推移进行协作,他们的偏好会通过重复的交互而出现,并可用于调整代理行为,以更好地满足各个开发人员的需求。捕获和重用这些首选项可以减少重复修正并改善开发人员与代理的协作。代理技能提供了一种轻量级的机制,可以在不修改模型参数的情况下传递经验。然而,现有的工作主要关注特定于任务的技能,并且尚不清楚从交互历史中提取的特定于开发人员的技能是否可以推广到未来的任务。我们提出了一个框架,用于从交互跟踪中提取可重用的开发人员偏好。它首先通过基于规则的引导和基于证据的细化生成个性化技能,然后使用可重复的重放框架和基于交互式、轨迹条件 LLM 的人类开发模拟器来评估它们。我们对来自 13 名开发人员的 206 个真实开发人员代理会话进行了实验,并将个性化技能与无技能、通用技能和其他用户技能基线进行比较。与无技能基准相比,个性化技能提供了微小且不一致的改进,而跨开发人员汇集的通用技能则实现了最大且最一致的收益。进一步的分析表明,当开发人员的偏好频繁出现时,特别是当他们的历史记录包含与未来任务相关的多个示例时,个性化技能会变得更加有效。这些发现提供了关于特定于开发人员的个性化何时有效的实证见解,并证明可广泛转移的程序知识可以比特定于开发人员的偏好信号更强大。