论文
更少澄清、更好代码:编程助手中跨会话个性化歧义适配的基准评测
Fewer Clarifications, Better Code: Benchmarking Cross-Session Personalized Ambiguity Adaptation in Coding Assistants
摘要
AI辅助编程日益将非正式的用户意图转化为可执行软件,但编程请求常常包含在任务与会话之间以用户特有方式反复出现的歧义。现有的歧义消除方法通常在当前编程会话内孤立地处理每个含歧义请求,往往通过引出额外的澄清来完成。然而,同一用户已解决的会话历史能否作为记忆,用于在新开启的会话中消解反复出现的个性化歧义,仍缺乏充分探索。我们将个性化歧义适配表述为一个新任务:给定该用户此前已解决的编程会话和一个新的含歧义请求,助手应识别反复出现的歧义模式、产出符合意图的可执行方案,并尽量减少澄清。为对该任务进行基准测试,我们提出CAPA,它通过六种机制刻画个性化编程歧义,并使用受控的三阶段生成流水线将这些机制注入无歧义的可执行任务。CAPA包含分布在60个均衡的用户-歧义单元中的600个编程会话,其中包括300个留出的评估会话。我们在无历史和同用户历史两种条件下,以可执行成功率、首轮成功率和完成所需轮数评估了12个近期LLM。我们的分析考察了任务难度、用户身份和基于记忆的历史使用,并进一步提出同用户历史门控作为一种轻量的推理时方法。CAPA为开发长期编程助手奠定了基础,使其在让生成的代码更好对齐用户意图的同时,减少重复澄清。
