论文
询问重要的事情:对软件工程任务的奖励驱动的澄清
Asking What Matters: Reward-Driven Clarification for Software Engineering Tasks
摘要
人类通常会不完整地指定任务,因此助理必须知道何时以及如何提出澄清问题。然而,在软件工程任务中,有效的澄清仍然具有挑战性,因为并非所有缺失的信息都同样有价值,并且问题必须针对用户可以实际提供的信息。我们通过量化哪些类型的信息对任务成功影响最大以及哪些问题能引起模拟用户的有用响应来研究实际软件工程任务中的澄清。使用沙普利归因和分布比较,我们确定了有效澄清的两个关键属性:任务相关性(哪些信息预测成功)和用户可回答性(用户可以实际提供什么)。我们将这些属性作为多阶段强化学习奖励来训练 CLARITI,这是一个 8B 参数澄清模块,它与 GPT-5 对未指定问题的解决率相匹配,同时生成的问题减少了 41%。我们的结果表明,基于信息影响和用户责任性的实证分析的奖励设计可以提高澄清效率。