论文

AI从应用原型图生成Backlog的效果有多好?

How Well Can AI Generate Backlogs from App Mockups?

模型评测评测方法与指标

摘要

创建Sprint backlog需要耗费大量精力,因为epic、用户故事和任务等条目可能被遗漏或规格不一致。我们提出一种多模态方法,以支持从可视化应用原型图生成backlog,原型图是项目早期即可获得的产物。我们在GPT-4o上评估三种提示策略:zero-shot基线、用于视觉-语言推理的组合思维链(Compositional Chain-of-Thought,CCoT),以及角色驱动(persona-driven)提示。我们研究了横跨两个国家的七个应用开发项目,并就结果访谈了开发者。总体上,我们观察到基线提示偏重召回率胜过精确率,而CCoT更为均衡,在epic和用户故事上取得52-66%的平均F1分数。任务(task)条目更难准确生成。加入架构上下文时精确率提升最为一致,尤其是后端任务(精确率提升最高达35%)。对开发者的访谈显示,多达26%的假阳性仍被认为有用,这反映了backlog创建的创造性与开放性。为捕捉这一点,我们提出名为Revised Recall的新度量,用开发者评估补充真值(ground-truth)评估。我们的发现表明,结合架构上下文的混合提示可以辅助从早期原型图生成backlog,但结果因条目类型而异,且开发者监督仍然必要。

AI从应用原型图生成Backlog的效果有多好?:论文配图
图 2:研究方法概述。