论文
基于 LLM 的软件的可信验收测试的需求增强生成
Requirements-Augmented Generation for Trustworthy Acceptance Testing of LLM-Based Software
摘要
基于 LLM 的软件 (LBS) 将 大语言模型 集成为核心组件,以提供灵活、个性化的响应。与具有确定性输出的传统软件不同,LBS 表现出依赖于上下文的随机行为,这使得经典的验收测试和测试预言机不够充分:根据用户角色和软件上下文,相同的查询可能需要根本不同的响应。这种差距迫切需要自动化验收测试框架,该框架可以自主解释用户指令,同时在不断变化的环境中可靠地推断用户意图。在本文中,我们通过两项技术贡献提出了一种具有校准判决可靠性的 LBS 自动验收测试框架。首先,我们介绍需求增强生成(REAG),它通过自适应 RAG 和自我推理检索相关软件需求、领域知识和角色来解释用户意图,从而生成上下文感知的测试预言。其次,认识到预言机生成可能会检索不相关的约束、误解意图或幻觉需求,我们引入了置信度校准的级联判断。该方法通过模拟专家协议来量化判决的可靠性——接受高可信度的判决,升级不明确的案件,或在不确定时弃权——并由保形风险控制支持的经验可靠性保证。针对生产营养咨询应用程序的工业案例研究表明,REAG 的预言机质量得分为 3.91/5,在 82% 的案例中达到合格或边际预言机质量。经过置信度校准的级联实现了 98.8% 的准确率,通过过滤不合格的输出,将预言机质量从 3.91 提高到 4.30,并比单判断基线提高了 31.7% 的成本效率,验证了工业可行性