论文
NFR评估多轮LLM对话中的准确率与满意度
Accuracy and Satisfaction in Multi-Turn LLM Dialogues for NFR Assessment
摘要
基于LLM的对话助手已成为软件开发者的主流工具——但当前评估基准只关注功能正确性。这在评估这些对话处理非功能需求(NFR)时的质量与准确性上留下关键缺口——NFR本质含糊、依赖上下文并涉及程序的许多部分。评估这些系统对NFR协作推理的支持需要超越单轮准确率的方法——同时捕捉系统输出的正确性与多轮交互的质量。本文中——我们调查开发者与基于LLM的智能体在健康保险可携性与责任法案(HIPAA)合规领域的多轮对话的准确率与质量。我们雇用49名程序员与GitHub Copilot交互——对照iTrust代码库(按HIPAA法规设计的系统)从三个维度评估148个HIPAA衍生NFR:需求满足度、推理与代码定位。我们发现开发者倾向于同意LLM评估——但对照专家真值的准确率低。我们对用户满意度建模——发现更长的系统响应与更多提供信息的轮次负面影响用户满意度——而主动交互正面影响它。我们的发现为设计支持NFR评估的基于LLM的对话系统提供洞见。
