论文

用于定性数据分析的 LLM 在人体实验中因安全特定评论而失败

LLMs for Qualitative Data Analysis Fail on Security-specificComments in Human Experiments

模型评测模型能力评测

摘要

[背景:]人体实验中自由文本论证的主题分析提供了重要的定性见解。然而,它的成本很高,因为可靠的注释需要多个领域专家。 大语言模型 (LLM) 似乎是替代人类注释者的理想候选者。 [问题:] 编码特定于安全性的方面(提到的代码标识符、提到的代码行、提到的安全关键字)可能需要比情感分类更深入的上下文理解。 [目的:]探索LLM是否可以充当人类受试者技术安全评论的自动注释器。 [方法:] 我们在 LiveBench 上提示四个表现最好的 LLM,以检测人类受试者分析易受攻击的代码片段的自由文本注释中的 9 个与安全相关的代码。使用 Cohen 的 Kappa(机会校正精度)将输出与人类注释者进行比较。我们模仿注释最佳实践来测试不同的提示,包括新兴代码、带有示例的详细代码簿以及冲突示例。 [负面结果:]我们仅在使用详细的代码描述时观察到显着的改进;然而,这些改进在不同代码中并不统一,并且不足以可靠地取代人类注释者。 [局限性:] 需要更多 LLM 和注释任务的额外研究。