论文

像我 5 岁或我选择的任何东西一样解释:评估语言模型响应的交互潜力

Explain Like I'm 5 or Whatever I Choose: Evaluating the Interactive Potential of Language Model Responses

模型评测评测方法与指标

摘要

在科学信息搜索任务中对 大语言模型 (LLM) 的评估变得越来越以使用为中心,例如与真实用户进行实时或多轮评估。这些评估仍然假设单个静态聊天界面,但随着模型集成到新界面中,评估必须转变以纳入特定于界面的标准。我们提出了一个新的评估框架,该框架基于一项由 16参与者参加的形成性研究,该研究测试模型对一个查询生成多个响应的能力,这些响应沿着可解释的语言轴(语言复杂性)有所不同,其灵感来自于以人为本的设计文献中的直接操作界面。我们通过针对 98的科学查询生成不同语言复杂程度的 5 个响应来评估 GPT-5.1、GPT-5 mini、Claude Sonnet 4.5 + Thinking 和 DeepSeek-V3.1。虽然模型的复杂性因响应而异,但大多数变化仍然不一致,性能最佳的模型 (Claude Sonnet 4.5) 仅在 $46\%$ 的时间内将可靠的复杂性度量向正确的方向移动。我们的研究结果随着样本量的增加和替代复杂性水平的增加而成立。