论文

LLM 可以通过正确的提示更好地捕捉人类判断

LLMs Can Better Capture Human Judgments--With the Right Prompts

上下文与知识上下文工程

摘要

大语言模型 (LLM) 不擅长捕捉人类判断吗?两个常见的限制是 LLM 无法捕获响应的完整分布,并且它们的判断在措辞变化中不稳定。我们展示了可以减轻这些限制的简单提示策略。在两个数据集(涵盖 32 个国家/地区的国际社会调查计划家庭和不断变化的性别角色模块中包含美国代表的 144 个道德情景和 38 个道德信念)中,我们展示了简单的启发技术如何帮助改善人工智能与人类的一致性。首先,促使模型报告标准差和响应比例比常见策略更好地恢复了人类的全部响应。其次,确保场景对人类参与者来说是清晰的(正如人类混乱评级所反映的那样)可以提高模型一致性,并且 LLM 可以跟踪人类混乱评级。与此同时,我们发现 LLM 对自身误差的估计校准不佳,尽管它们可以相对较好地预测人类变异性。这些结果表明,向 LLM 提出更好的问题可以得到更好的答案。