论文

审计合成回忆录:将LLM生成自传的场景级虚构对照其所描述人生的文献记录进行测量

Auditing the Synthetic Memoir: Measuring Scene-Level Confabulation in LLM-Generated Autobiography Against the Documented Record of the Life It Describes

模型评测评测方法与指标

摘要

当被要求撰写一个人的一生时,大语言模型(LLM)写下的内容有多少真实发生过?我们进行了一项场景级案例研究审计——据我们所知(基于非系统性文献检索),这是首次将LLM生成的自传对照受试者专属真值语料库进行量化审计。本文受试者与作者为同一人:一部366天的“一日一页”第一人称轶事集由一个对话式LLM起草,其有记录的输入是一个模板、两天示例文本和每天的一条引语——而非她的语料库——随后每一天都用分析前固定的四级评分标准,对照独立验证语料库在轶事场景层面进行审计。我们把验证失败率定义为未被评为VERIFIED(场景获得正面佐证)的天数占比:366天中有354天失败,占96.7%(Wilson 95%置信区间94.4-98.1%)。只有12天包含被佐证的场景;19天(5.2%)断言了被记录积极反驳的主张;主导失败模式是“有据漂移”——真实的人物、雇主和场景被放进虚构情节——不过其测得的占比因评分者而异。独立重评复现了总体结论(无证据表明原始比率被夸大),同时显示四分类仅有中等至一般水平的可靠性。在相同输入下用当前具名模型重新生成这些日子,复现了100%的验证失败;以受试者语料库为基础进行接地生成能显著提高验证率,但仍留下大量残余失败(83.3%)。我们贡献了这一测量、一个可复用的审计工具(我们表明其WEAK/UNVERIFIED边界不可靠),以及一种效果已量化的接地补救方法。