论文

LLM 人格归纳中的评估漂移:我们正在移动目标吗?

Evaluation Drift in LLM Personality Induction: Are We Moving the Goalpost?

模型评测模型行为与机制分析

摘要

大语言模型 能否可靠地表达类似人类的个性,或者它们只是模仿表面线索而没有稳定的底层特征?为了研究这一点,我们在长篇文章中引入了 LLM 和 微调 中的个性,其中每篇文章都与目标大五人格概况相关联。然后,我们使用 IPIP-NEO 问卷评估诱导人格的稳定性和保真度。具体来说,我们问:(i)后训练(SFT、DPO、ORPO)是否可以在及时改写的情况下稳定问卷分数,以及(ii)它是否可以从无指导的论文中诱导出目标“大五”概况?我们的结果表明,微调 一致地减少了五个模型中问卷响应的方差,直接减轻了预训练模型中报告的评估脆弱性。然而,这种新发现的稳定性揭示了一个更根本的限制:即使单个性状得分有所提高,完整五维轮廓的准确性仍然接近机会。这表明无指导的论文缺乏忠实个性表达所需的线索。因此,我们主张基于场景的数据集或交互式启发,随着时间的推移积累与测试一致的证据。