论文

超越原始转录:基于 LLM 的数字孪生的结构化角色提取

Beyond Raw Transcripts: Structured Persona Extraction for LLM-Based Digital Twins

上下文与知识上下文工程

摘要

基于 LLM 的“数字双胞胎”旨在模拟一个人在新环境中的行为或对新问题的反应,并给出该人之前反应的一些表示。一种常见的方法是根据调查记录或摘要响应构建这种表示。先前的工作表明,将长转录本压缩为较短的 LLM 生成的摘要并不会显着降低预测准确性,这表明信息量不是主要瓶颈。在这项工作中,我们认为关键的限制是结构性的:角色信息在提供给模拟器模型之前是如何组织的。我们通过比较非结构化摘要与结构化人物表征来研究这一点。首先,我们引入了一种基于消费者行为理论的手工设计模式(BDE:背景、决策过程、评估),并表明它在同质基准 (Twin-2K-500) 上将原始转录本的预测准确性提高了 +1.91 个百分点,在 gpt-5.4-mini 和 Qwen3-8B 上作为稳健性检查具有类似的增益。然而,这种固定结构并不能推广到更多异构任务,这些任务的性能在统计上与原始转录本基线没有区别。为了解决这个限制,我们提出了一种自动结构发现管道,其中 LLM 迭代地提出和细化特定于任务的角色结构和提取提示。在 13 个不同子研究的基准测试中,这种方法恢复了性能,将平均准确度比原始转录本基线提高了 1.91 个百分点,并消除了使用固定模式观察到的重大损失。总的来说,我们的结果表明,基于 LLM 的数字孪生的主要限制不是提供多少信息,而是信息的结构方式,而最佳结构取决于任务。