论文
SenWorld:生成上下文丰富评估数据的数字孪生仿真
SenWorld: A Digital-Twin Simulation for Generating Context-Rich Evaluation Data
摘要
智能手机个人助手在纵向个人数据上推理,但评估它们需要正确答案已知、上下文丰富的评估数据,而真实设备轨迹因隐私敏感无法共享。为应对该挑战,我们提出SenWorld:一个物理落地、确定性、事件溯源的数字孪生仿真,生成真值由构造固定的此类数据。在SenWorld中,人设在一个由真实地图、天气、假日与网络数据构成的世界里度过完整一天;每个可观察信号都被存档进全系统快照;每个评估案例由指向既有记录的指针标注,而非事后标注或大语言模型(LLM)裁判。我们在北京以16个人设评估该方法:生成数据在类别分布(Jensen–Shannon散度0.070)与通讯记录的日内节律(JSD低于0.1)上紧贴留出的真实用户基准,尽管生成记录仍比真实记录短。在没有脚本化交互的情况下,人设形成完全互惠的对话子图与差异化的行为库。投射为717个评估案例后,生成数据在一个生产智能手机助手中暴露78次失败,集中在通话与短信记录,而联系人、日程与闹钟从不失败;快照指针把每次失败确认为助手侧的检索错误,全程无LLM裁判参与。总体上,SenWorld为真值由构造固定的评估数据提供隐私安全、可复现、经分布核验的路径。
