论文
个人AI记忆用于评分预测的受控审计
A Controlled Audit of Personal AI Memory for Rating Prediction
摘要
在结构化评分预测中,个人AI使用的是历史物品-评分关联,还是主要使用用户的评分倾向?我们审计这一区分:在每个用户内置换历史评分,同时保持精确的评分分布、物品支持度与元数据。该控制与完整历史、原生记忆提取和匹配的数值读取器组合,在公开冻结的评估中覆盖Coat与MovieLens的400个留出用户画像与6160个目标评分。Coat上,受测的Qwen撰写Mem0管道相对完整历史使Qwen的用户宏平均绝对误差增加0.084、Phi增加0.149,两者的族调整bootstrap区间均不含零。正确的历史分配在Coat上帮助两个读取器,MovieLens上对应效应更小且调整后不结论。仅历史的ridge读取器在两域优于Qwen、在MovieLens上优于Phi,Coat上的Phi比较未决。全部2800次读取器调用(含150次无效输出)按固定回退规则保留;另一独立实现验证输入、指标与全部十项主对比。贡献是一个可复现的诊断研究,说明为何提取、关联使用、输出可靠性与读取器选择需要分别评估。