论文

BehaviorBench:从行为踪迹建模真实世界用户决策

BehaviorBench: Modeling Real-World User Decisions from Behavioral Traces

模型评测基准与评测资源

摘要

许多决策支持设置需要适应个人用户的系统,但该问题的评估数据仍然有限。现有的用户理解基准通常依赖于模拟用户或模型生成的行为,尽管最近的工作警告说基于模型的模拟可能会系统地偏离人类行为。我们引入 \textsc{BehaviorBench},这是一个根据现实世界行为轨迹评估个性化决策模型的基准。 \textsc{BehaviorBench} 根据观察到的公共预测市场和链上记录重建钱包级决策历史,并将它们组织成两个互补的任务层:\emph{Belief Prediction},它预测用户最终显示的市场立场和信心,以及 \emph{Trade Prediction},它预测单个交易的方向和金额。在 2,000 个评估钱包中,该基准包含 141,445 个 Belief 实例和 1,485,972 个 Trade 实例,并具有用于基于检索的评估的不相交支持池。我们在四种历史界面下评估前沿和开放权重生成模型:无个性化、直接最近历史、生成的用户配置文件和检索的支持钱包证据。个性化比交易预测更一致地改进了信念预测,模型排名跨任务层和指标变化,并且不同的历史界面暴露了不同的故障模式。 \textsc{BehaviorBench} 提供了一个评估设置,用于研究个性化方法是否可以使用真实世界的行为证据而不是单独使用模拟用户。

BehaviorBench:从行为踪迹建模真实世界用户决策:论文配图
图 1:BehaviorBench 构建流程概述。我们收集公共事件元数据和链上日志,重建钱包-市场-结果行为,应用队列和质量控制过滤器,并为信念预测和交易预测构建两个基准层,并使用不相交的支持池进行基于检索的评估。