论文

SERUM:用户建模的状态提取和细化

SERUM: State Extraction and Refinement for User Modeling

模型推理推理验证与自校正

摘要

能够主动、个性化交互的代理助理需要用户意图和工作流程的结构化模型。然而,从原始的、非结构化的屏幕活动构建这些模型仍然是一个开放的挑战。我们提出了 SERUM,这是一个多通道框架,它使用分层 VLM 注释直接从非结构化自我中心视频中提取有限状态行为模型。通过滑动窗口处理屏幕记录,SERUM 在活动识别和意图推理通道之间交替,每个通道都使用累积的先验上下文来细化标签,以减少单通道注释中出现的幻觉和时间混淆。然后通过句子嵌入和人工校准的阈值将同义状态合并为紧凑、连贯的分类法。我们通过在生成的标签序列(动作和意图)上拟合一阶马尔可夫模型并根据频率基线测量预测准确性来评估行为结构。在四个领域(编码、烹饪、体育活动和日常生活)的 61 个以自我为中心的视频中,我们发现:(1)经过几次迭代后,迭代标签细化收敛到稳定状态词汇,我们将其称为图式平衡; (2)归一化马尔可夫模型比频率基线实现了显着更低的困惑度和更高的动作预测,在编码等结构化任务上收益最大; (3) 人类注释者将最终通过的标签评为准确,并且比首次通过的标签有了有意义的改进。据我们所知,SERUM 是第一个从非结构化自我中心屏幕视频生成可解释过程模型的系统,无需手动注释,为用户建模和行为理解开辟了一条可扩展的途径。我们的演示、代码和结果是公开的