论文

面向屏幕条件化动作预测的架构敏感监督微调:PiSAR基准

Architecture-Sensitive Supervised Fine-Tuning for Screen-Conditioned Action Prediction: A PiSAR Benchmark

模型评测模型能力评测

摘要

我们在PiSAR(Persona、intent、Screen、Action、Rationale)的661行留出切片上,将三个监督微调模型与前沿零样本基线进行对比评测。PiSAR是一个包含12,929条元组的屏幕锚定行为理由语料库,由公开应用商店评论、Pew American Trends Panel人口统计数据与OPeRA购物者轨迹整理而成。每个模型——无论前沿模型还是微调模型——都在相同的661行切片上用相同的评分流程评估。两点发现。其一,前沿零样本基线(Claude Opus 4.7与GPT-5.5)分别达到sem_sim 0.459和0.482;微调后的Qwen3-VL-8B-Instruct达到0.783,并在79%的行上超过sem_sim ≥ 0.7,而两个前沿基线只有1-2%,在同一测试集上绝对差距达0.30。其二,同样的训练数据与配方用在Gemma-4-26B-A4B-IT上只得0.441,与前沿零样本基线处于同一水平区间,而非接近微调后的Qwen。我们将其解读为配方与模型的错配:经过推理调优的高参数量模型抗拒被取代,可能需要更多数据或更强的微调方法。

面向屏幕条件化动作预测的架构敏感监督微调:PiSAR基准:论文配图
图 7:工作示例,第 122 行 (OPeRA)。黄金基本原理是亚马逊搜索会话期间购物者的逐字表述,由 OPeRA 协议捕获:更改搜索关键字以查找用于睡眠呼吸暂停的楔形枕头。联合训练的 Qwen 产生近似释义 (sem_sim 0.973);仅接受过 OPeRA 训练的 Qwen 捕捉到了医学意图,但发明了一个不在屏幕上的“自动完成器”细节(sem_sim 0.509); Gemma 运行会陷入与角色任务无关的一般积极反应 (sem_sim 0.159)。