论文
面向屏幕条件化动作预测的架构敏感监督微调:PiSAR基准
Architecture-Sensitive Supervised Fine-Tuning for Screen-Conditioned Action Prediction: A PiSAR Benchmark
摘要
我们在PiSAR(Persona、intent、Screen、Action、Rationale)的661行留出切片上,将三个监督微调模型与前沿零样本基线进行对比评测。PiSAR是一个包含12,929条元组的屏幕锚定行为理由语料库,由公开应用商店评论、Pew American Trends Panel人口统计数据与OPeRA购物者轨迹整理而成。每个模型——无论前沿模型还是微调模型——都在相同的661行切片上用相同的评分流程评估。两点发现。其一,前沿零样本基线(Claude Opus 4.7与GPT-5.5)分别达到sem_sim 0.459和0.482;微调后的Qwen3-VL-8B-Instruct达到0.783,并在79%的行上超过sem_sim ≥ 0.7,而两个前沿基线只有1-2%,在同一测试集上绝对差距达0.30。其二,同样的训练数据与配方用在Gemma-4-26B-A4B-IT上只得0.441,与前沿零样本基线处于同一水平区间,而非接近微调后的Qwen。我们将其解读为配方与模型的错配:经过推理调优的高参数量模型抗拒被取代,可能需要更多数据或更强的微调方法。
