论文
Harness Compilation:按小型VLM行为分配运行时决策
Harness Compilation: Which Decisions Should a Small Vision-Language Model Keep?
摘要
小型视觉语言模型可能能够阅读外部证据,却难以主动获取证据。我们提出Harness Compilation(HC),一种离线过程,用来调整冻结小型VLM与其外部Harness之间的分工。大型教师根据学生执行轨迹修订可复用内容和控制方式,再由独立验证集选择部署的Harness。部署既无需权重更新,也不调用教师。在七种视觉问答设置中,学生模型参数量均不超过9B;对每种设置独立构建三次后取平均,HC相对直接使用学生模型提高9.9—23.9分。对五种运行时决策类型——调用、选择、参数生成、证据整合和弃答——的干预说明了分工的重要性:请求证据和生成开放查询可能代价较高,而有限选项选择与阅读给定文本仍适合由学生完成。事实卡片使全部十种受测学生受益,但决策策略的迁移效果不均匀。当迁移接口不再适合新学生时,针对该学生重新编译会有帮助。在100个练习样本下,HC在三项任务上超过仅答案LoRA。更大的训练预算能够追平或超过固定Harness,而二者结合在SlideVQA上优于任一单独方法。这些发现支持根据测得的学生行为分配工作,而非统一剥离所有决策。
