PosterHarness:将科学海报生成转变为可审计的指令遵循基准
PosterHarness: Turning Scientific Poster Generation into an Auditable Instruction-Following Benchmark
摘要
富含文本的图像模型现在可以设计海报规模的布局,但我们缺乏方法来衡量它们是否遵守科学传播合同:清晰的标签、规定的长宽比,以及——最重要的是——放弃捏造的科学数据。我们推出了 POSTERHARNESS,一种可审核的Harness,将海报生成重新构建为可测量的遵循指令的任务,并具有试点基准和故障分类法。 POSTERHARNESS 使用占位符优先契约来分隔两个作业模型,否则会混淆。该模型执行视觉摘要设计:版式、阅读路径、颜色和背景,但从不绘制承载数据的图形。每个图形区域必须是一个空的标记占位符;确定性合成器在检测到的坐标处插入真实的源文件图形。这使得属性可测量:占位符计数和 ID 准确性、空白、纵横比合规性、合成图形的放弃、公共文本卫生和源图出处 - 失败记录为明确的拒绝,而不是隐藏在看似合理的输出中。我们在 12 篇论文(6 篇 HEP、6 篇 AI/ML 相关论文)上实例化了该工具,并报告了三项发现。 (i) 反事实调查显示,占位符合约将三篇论文中的 VLM 统计综合数字从 34 变为 0。 (ii) 失败分类法识别阻塞合约:占位符几何、占位符 QA、模板批评家和公共文本。 (iii) 与 Paper2Poster 的比较显示出一种权衡:PosterHarness 产生更高分辨率的伪影、更低的白色画布分数和更强的 VLM 视觉偏好;确定性基线保留了更多 PosterQuiz 风格的信息并且运行速度更快。我们将此报告为政权特征,而不是优越性主张。所有工件、提示、清单和审核脚本都作为可重用的评估组件发布。