论文

通过视觉语言反馈进行局部笔画质量评估

Local Brushstroke Quality Assessment via Vision-Language Feedback

模型评测模型能力评测

摘要

本文研究多模态 LLM 是否可以评估书法中的局部笔触质量并生成有教育意义的自然语言反馈。我们构建了一个评估框架,其中三个多模态 LLM(GPT-4o、Claude Sonnet 4 和 Gemini 2.5 Flash)使用五点顺序量表评估书法作品的前后图像对,并将其输出与三位专家书法家指定的分数进行比较。我们还检查了 Claude 的检索增强生成(RAG)变体作为初步条件。结果表明,所有模型都达到了有用的绝对分数准确性 (MAE) 水平,其中 GPT-4o 表现最佳 (MAE = 0.885)。然而,这些模型都没有与人类专家产生统计上显着的总体排名相关性(Kendall's tau)。对生成的基本原理的词汇分析揭示了每个模型中的特征评估偏差,并且 RAG 被证明可以提高排名相关性,同时恶化绝对准确性,这对基于文本的规则注入构成了重要的负面结果。