论文

反馈到评分标准:我们可以从内嵌评论中了解专家标准吗?

Feedback-to-Rubrics: Can We Learn Expert Criteria from Inline Comments?

模型评测评测方法与指标

摘要

大语言模型 (LLM) 越来越多地用于写作和审阅支持,但其有用性取决于上下文相关的标准,例如专家偏好或组织特定的约定,这些标准通常是默认的、未记录的且难以直接得出。我们提出了一个问题设置,用于从人工编写的或 LLM 生成的草稿等工件上积累的内联评论中学习可重用的自然语言规则。我们的方法从这些评论中推断出标题,并通过观察标题条件预测和参考评论之间评论方面的不匹配来迭代地完善它们。我们在现实世界的审查环境和具有参考标准的受控环境中评估所提出的方法。这些结果表明,内嵌评论可以被提炼成可重用的评分标准,支持评论预测、评分标准理解和自动工件修订。