论文

结合LLM-as-a-Judge与人在回路的城市可持续旅行多维评估

Multi-Dimensional Evaluation of Sustainable City Trips with LLM-as-a-Judge and Human-in-the-Loop

模型评测评测方法与指标

摘要

当人工标注成本高昂、标准指标又忽视以利益相关者为中心的目标时,评估细腻的对话式旅行推荐就变得困难。我们研究用LLM作为评审(LLMs-as-Judges)对可持续城市旅行清单在四个维度——相关性、多样性、可持续性与热门度平衡——上进行评估,并提出一个三阶段校准框架:(1)用多个LLM做基线评审;(2)专家评估以识别系统性错位;(3)通过规则与少样本示例进行维度特定校准。在两种推荐设置中,我们观察到模型特有的偏见和高维度级方差,即便各评审在总体排名上一致。校准澄清了各维度的推理,但暴露出对“可持续性”的分歧解读,凸显了对透明、偏见感知的LLM评估的需求。提示词与代码已发布以保证可复现性:https://github.com/ashmibanerjee/trs-llm-calibration。

结合LLM-as-a-Judge与人在回路的城市可持续旅行多维评估:论文配图
图1:三阶段LLM校准框架:先做基线评判,再与人工评估比对找出系统性偏差,最后分维度校准,以提升对齐与可靠性。