论文

XQDT:带有反馈信号的可解释和定量数据文本对齐度量

XQDT: eXplainable and Quantitative Data-Text Alignment Metric with Feedback Signals

模型评测评测方法与指标

摘要

评估数据文本对齐仍然具有挑战性:现有指标通常对分数提供有限的解释,而基于提示的 LLM-as-Judge 方法可能既昂贵又不可靠。我们提出了一种端到端可解释的评估指标,可以微调语言模型以识别数据文本对中遗漏的、额外的、不正确的和正确的数据单元。这些局部判断被汇总为精确度、召回率和 F1 分数,提供细粒度的诊断反馈和可解释的对齐质量度量。在各个基准测试中,我们的微调模型在错误预测方面优于 LLM-as-Judge 方法,并实现了有竞争力的精确度、召回率和 F1 分数,同时保持与人类判断的强相关性。除了评估之外,我们的验证器输出还为下游校正和细化提供有用的反馈信号,支持数据到文本和文本到数据的面向对齐的改进。代码和资源可在 https://github.com/guihuzhang/xqdt 获取。