论文

DS@GT ARC at Touché:大语言模型 用于检索增强辩论

DS@GT ARC at Touché: Large Language Models for Retrieval-Augmented Debate

模型评测模型行为与机制分析

摘要

我们将 DS@GT ARC 工作笔记提交扩展到 Touché 2025 检索增强辩论任务。该任务有两个子任务:在模拟辩论中生成下一个话语,并根据格莱斯格言的数量、质量、关系和方式评估辩论反应。 DS@GT ARC 提交内容包括来自三个提供商的六个领先的 LLM,通过检索增强提示管道进行提交。我们总结了工作论文的结果,并探讨了多 LLM 评估者协议是否是官方评估绩效的可靠代理。分析表明,前沿 LLM 系统是强响应发生器,并且作为评估者,他们在模型系列中强烈同意。然而,这种共识并不能可靠地跟踪官方评估目标,在质量准则上差距最大。本文随附的源代码位于 https://github.com/dsgt-arc/touche-2025-rad 和 https://github.com/dsgt-arc/touche-2025-rad-analysis。