论文

WordPolo:通过迭代语义反馈评估语言模型

WordPolo: Evaluating Language Models Through Iterative Semantic Feedback

模型评测基准与评测资源

摘要

大型语言模型 (LLM) 和大型推理模型 (LRM) 通常仅通过数据集准确性在具有挑战性的基准上进行评估,无法深入了解其推理过程的质量或忠实度。我们提出了 WordPolo,这是一项单词查找任务,参与者必须使用语义相似性反馈来发现未知的目标单词。玩家从零知识开始,进行猜测,并获得距离分数(1=正确,更高=更远)。成功需要解释分数以导航语义空间并系统地缩小搜索范围。这种设计使得迭代推理和自适应搜索策略既可直接观察,又是成功所必需的。我们评估了最近的 LLM(GPT-4.1、Llama 4、Claude 3.5 Haiku、Qwen 3)、LRM(o4-mini、Deepseek-R1)、人类以及针对 1,500 个谜题的新颖启发式算法。除了解决率(范围从 4% 到 62%)之外,我们还引入了基于进展的指标,这些指标揭示了模型通常会取得有意义的进展,而仅凭准确性就会错过这些见解。我们的分析显示了推理模型如何因过度思考和思考不足而受到阻碍,而成功的模型则表现出类人的策略。 WordPolo 展示了对测试推理过程和结果的基准的需求,提供模型功能的整体测量。我们的代码和数据集可以在 https://wordpolo-demo.vercel.app/ 找到。