论文

LLM Reasoning 的针对性测试:审计约束协议

Targeted Tests for LLM Reasoning: An Audit-Constrained Protocol

模型评测评测方法与指标

摘要

固定推理基准评估规范提示,但表示中语义上有效的更改仍然可以改变模型行为。对瞬变的研究可以揭示此类失败,但如果不进行审计,它们可能会将真正的模型错误与无效的扰动、提取伪影和不匹配的搜索程序混合在一起。我们提出了一种用于有针对性的推理评估的审计约束协议。提示变体是从有限组件语法生成的,确定性地呈现,在固定的查询预算下进行评估,并且仅在语义和提取审核之后才计为模型错误。在此协议中,我们实例化了组件自适应提示采样(CAPS),这是一个基于提示组件的基于分数的采样器,并将其与相同任务库、渲染器、模型接口、解码设置和审核程序下的等预算统一组件采样进行比较。在三个审计切片中,该协议识别了已确认的模型错误提示键,同时排除了格式化和提取工件,但匹配的比较并未表明 CAPS 比统一采样提高了审计产量或独特的提示键发现。其贡献是方法论上的:可以在可重构、可审查、预算匹配的协议下研究有针对性的即时变化,并且代理指导政策应根据审计产量而不是原始错配计数或仅选定的示例来判断。