论文
VeRA:规模化验证式推理数据增强
VeRA: Verified Reasoning Data Augmentation at Scale
摘要
当今大多数评估方案的主要问题在于其“静态”性质:同样的题目被反复使用,导致记忆化、格式利用乃至最终饱和。要衡量真正的AI进步,我们需要在构造上就稳健的评估,而非事后检测。为此,我们提出VeRA(Verified Reasoning Data Augmentation),一个将基准问题转化为可执行规格的框架,包含:(i)带占位槽的自然语言模板;(ii)采样有效配置的相干生成器;(iii)确定性验证器,为每个配置校验参数并计算相应的正确答案。从单个种子问题出发,VeRA以近零边际成本自动创建无限个带可靠标签的已验证变体,无需人工参与。VeRA以两种互补模式运行。VeRA-E(等价)在保持底层逻辑不变的情况下改写题目,可用于检测记忆化与真实推理之别。VeRA-H(强化)在保持可验证性的同时系统性增加复杂度,从而能在智能边界处可靠地创建并标注全新的困难任务。用VeRA评估16个前沿模型,我们发现:(i)VeRA-E提升评估质量并揭示污染模式;(ii)VeRA-H实现无人工参与的困难任务生成与可靠标注;(iii)VeRA确立已验证基准作为通用范式。VeRA将基准从用尽即弃的静态对象,重新构想为可按需生成新鲜、已验证实例的可执行规格,提升评估的稳健性与成本效益。借助VeRA,我们展望任何可验证领域的评估都能在不牺牲标签完整性的前提下无限扩展。为激发后续研究,我们已开源全部代码与数据集。
