论文
HARDEN:保留答案的约束演化困难样本生成
HARDEN: Constrained Evolutionary Search for Harder, Answer-Preserving Evaluation Cases
摘要
语言模型通常根据策划的基准进行评估,这些基准低估了企业部署的复杂性。我们引入了 HARDEN,一种约束进化搜索方法,可以将现有评估案例的输入调整为更具挑战性的变体,同时保持其预期输出固定。 HARDEN 沿着生成的特定领域的复杂性轴进行搜索,同时强制执行可行性约束,例如保留任务语义、现实性和执行有效性。在 FinQA、PubMedQA 和 ContractNLI 以及三个 Qwen3.5 模型规模(35B-A3B、122B-A10B 和 397B-A17B)中,HARDEN 使任务模型准确度平均降低 22.7%,相对于使用相同可行性检查的单次生成基线,降低高达 49.9%。这些结果表明,进化搜索可以产生更难的有效评估案例。
