论文
格式敏感指数:LLM基准测试中token受控的提示包装鲁棒性与模式符合度
Format Sensitivity Index: Token-Controlled Prompt Wrapper Robustness and Schema Compliance in LLM Benchmarking
摘要
提示包装常仅在格式上不同,却能改变模型分数到足以翻转排行榜结论的程度。我们在token受控协议下研究这种方差,并引入两个互补指标:格式敏感指数(FSI)——包装选择诱导的准确率范围;可解析性敏感指数(PSI)——答案可解析性的相应范围。跨140,000次OpenRouter生成(覆盖7个QA任务、5个包装家族、4个7B至72B参数的指令模型):平均FSI跨模型差异超过30倍,且主要由符合性失败解释。固定效应回归显示:即使控制任务、模型与包装,可解析性仍是准确率的强预测因子。我们主张不报告包装方差与符合度的准确率在统计上是脆弱的,并为基准测试与结构化输出部署给出实用建议。
