论文
IBBench-Light:一种针对外部指令的条件任务响应配对评估
IBBench-Light: A Paired Evaluation of Task-Conditioned Responses to External Directives
摘要
外部记录可能包含执行或阅读文本的指令,具体取决于用户请求。IBBench-Light对同一记录下的两种使用场景进行测试。十二个语义基底产生每模型144组匹配对;四个量化指令模型生成1,152条贪婪响应存档。配对精确合同准确率(PECA)要求两个响应均满足其输出合同。Qwen在132个执行和109个处理指令上成功,但仅完成97组配对,揭示了简单平均值所掩盖的细节。我们审计了字面目标暴露和大小写归一化,并增加了1,722条CPU生成日志以测试无指令控制、十二个额外语义基底、同基底用语变化以及生成终止策略。在固定Phi重跑中,改变结束序列(EOS)集合使精确配对成功率从0/144提升至62/144。一个有界IHEval对比使用相同的SmolLM2检查点和输出预算,同时保留其发布的指令角色和评分器。该基准衡量条件任务和输出合同的成功率,其任务差异和配对数量需与终止策略共同解读。