论文
当正确答案缺失时:Jev 中依赖于算术的拒绝瓶颈
When the Right Answer Is Missing: An Arithmetic-Dependent Rejection Bottleneck in Jev
摘要
Jev 等类型化决策模型通过直接从预定义选项中进行选择,为决策工作流程中的生成式 LLM 提供了有效的替代方案。当候选集不包含有效答案时,TypeSafe 建议包含“其他”或“以上都不是”选项以启用拒绝。然而,在这份报告中,我们发现了一个与算术相关的拒绝瓶颈:Jev 在可用时可靠地选择正确的数字答案,但在不存在错误的替代方案时,尽管有明确的拒绝选项,但经常接受错误的替代方案。在配对算术问题上,答案呈现准确率达到 99%,而正确拒绝率则下降至 7%。此外,这种差距在数值大小、操作深度、上下文表述和拒绝标签方面仍然存在,并延伸到时间计算和容量舍入等场景。然而,原生布尔验证在相同的无答案算术情况下实现了 99% 的精确匹配精度,这表明即使模型成功验证候选正确性,分类拒绝也可能会失败。最后,我们表明,针对单独的开发问题选择的简单决策阈值可将算术拒绝精度从 7% 提高到 79%,同时保留 97% 的答案呈现精度,从而在无需重新训练或额外推理的情况下显着减轻失败。