论文

语言模型可以注意到不可能的工程问题,但仍然将其报告为已解决

Language models can notice an impossible engineering problem yet still report it as solved

模型评测评测方法与指标

摘要

语言模型起草工程计算,但答案的准确性并不能表明它们是否拒绝了不可能的问题。我们针对 30 对力学问题测试了 14 个模型,每对问题都有一个有效版本,以及一个通过更改给定值或假设而变得不可能的版本。两个独立的求解器验证了每个答案,并表明每个有缺陷的问题在物理上都是不可能的。我们对有效问题的解决与对有缺陷的问题的拒绝分开进行评分。每个回复都需要“已解决”或“无法解决”状态;拒绝意味着“无法解决”或拒绝回答。最初的提示并没有警告问题可能存在缺陷。在最近的三个模型中,90 条回复中有 12 条未能排除有缺陷的问题。根据人工智能评分者和数字检查,在其中 11 条回复中,该模型指出了缺陷,回答了纠正的问题,并且仍然将原始问题报告为“已解决”。后来我们重新测试了一家提供商的四个模型,提供“有缺陷”而不是“无法解决”,并要求他们说出并解释缺陷。三个模型的拒绝率在统计上显着增加,但三个模型解决有效问题的表现下降。因此,评估需要对两个版本进行评分,并将缺陷识别与报告的状态区分开来。

语言模型可以注意到不可能的工程问题,但仍然将其报告为已解决的原论文方法或结果图
补充图 1:公差灵敏度。当每个关键公差乘以 0.25 到 10 之间的系数时,解决计数正确的项目。冻结的规则是系数 1。颜色是该规则的变化。没有模型对会颠倒因素 1 和 5 之间的顺序。该范围内最大的变动是十四行诗 5 的四个附加项目。