论文
语言模型可以注意到不可能的工程问题,但仍然将其报告为已解决
Language models can notice an impossible engineering problem yet still report it as solved
摘要
语言模型起草工程计算,但答案的准确性并不能表明它们是否拒绝了不可能的问题。我们针对 30 对力学问题测试了 14 个模型,每对问题都有一个有效版本,以及一个通过更改给定值或假设而变得不可能的版本。两个独立的求解器验证了每个答案,并表明每个有缺陷的问题在物理上都是不可能的。我们对有效问题的解决与对有缺陷的问题的拒绝分开进行评分。每个回复都需要“已解决”或“无法解决”状态;拒绝意味着“无法解决”或拒绝回答。最初的提示并没有警告问题可能存在缺陷。在最近的三个模型中,90 条回复中有 12 条未能排除有缺陷的问题。根据人工智能评分者和数字检查,在其中 11 条回复中,该模型指出了缺陷,回答了纠正的问题,并且仍然将原始问题报告为“已解决”。后来我们重新测试了一家提供商的四个模型,提供“有缺陷”而不是“无法解决”,并要求他们说出并解释缺陷。三个模型的拒绝率在统计上显着增加,但三个模型解决有效问题的表现下降。因此,评估需要对两个版本进行评分,并将缺陷识别与报告的状态区分开来。
