论文
正确答案,错误机制:AI科学家为何会维护被自身数据反驳的主张
Position: Correct Answer, Wrong Mechanism -- When AI Scientists Defend General Claims Their Own Data Contradicts
摘要
AI科学家系统常被描述为工具、合著者或创始人,但评估往往只关注最终答案。本文主张,仅看结果不足以评价这类系统,应分别衡量任务结果、机制正确性和认识上的诚实。证据来自编码Agent在Geant4模拟中尝试重新发现一个已知粒子识别观测量的28次实验,其中8次使用另外两个前沿模型。主模型20次实验中有4次、跨模型8次实验中有3次通过错误推理得到看似正确的结果,但条件变化后便失效,作者将其称为“正确答案,错误机制”(CAWM)。诚实与机制正确性在同一Agent执行轨迹中可能分离:面对部分误导性先验,五个Agent都依据证据拒绝错误部分,但其中一个仍用与自身数据不符的物理解释维护其选定观测量。在本文的模拟发现任务中,编码Agent可充当可靠工具,却尚不能可靠地自行核验开放式科学主张的机制。作者提出轻量检测:单步条件切换检查仅需Agent的主张即可识别过度概括;当正确观测量已知时,补充重新计算可识别其余案例。两种检查共同识别了本文所有CAWM案例。