论文
AI知道哪里错了却无法纠正:高风险决策下前沿LLM的螺旋面动力学
AI Knows What's Wrong But Cannot Fix It: Helicoid Dynamics in Frontier LLMs Under High-Stakes Decisions
摘要
大语言模型在输出可被检验时表现可靠:解方程、写代码、检索事实。当检验不可能时,它们的表现则不同,例如临床医生在数据不完整的情况下选择不可逆的治疗方案,或投资者在根本性不确定性下投入资本。螺旋面动力学(helicoid dynamics)是赋予第二个领域中一种特定失败模式的名字:系统一开始胜任地投入,逐渐漂移出错,准确地指出哪里出了问题,然后在更高的复杂程度上重现同样的模式,意识到自己在循环却仍然继续。这项前瞻性病例系列记录了七个领先系统(Claude、ChatGPT、Gemini、Grok、DeepSeek、Perplexity、Llama系列)在临床诊断、投资评估和高后果访谈场景中经受测试时的这一模式。尽管设置了旨在维持严谨协作的明确规程,所有系统都表现出该模式。当被当面质询时,它们将其持续存在归因于训练中的结构性因素,超出对话所能触及的范围。在高风险下,当严谨与安逸发生分歧时,这些系统倾向于安逸,恰恰在可靠性最重要的时刻变得不那么可靠。文中提出十二个可检验的假设,对智能体AI监督与人机协作具有启示。螺旋面模式是可处理的。识别它、命名它并理解其边界条件,是迈向那些在决策最难、赌注最高时仍保持可信赖伙伴地位的LLM的必要第一步。