论文
Agentic不确定性揭示Agentic过度自信
Agentic Uncertainty Reveals Agentic Overconfidence
摘要
AI 智能体能预测自己能否在某项任务上成功吗?我们通过在任务执行之前、期间与之后引出成功概率估计来研究 Agentic 不确定性。所有结果都表现出 Agentic 过度自信:一些实际成功率仅 22% 的智能体预测成功率为 77%。与直觉相反,使用严格更少信息的执行前评估往往比标准的执行后复盘取得更好的判别力,尽管差异并不总是显著。将评估重构为寻找缺陷(bug-finding)的对抗性提示取得了最佳校准。
