论文
自我报告不等于验证:演化搜索中基于环境的大语言模型算子审计
Self-Reports Are Not Verification: Environment-Grounded Auditing of LLM Operators in Evolutionary Search
摘要
语言模型代理越来越多地提出行动、观察外部反馈并解释自己的行为。他们的信心和理由是方便的监控信号,但方便并不是验证。我们引入了基于环境的审计,其中每个中间提案都会收到准确的结果。语言模型运行进化上下文搜索,其反馈功能为每个有效猜测分配一个准确的排名,无需人工注释。在跨越五种配置和三个型号系列的 200 次运行中,四种报告配置生成了 12,249 份自我报告。我们测试三个假设:规定的置信度经过校准,继承的基本原理影响后来的提案,基于适应性的选择提高了报告质量。三者皆失败。运营商将前 100 名的成功夸大了 4.8 至 9.3 倍,而校准和歧视则在模型系列之间分离。对 754 个继承原理的受控干预将真实原理的任何可衡量的好处限制在大约 250 个等级。尽管搜索行为截然不同,但基于适应度的选择和随机选择都不会在报告准确性方面产生可检测的选择差异或亲代到后代的传递。因此,代理的自我报告应被视为针对环境进行验证的声明,而不是其自身可靠性的证据。