论文
可靠性所在:代理系统中行为属性的实验本地化
Where Reliability Lives: Experimental Localisation of Behavioural Properties in an Agent System
摘要
关于代理系统的可靠性声明隐含地将每个属性定位在某个地方:在模型中,或者在模型周围的机器中。我们建立了一个系统,其中该位置是一个实验问题。该主题是一个持久的模拟解决方案,其权威的仅附加分类账裁决每一个针对世界国家的企图行为;公认的历史是唯一的现实。在任何实验之前,思想、制度和世界都是分开的。保持认知不变,我们干预机构的认知机制(证据来源、信念可用性、物证易读性);预先登记的实验两次反驳了我们的中心预测,方向相反。然后,注册的造假者提供几何图形否认信念通道的输入,上演的真实的第一手证人,及其边际值,在整个无证人阶段为非正值,变为正值:11个种子中的9个,零添加了错误归因。在固定制度执行的情况下,我们以四种方式干预认知:消融本土思想的机器,在任务中杀死并重置它们,用冻结的前沿-LLM面板代替整个本土认知,并用可信的虚假证词腐蚀信仰。行为发生了巨大的变化:一个谎言让每个信任团队付出了大约 900 次徒劳的行动,而不信任团队却没有付出任何代价。五项预先声明的属性没有按照任何测试的轨迹移动:接受的现实保持单一,无效的尝试因键入的原因而被拒绝,职责超出了其流程,没有工作被接受两次,并且没有接受错误的完成(2,581 个替代面板声明,没有错误)。我们的主张仅限于这种情况:测量的行为特性与通过干预建立的认知的实质性变化是分开的。一个设计好的世界,而不是一群机构;没有针对机构优化代理的测试。