论文
可信人工智能的真相:表达的怀疑、出处和作为可工程立场的信念修正
Truth for Believable AI: Expressed Doubt, Provenance, and Belief Revision as an Engineerable Stance
摘要
对话代理通常以一致自信的语体表达答案。我们测试表达的不确定性、起源感知断言和明确的信念修正是否可以作为固定语言模型上的行为层来实现;我们不测试可信度或信任。该层结合了三种认知状态、每个声明的置信度和类型来源、来源门控表达规则以及具有可审计确认和对错误更正的部分抵抗力的持久修订存储。我们使用合成模型和 Qwen2.5-0.5B-Instruct 在构建的、机械评分的多会话基准上对其进行评估。合成仪器通过了所有五项检查。在真实模型上,确认可靠性(一种推论保证)在 100% 的情况下成立,并且真实的更正比错误的更正更容易被接受(对于持有的信念,0.44 vs. 0.15;0.875 vs. 0.420,包括规则接受的对未持有事实的更正),但预先指定的表达保真度、矛盾分离和出处裕度失败。一项公开的事后分析表明,基于平均答案标记概率的表达门控将正确性排序低于端到端机会(AUC 0.41,对话集群),而基于采样一致性的门控则具有歧视性(AUC 0.66)。从该发现中选择并在单独提交的协议下进行评估的一致性门控配置满足会话级操作和功能等效标准,并在重新绘制的会话集上进行复制。操纵结果取决于选择,并且当不确定性集中在 60 个事实上时,这两个标准仍然悬而未决。支持的结论仅限于构建审计保证、依赖存储的部分校正辨别以及词元概率门控的特定于基准和模型的失败;在进行人工评估之前需要扩展事实基础。