论文

面向教材历史偏见检测的智能体评估架构

An Agentic Evaluation Architecture for Historical Bias Detection in Educational Textbooks

智能体系统Agent 协作

摘要

历史教材常包含隐性偏见、民族主义叙事框架和选择性遗漏,这些内容难以规模化审计。我们提出一种智能体评估架构,由一个多模态筛查智能体、五个异构评估智能体组成的陪审团,以及一个用于裁决综合与上报人工的元智能体组成。一项核心贡献是来源归因协议(Source Attribution Protocol),它区分教材叙述与所引用的史料,防止单一模型评估器中因错误归因而导致的系统性误报。在针对罗马尼亚高中历史教材的实证研究中,270个筛查片段中的83.3%被判定为教学上可接受(平均严重度2.9/7),而零样本基线下为5.4/7,表明智能体审议可减轻过度惩罚。在一项盲测人工评估(18名评估者、54组对比)中,独立审议配置在64.8%的案例中被优先选择,胜过启发式变体和零样本基线。每本教材成本约2美元,这些结果使智能体评估架构成为教育治理中经济上可行的决策支持工具。

面向教材历史偏见检测的智能体评估架构:论文配图
图2:系统生成的HTML报告示例,突出教材中提取的历史偏见、分类学归类及所评定的严重程度分数。