论文
超越准确性:衡量负责任的人工智能评估的思想链推理中的偏差确认
Beyond Accuracy: Measuring Bias Acknowledgment in Chain-of-Thought Reasoning for Responsible AI Evaluation
摘要
推理模型越来越多地用于最终答案不是唯一审查对象的环境中:教育工具可能会向学生展示中间步骤,决策支持系统可能需要人工监督,审计工作流程可能会检查误导性或有偏见的输入痕迹。在这种设置中,两个响应可以收到相同的最终答案分数,但跟踪是否明确标记注入的偏见内容有所不同。只考虑准确性的评估会导致这些情况崩溃。我们研究这个差距作为负责任评估的测量盲点,并引入具有两个轴的最小痕迹级诊断:\emph{敏感性}(偏差是否破坏了先前的正确答案)和\emph{确认}(痕迹是否包含对注入内容的标题定义的表面参考)。在数千个有偏差的 GSM8K 试验中,GPT-4o 和 Claude Sonnet~4 在相同的标题下具有相似的敏感率($1.3\%$ vs. $1.2\%$),但确认率却截然不同($13.0\%$ vs. $75.0\%$)。