论文
社会科学中的 AI 编码智能体:方法论多样化、经验一致、解释上脆弱
AI Coding Agents in Social Science: Methodologically Diverse, Empirically Consistent, Interpretively Vulnerable
摘要
在科学分析中部署基于 LLM 的代理引起了相反的担忧:代理可能会减少方法的多样性,或者它们可能会增强分析的灵活性,从而使研究人员得出有动机的结论。我们认为这些担忧针对两个在经验上可分离的层:方法选择的设计层和决策层,其中决策规则将估计映射到实质性主张。我们通过针对众多分析师的人类基线对著名的移民和社会政策运行 20 次独立的 Claude Code 和 Codex 执行来进行测试。在设计层面,Codex 符合人类方法论的多样性,而 Claude Code 产生的规范数量几乎是人类的三倍;两种代理的效果估计与人类共识大致一致,并且没有代理模型与任何人类模型完全匹配。及时诱导的反移民研究人员会事先重新组织每个智能体的方法决策,但与相同数据中存在偏见的人类分析师不同,不会改变总体估计或最终裁决;智能体也不会沿着人类用来偏差其估计的方法轴重新调整路线。在判决层,明确的确认提示将 Claude Code 的判决从 10% 支持率翻转到 90%,同时保持其系数分布基本不变,通过规则省略而不是规则软化来操作。人工智能代理可以在设计层与人类方法多样性相媲美或超越,同时在判决层保持脆弱性。在我们的环境中,人工智能偏差的根源不是估计,而是解释。