论文
论文重构评估:评估人工智能撰写的论文中的呈现和幻觉
Paper Reconstruction Evaluation: Evaluating Presentation and Hallucination in AI-written Papers
摘要
本文介绍了第一个用于量化现代 编码智能体 撰写的论文质量和风险的系统评估框架。尽管人工智能驱动的论文写作日益受到关注,但对人工智能论文的质量和潜在风险的严格评估仍然有限,并且对其可靠性仍缺乏统一的认识。我们引入论文重建评估(PaperRecon),这是一个评估框架,其中从现有论文创建概述(overview.md),之后代理根据概述和最少的额外资源生成完整的论文,然后将结果与原始论文进行比较。 PaperRecon 将人工智能撰写的论文的评估分解为两个正交维度:演示和幻觉,其中演示使用评分标准进行评估,幻觉通过基于原始论文来源的代理评估进行评估。为了进行评估,我们引入了 PaperWrite-Bench,这是 2025 年之后发表的来自不同领域顶级场所的 51 篇论文的基准。我们的实验揭示了一个明显的权衡:虽然 ClaudeCode 和 Codex 都随着模型的进步而改进,但 ClaudeCode 以平均每篇论文超过 10 个幻觉为代价实现了更高的呈现质量,而 Codex 产生的幻觉更少,但呈现质量较低。这项工作朝着建立人工智能驱动的论文写作评估框架并提高研究界对其风险的理解迈出了第一步。