论文

编辑路由决定了人工智能辅助科学写作中计算结果的合格程度

Editorial routing shapes how computational results are qualified in AI-assisted scientific writing

模型评测模型行为与机制分析

摘要

大型语言模型越来越多地分析计算结果和起草手稿,使得可靠的通信与正确的分析一样重要。使用固定的计算证据,我们测试了在研究工作流程中其他地方的建模选择之间分配比较是否会改变手稿报告。在受限的句子写作任务中,当将详细比较分配给一组存储库时,Anthropic 的 Claude Sonnet 5 经常省略数字限定,但当将相同的比较分配给支持信息或其自己的工作笔记时,会更频繁地保留它们; Claude Opus 5 的灵敏度较低。这些效果并不遵循简单的可访问性顺序。有针对性的放置规则在很大程度上恢复了句子级别的资格,而通用准确性提醒却没有。较长的贡献保留了数字资格,尽管跨计算设置的一些摘要仍然被重定向到存储库。因此,在人工智能工作流程中记录上下文并不能确保读者遇到结果时的沟通。