论文

StoryScope:调查人工智能小说中的特质

StoryScope: Investigating idiosyncrasies in AI fiction

模型评测模型行为与机制分析

摘要

随着人工智能生成的小说变得越来越普遍,作者身份和原创性问题正成为如何评估书面作品的核心。虽然该领域现有的大多数工作都侧重于识别人工智能写作的表面特征,但我们要问的是,人工智能生成的故事是否可以在不依赖文体信号的情况下与人类故事区分开来,重点关注话语层面的叙事选择,例如角色代理和时间顺序不连续性。我们提出了 StoryScope,这是一个管道,可以自动生成跨 10 个维度的话语级叙事特征的细粒度、可解释的特征空间。我们将 StoryScope 应用于包含 10,272 个写作提示的并行语料库,每个提示均由一位人类作者和 5 个 LLM 编写,生成 61,608 个故事,每个故事约 5,000 个单词,每个故事提取 304 个特征。仅叙述特征就实现了人类与人工智能检测的 93.2% 宏观 F1 和六向作者归因的 68.4% 宏观 F1,保留了包含文体线索的模型超过 97% 的性能。一组紧凑的 30 个核心叙事特征捕捉到了大部分信号:人工智能故事过度解释主题并偏爱整洁的单轨情节,而人类故事将主角的选择框定为道德上更加模糊,并增加了时间复杂性。每个模型的指纹特征支持六向归因:例如,Claude 产生明显平坦的事件升级,GPT 对梦境序列过度索引,而 Gemini 默认使用外部角色描述。我们发现人工智能生成的故事聚集在叙事空间的共享区域,而人类创作的故事则表现出更大的多样性。更广泛地说,这些结果表明,潜在叙事结构的差异,而不仅仅是写作风格,可以用来区分人类撰写的原创作品和人工智能生成的小说。