论文
主体驱动的语料库语言学:自主语言发现的框架
Agent-Driven Corpus Linguistics: A Framework for Autonomous Linguistic Discovery
摘要
语料库语言学传统上依赖人类研究人员来提出假设、构建查询和解释结果——这个过程需要专业的技术技能和大量的时间。我们提出了代理驱动的语料库语言学,这是一种方法,其中 大语言模型 (LLM) 通过结构化工具使用接口连接到语料库查询引擎,接管调查周期:生成假设、查询语料库、解释结果和跨多轮细化分析。人类研究人员设定方向并评估最终输出。与不受约束的 LLM 一代不同,每项发现都基于可验证的语料库证据。我们并不将其视为基于语料库/语料库驱动的区别的替代,而是将其视为补充维度:它涉及谁进行探究,而不是理论与数据之间的认识论关系。我们通过模型上下文协议 (MCP) 将 LLM 代理链接到 CQP 索引的古腾堡语料库(500 万个词元)来演示该框架。只给出“调查英语强化词”,智能体识别出一个历时中继链(so+ADJ>very>really)、语义变化的三种途径(去词汇化、极性固定、隐喻约束)和语域敏感分布。受控基线实验表明,语料库基础有助于模型单独从训练数据中产生的量化和可证伪性。为了测试外部有效性,代理复制了两项已发表的关于 CLMET 语料库(4000 万词元)的研究 - Claridge (2025) 和 De Smet (2013) - 数量上非常一致。因此,代理驱动的语料库研究可以以机器速度产生基于经验的发现,从而降低更广泛的研究人员的技术障碍。