论文

前沿模型Agent参与自然表型的本体标注

Frontier LLM-based agents can overcome the ontology curation bottleneck for natural phenotypes

智能体系统上下文与知识本体Agent任务评测

摘要

将自由文本的表型描述链接到本体术语(通常称为表型标注)对于跨研究整合比较形态学数据至关重要。这一劳动密集型流程高度依赖训练有素的人类专家,因而难以扩展,构成一个关键瓶颈。Dahdul等人(2018)在七项系统发育研究中建立了实体-质量(Entity-Quality,EQ)标注的黄金标准(Gold Standard,GS),并用基于本体的语义相似度指标评估了三名人类整理员和Semantic CharaParser NLP工具;他们报告称机器与人类的一致性显著低于整理员之间(人与人)的一致性。本文中,我们使用来自Anthropic和OpenAI的五个前沿托管LLM重新审视该基准,每个模型都在一个自包含的工作区中充当“智能体整理员”,该工作区提供源出版物PDF、原始人类整理员所使用的同一标注指南、四个项目本体(UBERON、PATO、BSPO、GO)以及一个验证脚本。在同样的黄金标准下评估,每个智能体都落在原研究三名训练有素的人类生物整理员的整理员间差异范围内;表现最佳的智能体接近但未达到表现最佳的人类整理员的水平。智能体在全部四项指标上大幅超越Semantic CharaParser。