论文

大语言模型解释、嵌入组织、图谱涌现:智能体驱动的科学知识编译

LLMs Interpret, Embeddings Organize, Graphs Emerge: Agent-Driven Compilation of Scientific Knowledge

上下文与知识知识获取与更新

摘要

持续的科学工作需要一个知识基础,可以跨任务进行解释并保留获取证据的路径。我们将这个过程称为\emph{科学知识编译},并在ASKS(\emph{代理驱动的科学知识系统})中实现。对于每个来源,LLM都会生成可读的 Wiki 视图和面向机器的语义。确定性检查将后者转换为文档本地 GraphDelta,并将几何图形与显式图形规则一起嵌入,将建议的更改集成到持久状态中。每次摄取都是对累积知识的可检查状态转换,编译后的 Wiki 和图形视图链接到保存的源记录。我们通过按时间顺序汇编来自一个研究项目的 56 篇已发表论文来检验这一过程。分支生存、跨论文支持、沿袭、覆盖和流失产生了以张量网络方法为中心的可追溯的作者研究肖像,并分支到量子多体研究、张量网络机器学习和面向量子人工智能的方向。在此过程中,更高级别的 Hub 组织保持稳定且低流失。规范节点的增长主要是加性的。图形级测量和导航路径保留到编译它们的源记录的链接。

大语言模型解释、嵌入组织、图谱涌现:智能体驱动的科学知识编译:论文配图
图1:ASKS中的科学知识汇编。每个接收的科学来源 DtDt} 都保留下来, 而一个大语言模型则产生两个互补的来源-本地表达方式: 一个可读 Wiki 视图 WtWt} 和 机器显示的语义空格 StSt} 。校验语义和确定源关系形成可检查的文件- 本地的 GrapDelta @ t\ Delta} 。嵌入的几何和清晰的图形规则将三角洲与累积状态 GtG} 整合, 以生成 Gt+1Gt+1} 。重复这种过渡,将当地口译变成一个不断演变的研究地图。持续的维基和图形表面引导导航,而科学主张则决心要找到源处理的证据。