论文

持续驻留科研Agent的单研究者实施案例

Persistent AI Agents in Academic Research: A Single-Investigator Implementation Case Study

模型评测评测方法与指标

摘要

背景:大语言模型 通常被评估为模型、基准或简短的对话片段。当智能体持久地嵌入具有持久内存、本地文件、外部工具、预定例程、委派角色和明确安全协议的真实学术研究环境中时,会发生什么,人们知之甚少。方法:2026 年 1 月 31 日至 5 月 25 日进行了结构化的自我观察实施案例研究。分析单位是持久的人类智能体环境:研究员、智能体运行时、记忆层、工具、存储库、预定作业、专门智能体角色和治理规则。结果是使用 PARE-M(持久智能体研究环境测量)进行组织的,这是一个涵盖架构、利用率、工件生产、资源使用、可重复性和治理的测量框架。结果:可恢复的主智能体遥测包含 96 个活跃日内的 75,671 条重复数据删除记录,其中包括 8,059 条用户角色消息和 23,710 条助理角色消息。工作空间包括 502 个记忆相关文件、17 个配置的智能体目录和 57 个技能文件。活动系统时间为 579.7 小时(30 分钟上限间隙估计)。源自记忆的记录识别出 482 个输出智能体事件和 889 个失败、验证、纠正或协议智能体事件。严格的 2026 年 5 月轨迹子集捕获了 627 个模型完成的事件和 7395 万个记录词元,其中 82.9% 是缓存读取。结论:工作流程以缓存为主,这表明持久智能体环境可能会将经济单位从每个词元的成本转变为每项已完成研究成果的成本。未来的评估应该使用工件级别的分母、可重复的解析规则、校正分类法和治理事件的独立编码。