科学Agent:评估科学任务的专业系统提示
Scientific Agents: Evaluating Profession-Specific System Prompts on Scientific Tasks
摘要
详细的专业特定系统提示提高了词元使用率和每次响应的估计成本,但没有一致的准确性增益。我们通过 Pi Agent工具中的 OpenRouter 使用 Gemini 3.8 Flash 评估 Scientific Agents,这是一个包含 503 个专业 AGENTS.md 配置文件的开源语料库。我们将匹配的个人资料与四个对照进行比较:最小基线(“你是一个有用的助手”)、个人资料的开头角色句子、通用的科学严谨性指南以及来自不相关领域的个人资料。在 9 个基于文本的科学基准(4,531 个抽样问题,100 个匹配的配置文件)中,4,488 个项目在 API 错误重试后完成了所有五个条件,并通过基于规则的自动评分进行评分。平均配置文件-基线准确度差异为 -0.6 个百分点(固定任务的 95% 引导区间 [-1.5,+0.2]),并且没有基准显示统计上有明显的改进。匹配的配置文件产生的输出词元数量是原来的 1.5-2.3 倍,每次成功调用的成本是原来的 2.2-4.5 倍。在 60 个使用 BioMysteryBench 工具的生物信息学问题(基线和配置文件各运行 3 次)中,配置文件的平均解决率为 46.7%,基线的平均解决率为 56.7%,差异为 -10.0 个百分点(95% 区间 [-16.7,-3.3]),这是由于配置文件下更频繁的词元和时间限制停止造成的。更长的提示有一个意想不到的操作优势:在 SuperGPQA 上,频繁的提供商 API 丢弃留下了较短的基线,只有 54.0% 的项目得到了正确的首次通过答案,而配置文件中的这一比例为 71.6%。通用和不匹配的提示几乎同样可靠,因此这种增益来自提示长度或格式,而不是领域专业知识。对于测试的模型和任务,默认加载完整的职业档案并不会提高准确性,而且成本会更高;选择性检索剖面部分或开放式科学任务是否会改变这一点仍有待测试。