论文

PaperClaw:用智能体实现自主研究与人机协同精修

PaperClaw: Harnessing Agents for Autonomous Research and Human-in-the-Loop Refinement

智能体系统上下文与知识记忆Agent HarnessAgent SkillsAgent记忆

摘要

大语言模型已成为有能力的推理者与工具使用者——能编写运行代码并检索文献——使自动化研究过程本身成为现实目标。我们提出PAPERCLAW——受测试框架约束的多智能体系统:从研究领域自主推进到完成的论文。PAPERCLAW从一个领域的活文献、数据集与代码中策展研究域;以预注册的主结果契约头脑风暴出想法;经迭代提议-测试-反思循环驱动可停止的假说地图——仅从测量裁决生长、在证据支持想法后停止——此时撰写符合会议要求的论文。全生命周期记忆把每个阶段保持在单一活记录中——长时运行可暂停、检查与恢复而不丢上下文。核心是带研究工具与技能的环内研究助手:它能自主驱动整条管线——同一接口也让人在任何阶段介入——经人机协同精修把首份自主草稿变成更强的论文。全程PAPERCLAW保持输出锚定可查:仅引用经开放学术索引验证的参考文献、报告真实运行过的结果。LLM裁判评估发现PAPERCLAW无论完全自主还是人机协同精修都能产出强论文。

PaperClaw:用智能体实现自主研究与人机协同精修:论文配图
图 1:方法概述。 PaperClaw 将策划的领域(论文、数据集、代码、场所)转化为想法规范,然后通过迭代提议 →\rightarrow 测试 →\rightarrow 反射循环驱动假设图,仅根据测量的结论(绿色支持,红色反驳,琥珀色不确定)来增长地图,直到证据足以编写论文。在整个过程中,循环研究助理允许用户在任何阶段介入,例如完善领域、提出假设、解释结果或起草论文。