论文
正在构建的理论:在规范不断发展的情况下为研究软件编排语言模型
Theory Under Construction: Orchestrating Language Models for Research Software Where the Specification Evolves
摘要
大语言模型 现在可以生成大量代码和草稿研究文本,但研究软件项目需要的不仅仅是任何一个工件。数学论文、可执行系统、基准面和公共主张必须一起成熟,但往往会出现疏离。我们确定了两种特定于 LM 的故障模式:幻觉累积,其中声明超出了代码或理论支持的范围,并且不受支持的断言在会话中传播;以及去同步,其中代码、理论或模型自己的世界模型失去了一致性。我们提出 Comet-H,这是一种迭代提示自动机,它将构思、实现、评估、基础和论文写作协调为单个工作空间状态的耦合坐标。在每一步中,控制器都会根据工作区当前缺乏的内容进行评分来选择下一个提示,以半衰期推进未完成的后续工作,并在文档发生变化时根据代码和基准重新检查论文和自述文件。我们将提示选择视为提示系列上的一个小型上下文强盗问题,以提示为臂,工作空间赤字为上下文,以及手动加权的线性分数。这个透明的记分器,与未完成工作的褪色记录相结合,限制了长期的后续行动,不需要学习策略,并使每个即时选择在工作空间中清晰可见。我们创建了涵盖 20 个领域的 46 个研究软件存储库的组合。我们深入研究了 A3,这是一种完全在循环内构建的 Python 静态分析工具,在 90 例基准测试中达到了 (F1 = 0.768),而次佳基线为 0.364。在大约 400 次提交中,我们发现审核和收缩通过在每个成功轨迹的后期阶段占据主导地位。