论文
AI Harness工程:基础模型软件代理的运行时基础
AI Harness Engineering: A Runtime Substrate for Foundation-Model Software Agents
摘要
基础模型已经改变了自动代码生成,但自主软件工程代理在实际开发环境中仍然不可靠。主流的解释是模型能力中存在这种差距。我们提出了一个不同的轨迹:软件工程能力从模型-Harness-环境系统中产生,其中运行时底层(Harness)调解基础模型代理如何观察项目、对其采取行动、接收反馈并确定更改是否完成。我们将此基础正式化为人工智能Harness工程,并确定十一个组成部分的职责:任务规范、上下文选择、工具访问、项目内存、任务状态、可观察性、故障归因、验证、权限、熵审计和干预记录。我们通过四级阶梯(H0-H3)来操作该工具,逐步向代理公开运行时支持,并且我们提出了一种基于跟踪的评估协议,将每个代理运行转换为可审计的情节包。应用于受控验证任务时,该框架生成情节包,其证据结构随Harness级别而系统地变化:较低级别仅生成最终补丁,较高级别生成再现日志、故障归因、确定性需求检查和结构化验证报告。该框架重新构建了自主软件工程的核心问题,从基础模型是否可以生成补丁到模型-工具-环境系统是否可以生成可验证的正确性、归因性和可维护的更改。我们概述了基础模型软件代理所需的运行时系统的研究计划。