论文
LemonHarness技术报告
LemonHarness Technical Report
摘要
随大语言模型(LLM)智能体应用于更长任务——它们日益跨多轮迭代修改工作区状态。但智能体通常只观察工具输出与日志片段——而实际状态变化发生在文件系统中。没有显式工作区边界——文件写入与临时工件生成等改状态操作可能把变更散布到各路径。随时间推移——这些弱约束变更累积——使修改文件等状态难以追踪。本文提出LemonHarness——面向长程智能体的集成执行框架。LemonHarness建立显式执行边界:把改状态操作约束在明确定义的工作区内——并把模型调用、工具执行与规则知识纳入单一受控边界。改状态操作(文件写入、依赖安装、临时工件创建)经结构化工具接口执行——执行反馈记录为可供后续模型决策使用的观察。系统还引入可复用规则知识库——把反复出现的执行规则与验收标准变成运行时知识。LemonHarness进一步加入时间感知执行机制——向模型暴露已用与剩余预算——使其能随时间压力变化重新平衡探索、实现与验证投入——避免长等待或过度验证导致超时。在Terminal-Bench 2.0上——LemonHarness_GPT-5.3-CodeX在445次试验中达84.49%准确率;同框架搭配更强的GPT-5.5骨干把五次作业的平均准确率提升到86.52%。结果表明统一运行时边界、可调用规则知识与时间感知执行能改善长程智能体执行的稳定性。
