论文

LemonHarness技术报告

LemonHarness Technical Report

智能体系统Agent Harness

摘要

随大语言模型(LLM)智能体应用于更长任务——它们日益跨多轮迭代修改工作区状态。但智能体通常只观察工具输出与日志片段——而实际状态变化发生在文件系统中。没有显式工作区边界——文件写入与临时工件生成等改状态操作可能把变更散布到各路径。随时间推移——这些弱约束变更累积——使修改文件等状态难以追踪。本文提出LemonHarness——面向长程智能体的集成执行框架。LemonHarness建立显式执行边界:把改状态操作约束在明确定义的工作区内——并把模型调用、工具执行与规则知识纳入单一受控边界。改状态操作(文件写入、依赖安装、临时工件创建)经结构化工具接口执行——执行反馈记录为可供后续模型决策使用的观察。系统还引入可复用规则知识库——把反复出现的执行规则与验收标准变成运行时知识。LemonHarness进一步加入时间感知执行机制——向模型暴露已用与剩余预算——使其能随时间压力变化重新平衡探索、实现与验证投入——避免长等待或过度验证导致超时。在Terminal-Bench 2.0上——LemonHarness_GPT-5.3-CodeX在445次试验中达84.49%准确率;同框架搭配更强的GPT-5.5骨干把五次作业的平均准确率提升到86.52%。结果表明统一运行时边界、可调用规则知识与时间感知执行能改善长程智能体执行的稳定性。

LemonHarness技术报告:论文配图
图 1:LemonHarness 框架概述。任务通过统一的运行时边界进行处理,该边界集成了模型推理、工具执行、工作区状态和执行日志。一般规则知识提供可重用的执行规则、标准和任务优先级,而时间感知控制根据已用和剩余​​预算调整探索、实施和验证。通过外部验证检查最终任务状态,同时保留可追踪的执行记录。