Humanize:为Agentic编程建立独立判断与验收机制
Humanize: Judgement Engineering for Agentic Coding
摘要
Agentic编程降低了代码生成成本,但可靠地完成任务仍然困难:负责写代码的Agent往往无法可靠判断任务是否已经完成。我们提出Humanize,这是一个围绕判断工程构建的多Agent编程工作流,在规划、实现、审查和学习阶段的交接处,以明确、可由程序强制执行的规则作出判断。人工批准计划契约,构建Agent分轮实现,来自另一厂商的审查Agent判断是否完成;角色间的流转由确定性Hook控制,而非交给模型决定,并执行72项机械检查。若将工作流视为仓库状态上的马尔可夫链,交替构建和审查相当于从两个模型联合采样,一个缺陷只有被双方同时漏掉才会保留下来。我们通过实际部署、118份真实循环的公开复盘及其应用研究Humanize。项目在108天内发布68个版本,获得1,468个GitHub Star。应用包括正在接受上游审查的gem5构建系统迁移,涉及567个文件;Kernel Design Agents通过内核知识库和性能分析反馈扩展该循环,在MLSys 2026 FlashInfer竞赛全部三个Full-Agent赛道中均进入前三;Humanize Olympiad Agents(HOA)在IOI 2026、IMO 2026、IPhO 2026和IBO 2024中取得满分,在IChO 2026中取得418.5/437分并获得金牌。Humanize还在PutnamBench上取得672/672,并在Lean-Eval榜单以251/303排名第一,与专业数学家同台比较。复盘显示,独立审查能够发现构建Agent缺乏依据的完成声明,但何时停止仍是主要弱点。在能够区分阶段轮次的报告中,三分之二的轮次发生在实现已经通过验收之后。这些证据来自观察性研究,而非不同工作流的受控比较。