技术实践
OpenAI 与 Ironclad 用业务规则细化法律任务的计算机使用评估
概述
Ironclad 与 OpenAI 将法律商业采购流程转成11项端到端计算机使用任务,每项用8—50个细分规则检查最终业务状态。研究使用受控 Ironclad 环境及合成任务,结合经过筛选的公开SEC EDGAR材料,不使用Ironclad未公开客户数据。任务涉及多步骤浏览、信息处理及记录操作,人工耗时由专家估计约30—40分钟。研究先在这些任务上强化训练模型,再比较可公开使用的模型与内部训练结果。官方报告 GPT-6 Astra Max 平均得分55.0,GPT-5.6 Sol High为41.6;对应模拟估计时间为19.2与37.0分钟。时间为评估估计,不能解释成客户现场实测节省;更高的内部结果也不等于公开模型性能。方法价值在于把真实业务约束落实到可重复测试和多项验收规则,帮助区分界面操作完成与业务任务真正成功。