技术实践
腾讯用LLM评审模型自动评测Harness研发工作流
概述
chaseren所在团队在内部Harness研发工作流的自动评测与回归改进场景中应用AI。团队用Go实现评测CLI,由LLM考官按剧本与被测Agent多轮交互,独立裁判依据评分标准及工具调用记录判分,以git worktree隔离并发运行,并将缺陷归因到工作流、题目或模型能力。经过4轮workflow_rev迭代和50余次自动化运行,修复3道失败题后,17道题的通过率由82.4%(14/17)升至100%(17/17)(发布方自述口径)。