技术实践
百度贴吧用Skills与子Agent自动评测审查规则
概述
百度贴吧团队把 AI CR 规则的效果迭代做成 6 步自动化评测流程:生成规则→Case 构造→数据集上传→任务创建(工作流)→通用标注→汇总报告。前两步有两种方式:方式一为传统手动分步法,由 Ducc 或 Zulu 把自然语言描述的规则需求转成小码哥可识别的 rules prompt(人工确认与反馈调优),Case 构造则拉取指定 iCode 评审代码库到沙箱环境生成正例/反例代码片段,插入现有代码类的 private 方法后每个 case 独立提交评审,最后产出含评审 URL 与评论的 Excel。 方式二为推荐的 Agent/Skills 一站式自动化,团队搭建 Comate Skills(路径 ./comate/skills/smart-cr-benchmark)与 Sub-agent personal-cr-benchmark 双引擎,后者具备规则生成、代码库管理、测试用例生成、代码集成、Git 工作流、评论生成、CSV 汇总 7 大能力,一句话生成全套评测 case 和标准答案,规则已确定时也可直接基于既有 rules 跳过生成步骤。 数据集上传后在 ComateStack 工作流(tieba_AICR/automation/workflow-detail/2703)上执行推理→评估→标注→报告:推理算子配置 rules 与环境类型(DEV/PRO)自动执行 AI CR 评审,评估算子配置模型(默认千问,可替换为 GLM/Claude 等)自动比对预期结果,可加人工标注审核后自动生成含准确率、召回率的评测报告,形成配置→评测→优化→再评测的规则迭代飞轮。 团队称该套 Sub-agent、Skills、工作流已全部模板化,其他团队可直接迁移。