技术实践
字节跳动用多模型与多框架实验验证Harness交付
概述
针对豆包一个中等复杂度的需求(用户在创作页面内创作视频并做预览与调整),团队选取 3 个主流 Coding 模型与 3 个主流 Agent 框架两两组合,用真实业务需求与相同 Prompt 各跑 100 次,总计 900 次。第一轮结果:仅看功能正确率,所有组合均超过 80%。但按 UI 易用性、交互可行性、可靠性、可维护性、性能、兼容性等可交付性维度衡量,所有组合得分相对正确率出现大幅下降,且模型与框架组合表现出很强随机性,典型问题包括异常处理不规范、未复用仓库已有组件、改动影响历史功能、实现方式不符合团队工程规范,按真实业务上线标准距交付仍有距离。 第二轮把 Harness 基建(上下文工程、架构约束、团队知识是否已沉淀进 Memory、历史技术债梳理等)结合进去重跑:正确率由 80% 提升至接近 90%,可交付性得分普遍由此前 40—60 分的不及格水平提升至 80 分水平。