技术实践

淘天用人工干预次数评估复杂AI编码任务

应用与实践上下文与知识模型评测上下文工程评测方法与指标编程

概述

淘天团队在一个真实项目中统计了使用 AI Coding(类似 Speckit 的工程模式)的效果,并区分真提效与伪提效:真提效表现为 AI 能独立完成大块工作、人工只做参数与样式等轻量调优、生成代码可维护。伪提效表现为需频繁交互对话、AI 生成后需要大量返工(50%+ 人工调整)、架构设计与质量把控的心智负担仍在开发者身上。 结论是 AI 只在约 20% 的标准化场景中真正有效,80% 的复杂场景效果差甚至反效果。据此团队提出不应以「AI 代码采纳率」为指标——只要工程师坚持不写任何一行代码,完全通过对话让模型输出,采纳率可以做到 100%,但这不代表提效。真正的指标是需求完成上线时的人工干预次数,只有该次数降到最低才能证明大模型真正提效,在此目标下模型运行速度慢、部分场景能力不达标都可接受。 团队同时定位了导致提效不达预期的根因:模型层面注意力机制 O(n²) 限制、上下文膨胀与注意力坍塌(上下文超过 180-200K 后输出质量明显下滑,Coding Agent 普遍将窗口限制在 200K 左右)。方法论层面 Spec 工具框架化约束与「小步快跑」冲突、缺乏外部上下文注入与深度分析、任务粒度单一、PRD 图片与设计稿等多模态信息被丢弃。 协作模式层面 Vibecoding 长对话导致人机窗口不对称(AI 侧约 165K tokens 全在注意力范围,人只看得到最近 3-5 轮)与认知债。