技术实践
腾讯元宝产品经理以固定条件实测DSH与Kimi Code编码差异
概述
DeepSeek Harness(DSH)随V4 Pro开源后,一位腾讯元宝产品经理在本机跑通其Web、Headless与Python SDK等入口,并固定Kimi K3模型、提示词与隐藏验收,与Kimi Code做对照。两道编码题中,两套Harness四条轨迹全部通过15/15验收,耗时快慢互有胜负;过程差异明显:Kimi Code并行读取后整文件写入,工具调用更少,DSH minimal则在bash与编辑器间反复,步骤更碎,但前缀冻结、请求日志更完整,便于复现实验。用V4 Pro做跳一跳前后端任务时,DSH分三段会话约25分钟、85个step、96次工具调用,交付19项后端测试;Kimi Code初版约14分半、含两轮修复约21分钟,交付17项测试,并依据真实浏览器反馈修复问题。两套都出现过模型自测通过而真实浏览器失败的情形,最终靠外部浏览器验收与人工试玩兜底。作者提醒:每题仅单次运行、工具配置不完全一致,不构成性能排名;只找日常编码工具可优先选更成熟的产品,做领域Agent或评测复现则DSH的插件树与事件日志更有价值,生产接入还需自行补齐插件来源、凭证边界等治理。