论文
MoMHa:联合优化支撑框架的准确率、安全与 token
MoMHa: Multi-Objective Optimization of LLM Harnesses over Accuracy, Safety, and Tokens
摘要
大语言模型改进工作大多把准确率作为唯一目标。本文认为,围绕模型构建提示、路由调用和解析输出的Python支撑代码(harness)本身也是重要设计对象,其质量有多个目标:准确但从不拒绝不安全请求,或多消耗一个数量级token的支撑框架,都不能算好。Meta-Harness将设计转为对各领域准确率、行为安全和token成本三个目标的搜索,由 Agentic 方案生成器 Claude Code 读取历史代码、执行轨迹和评分文件后提出改进。核心发现是单阶段联合奖励方案MoMHa优于包括先准确率后token的两阶段消融、仅标量反馈和仅准确率基线在内的所有比较方案。评估涵盖17个领域:7组合成能力任务、7个真实公共基准(HumanEval、MBPP、Spider、FEVER、MMLU-Pro、LawBench、NuminaMath),以及3个源于U-SafeBench的用户特定安全领域,使用跨4个家族的12个模型。合成任务中MoMHa联合均值为0.482,10个基线为0.198—0.422,在10个逐领域列中赢得7个;真实任务得分0.461,最强基线DSPy为0.377,赢得7列中的5列。在12个目标模型中的8个上,无须重新训练即可把支撑策略迁移到未见基准。MoMHa获得最高的实测行为安全综合分(U-SafeBench为0.781),每个样例比两阶段方案少用95个token。作者计划发布全部支撑代码、评估设施和跨模型日志。
