论文
跨语言Token套利:经本地LLM优化代码智能体上下文窗口
Cross-Lingual Token Arbitrage: Optimizing Code Agent Context Windows via Local LLM Preprocessing
摘要
人工智能辅助编码代理受到输入令牌成本的瓶颈。原始人类输入的两种病态导致了大部分开销:非英语文本的标记化效率低下和对话提示中的结构熵。现有方法通过压缩已经臃肿的上下文或在发生故障后进行干预来做出反应。我们引入了一种在开发人员和云代理之间运行的飞行前边缘提示重写中间件。本地 Llama 3.2 (3B) 模型执行英语跨语言翻译、将结构重写为紧凑的面向任务的格式,以及经过正则表达式验证的后备重写保护措施,以确保优化的提示永远不会大于原始提示。我们对 OMH-Polyglot 进行评估,这是一个涵盖土耳其语、阿拉伯语、中文和代码转换规范的多语言编码基准。在三个商业 LLM 后端中,中间件将提示令牌减少了 34-47%,总令牌减少了高达 18.8%,同时保持或提高了任务准确性。消融研究表明,收益主要来自重写阶段,而不是简单的函数名称提取。与压缩率匹配的 LLMLingua-2 相比,我们的方法在所有评估的后端中始终实现卓越的 OckScore 性能。这些结果表明,主动提示优化可以在不牺牲编码质量的情况下大幅降低推理成本。