论文

Multisage:以可验证多语义表示增强代码翻译

Enhancing LLM-Based Code Translation with Verified Multi-Semantic Representations

摘要

现有大语言模型代码翻译常依赖词元统计,而未充分理解程序语义,导致逻辑与语义错误。功能描述和测试可辅助翻译,但实际场景中常缺少这些材料。Multisage直接从源码构建并校准多种语义信息。首先提取数据流图、类型约束和外部API信息;再生成代码摘要、函数级测试、API说明与测试;最后通过语义保持变异和跨语义一致性验证,过滤、校准和改进生成语义。在HumanEval-X上,该方法在多种主干模型中最高达到基线2.22倍的翻译成功率,持续优于直接提示、指令微调模型和思维链,较小模型的收益最大。