论文
Agent何时提供帮助?经典文本及其翻译的嵌入、LLM 和 Agentic 对齐
When Do Agents Help? Embedding, LLM and Agentic Alignment of Classical Texts and Their Translations
摘要
经典文本与其翻译的对齐支持机器翻译、检索和计算研究,但比较对齐工作流程的证据却很分散。这项研究比较了巴利语、梵语、米什尼希伯来语和藏语 452 个文本的 7 个系统,包括 9,833 个人类对齐单元:四个嵌入管道、一个直接 LLM 调用、一个自主Agent以及由独立审计员修改的Agent。生成工作流程可以恢复 93-94% 的参考对应关系,而嵌入最多只能恢复 77%。上限分析表明,句子边界使得嵌入管道无法表示某些参考。生成工作流程中的参考恢复类似:Agent的优势为 0.5 个百分点(95% CI -0.02 至 1.17),并且审核没有增加任何既定优势。尽管如此,Agent仍会为所有 452 个文本生成结构上有效的输出,而直接调用则为 437 个文本。一个盲法三名LLM小组根据来源和人类参考来评估每一个生成不匹配。大多数不匹配都被标记为可辩护的编辑变体;一致的重大错误标签仅覆盖 0.06-0.14% 的单位。该小组标记的Agent残留缺陷明显少于直接调用(0.7% 与 1.4%),这表明参考恢复本身低估了对齐质量。在在线发布的十部长巴利语开示中,Agent和审计Agent将直接调用的恢复率从 71% 提高到 84% 和 92%。相同的参考定位块使所有三个都达到 93%。因此,智能体提高了结构可靠性并减少了短段落上的判断缺陷,而它们在长文档上的巨大恢复优势在分块后消失了。在这种情况下,独立审核对准备好的段落几乎没有提供可衡量的额外好处。