论文

不那么甜蜜:LLM 文档工作流程中格式稳健性的实证研究

Not as Sweet by Another Name: An Empirical Study of Format Robustness in LLM Document Workflows

模型评测评测方法与指标

摘要

LLM 驱动的软件系统正在从纯文本对话快速发展为以文档为中心的端到端工作流程,其中相同的语义内容可以通过文件上传接口以不同的文档格式(例如 CSV)交付。然而,现有的测试工作侧重于输入为单个提示字符串的模型和系统的稳健性和可靠性,而没有回答一个关键问题:当相同的内容以不同的文档格式到达时,这些文档工作流程能否保持稳健的行为?为了填补这一空白,在本文中,我们提出了一种具有三种变质关系的格式感知变质测试框架,以全面评估端到端 LLM 文档工作流的格式鲁棒性。基于该框架,我们进行了大规模的实证研究,涵盖四个代表性的 LLM 工作流程、四个实际任务和四种文档格式,总共包括 48,000 个工作流程执行。我们的研究结果表明,格式变化构成了系统性的严重威胁。仅仅切换格式就会导致准确率下降高达 53.63%,并在超过 41% 的情况下引发决策偏差。我们从用户的角度进一步设计了轻量级缓解策略,无需模型重新训练即可恢复高达 44.21% 的格式引起的决策漂移。我们的研究表明,文档格式不是中立的包装,而是影响LLM软件系统可靠性的关键因素,需要在实际高风险场景的部署中进行相应的测试和保障。