论文

阅读用结构、写作用散文:多智能体文档写作中的非对称结构条件化

Structure for Reading, Prose for Writing: Asymmetric Structural Conditioning in Multi-Agent Document Authoring

摘要

撰写正式文档的多智能体流水线既要阅读请求方的表格,又要针对表格写作。我们报告一个已部署的标书应答系统,它在主权约束下运行开源权重模型,并以同一机构实际提交的人类标书作为对照评估。在一次系统没有可用范文的盲评比较中,LLM评判者在55个真值章节中的40个上评定系统答案不逊于人类提交的答案,在4个上更好,未遗漏任何章节,总共标记了一处无依据断言。对评判者识别出的每一个差距进行分类显示,68%是系统自身来源中不存在的内容——即人类作者掌握而流水线从未获得的知识——因此15个不利判定中只有6个涉及系统本可避免的缺陷。与真值的偏差更多是信息可得性问题而非写作质量问题,不区分两者的评估会低估这类系统。在此背景下,我们报告一种条件化非对称性。将文档渲染为结构化标记而非平铺散文能改进抽取,这一点已广为确立,我们在三个阅读任务上复现了它。但这一收益不能迁移到条件化上:在配对比较中,把标书的指令(instruction)材料从散文转换为嵌套XML,使答案质量从74%降至48%。我们进一步发现,点名某种被禁止的构造会使其集中而非消除——96%的残留缺陷落在提示明确点名的两种形式中;而将随机标注与确定性窗口函数耦合,会在字节完全相同的文件上把抽取的需求条数从68变为51。结构应属于模型阅读之处;散文与自施的测试应属于模型写作之处。

阅读用结构、写作用散文:多智能体文档写作中的非对称结构条件化:论文配图
图1:与人类工作的对比评估。(a) 由一个被指示按质量而非相似度打分的LLM,将系统的答案与该机构为同一采购提交的人工撰写标书进行评判;系统在该招标中没有可用的范例。下方的条形是在剔除仅由系统信息源不包含的信息所导致的不利判定后重新评分的结果(§3.2)。(b) 评判者指出的每一个差距,按原因分类。(c) 在第二项采购中,一位人类编辑基于系统草稿进行工作;直方图是每条草拟答案的措辞在提交文档中保留下来的比例(§3.3)。