论文
协作技术文档的句子特异性得分:领域迁移研究
Sentence Specificity Scores for Collaborative Technical Documentation: A Domain-Transfer Study
摘要
协作取决于共享的上下文,而技术文档是上下文在人员和 AI 团队成员之间持续存在的一种方式。特异性,即用语言表达的细节的数量和准确性,决定了文档捕获的信息内容以及信息传达的精确程度。这项工作审核技术文档中的句子特异性评分工具及其产物,并测试是否仅在生成后应用分数,以帮助在固定的大语言模型生成的修订中进行选择。在维基百科和三个技术文档语料库中,固定的通用领域预测器 SpeciTeller 和 Ko 等人的目标适应预测器的固定出版后作者存储库实现产生了不同的语料库顺序和相同句子排名一致性(从 -0.066 到 0.510)。严格的过滤和词元长度调整会改变这些模式而不协调它们。在 Gemma 集中,SpeciTeller 排名将方向有效选择从 71.7% 提高到 83.3%(+11.7个百分点;95% 源案例bootstrap区间 +1.7 到 +21.7);在 GPT-OSS-120B 集中,SpeciTeller 排名将方向有效选择从 51.7% 提高到 56.7%(+5.0个百分点;95% 源案例bootstrap区间 -6.7 到 +16.7),并且每个主要单分 GPT-OSS-120B 区间都包含零。这些发现将分数解释和决策值与预测变量和候选集联系起来。