论文

POTracker:为符合标准的停电报告生成优化大语言模型

POTracker: Optimizing Large Language Models for Standard-Compliant Power Outage Report Generation

模型训练监督微调与指令调优

摘要

近期大语言模型(LLM)擅长通用文本生成——但用于领域特定数据生成仍然困难——因为输出必须遵循严格格式与结构规则。不同于问答或翻译等开放任务——领域特定生成必须语义正确且符合既有指南与标准。本工作中——我们研究美国公用事业停电报告的全国互操作性问题。实践中——停电报告需要机器可读(如JSON或XML)——且必须严格遵循能源行业监管机构的要求。为解决该问题——我们提出POTracker——为停电报告生成优化的LLM。我们以所提目标微调Qwen2.5-7B-Instruct。关键贡献是新损失函数POTrackerLoss——同时考虑生成报告与真值报告间的文本相似度与结构(标签)相似度。我们在1,000份停电报告数据集上评估POTracker——并与五种知名微调方法及一种基于规则的XML转换方法比较。结果表明POTracker超越其他微调方法——整体准确率最高提升51%——生成的停电报告达86.47%结构准确率。此外——我们开展人类研究评估真值标准报告的质量——领域专家给生成的标签平均4.03分(0-5分制)。