论文
在块内思考:用LLM生成法规合规场景的RegulaRAG:UN Regulation No. 152案例研究
Think Inside the Chunk: RegulaRAG for Regulation-Compliant Scenario Generation using LLMs: A Case Study of UN Regulation No. 152
摘要
生成符合法规的测试场景对验证安全关键的汽车系统至关重要,但大语言模型(LLM)难以把输出落地于冗长、分层的标准文本。我们提出RegulaRAG,一个检索增强生成(RAG)流水线,它把SmartChunking——通过图遍历对段落和表格做参考感知的富化——与在这些富化单元上的Smart Retrieve & Rerank相结合。为测试该系统,我们在一个人工整理、覆盖UN Regulation No. 152(AEBS)全部场景的数据集上评估。研究包括:(i)三步渐进搜索,无需穷举网格搜索即可找到接近最优的检索参数;(ii)与五个基线RAG系统的正面比较;以及(iii)用干扰内容扩展源语料的鲁棒性压力测试。输出采用定制的带惩罚评分指标评估。在所有实验中,RegulaRAG取得最高的平均Meta-Score(82.99),领先次优系统43%(NoRAG:57.94),同时每查询消耗14k-25k token,而以图为中心的基线最高可达500k。即便法规来源数量增长,它仍保持强健稳定的性能,而竞争RAG系统的质量与鲁棒性急剧退化。
