论文
NL-PAC:LLM 介导监督中的规范模糊性和认证的最小最大风险底线
NL-PAC: Specification Ambiguity and Certified Minimax Risk Floors in LLM-Mediated Supervision
摘要
大语言模型 越来越多地为以自然语言指定的任务提供标签、评估和反馈。当规范允许多个读数但监督通道未透露哪个读数有效时,附加标签会减少采样误差,但不会解决由此产生的识别问题。我们引入自然语言 PAC (NL-PAC),这是一个使用固定模型的阈值解码法则来定义可接受的标签和候选目标的框架。多个标签被允许的概率等于逐点允许的目标类的直径,并且在目标盲监督下,每个学习者在每个样本大小下都会遭受至少该直径一半的最坏情况风险;此类的精确随机最小最大风险是通过数据独立策略获得的。有限样本置信界限使得这些数量可以通过保留的未标记输入进行验证。在冻结的 Qwen~2.5--3B 审核中,一个预先指定的提示会产生积极的模型相关证书,而释义和精确规则控制则产生零。桥牌审核发现,提供的候选阅读条款不符合将证书转换为连贯阅读所需的可接受条件。保证特定于审核的模型、提示、阈值和输入分布;将其扩展到人类解释需要外部验证。