论文

跨域泛化对训练LLM监控器有多大用处?

How Useful Is Cross-Domain Generalization for Training LLM Monitors?

模型训练监督微调与指令调优

摘要

使用带提示的语言模型作为分类器,能够在训练数据有限的领域开展分类,但会错失微调所能带来的部分鲁棒性与性能收益。我们研究在多个分类任务(每个任务各有自己的提示)上训练,能否提升模型在新领域、新分类提示下的表现。我们表明这种训练能部分泛化到相邻领域,提升训练中未见任务的分类性能。然而,我们识别出微调模型无法遵循提示的特定边缘情形,例如分类提示完全改变而数据领域与训练时相同的情况。我们表明分类训练可以与通用指令遵循训练混合进行,且(若混合得当)这种训练既保留分类训练的收益,又能缓解其泛化失败。出人意料的是,我们看到这种无思考(no-thinking)监督分类训练可以泛化到带思考(with-thinking)的分类与摘要,这表明无思考分类训练或许对构建其他类型的分类器与监控系统具有工具性价值。

跨域泛化对训练LLM监控器有多大用处?:论文配图
图 1:我们使用 SFT 在 1-token 分类响应上训练模型(左),然后在新的分类任务、思考分类和总结(右)上对其进行评估。尽管没有接受过训练,但经过微调的模型在所有三项任务上都得到了改进。提示和响应是说明性的;完整的提示可以在附录 A.2 中找到。