论文

偏好学习中谎言检测器监督的缩放趋势

Scaling Trends for Lie Detector Oversight in Preference Learning

模型评测安全与风险评测

摘要

LLM中的欺骗行为监控与防范成本高昂——这促成经谎言检测器的可扩展监督(SOLiD)等方法——用谎言检测器识别需交由高成本标注者审查的响应。本文中——我们将SOLiD扩展到更大模型——并在更多样、更现实的偏好学习设定中评估。我们发现有利扩展:在检测器99%真阳性率下——未检出欺骗从1B参数模型的34%降至405B参数模型的14%——且昂贵的人工标注者可完全从微调阶段移除——而无统计显著的欺骗增加。但SOLiD对检测器训练与偏好训练数据间的分布偏移敏感——这可能将检测器假阳性率推高到不可行的水平。