论文
可缓存决策模型可以遵循规则吗?
Can a Cacheable Decision Model Follow Rules?
摘要
Certo 是一个小型非生成决策模型 (Qwen3-4B):它从文本中对候选动作进行评分并返回概率,而不是生成答案。准确的设计会一起读取状态、规则和每个候选人(联合评分员),因此成本随着菜单的增加而增加。独立编码让每个候选者被编码一次并在各个状态中重复使用(77 个候选者的成本大约是 5 倍),但将状态与候选者分开。我们要问的是,这一举动对规则的敏感性有多少,以及它是否可以被训练回来。 Certo 上的四个实验:(1)测试到可缓存评分的转换失去规则敏感性(recall@1 1.00 -> 0.24),而联合评分器保持 1.00,并且入围名单+重新排名救援失败; (2)有针对性的反事实监督恢复了保留的综合规则任务(释义、反事实、组合;可在种子之间重现)的强劲表现,尽管我们没有隔离预测是否取决于所提供的规则; (3) 在真实规则上,附加收益并未建立——修复截断混杂后,联合记分者在短层(0.861 vs 0.500)和定向硬层(0.655 vs 0.483,n=29)上显着获胜; (4) 匹配的跨域真实散文混合没有帮助并降低了合同准确性(-9.3,-16.2 分)。可缓存编码器可以对其训练分布进行规则敏感,但无法转移到未见源的真实规则;联合记分器以缓存为代价保持优势。