论文
StoicLLM:小语言模型中哲学一致性的偏好优化
StoicLLM: Preference Optimization for Philosophical Alignment in Small Language Models
摘要
虽然 大语言模型 擅长事实适应,但它们在严格的数据限制下内化微妙哲学框架的能力仍未得到充分探索。我们通过使用偏好优化(ORPO、AlphaPO)专门研究基础斯多葛文本的微观数据集 LLM 来对此进行研究。通过多模型评论家库进行评估,我们的结果表明,仅 300 个高保真示例就可以引发与内向的斯多葛美德的强烈一致性,在释放上下文窗口的同时非常接近少数镜头提示。然而,重要的是,所有模型,包括少数样本基线,都在斯多葛主义的外向世界责任方面表现出持续的失败,这表明小模型的代表性限制是仅靠微观数据集适应无法克服的。