论文
迈向IIT启发的LLM意识:一个基于奖励的学习框架
Toward IIT-Inspired Consciousness in LLMs: A Reward-Based Learning Framework
摘要
追求通用人工智能(AGI)是语言模型发展的核心目标,其中类意识处理可作为关键助推器。虽然当前语言模型并非有意识的,但它们表现出与意识某些方面类似的行为。本文研究通过基于奖励的学习范式,在语言模型中实现意识领先理论——整合信息论(IIT)。IIT为量化意识提供了基于公理的形式化数学框架。借鉴其核心原则,我们构造一个新颖的奖励函数,量化文本的因果性、连贯性与整合性——这些是与意识处理相关联的特征。实证上,我们发现优化该IIT启发奖励带来更简洁的文本生成。在域外任务上,细致调优可在保持与基模型相当的准确率的同时,最多减少31%的输出长度。除主要任务性能外,我们还分析了该训练方法对模型置信度校准与测试时计算扩展的更广泛影响。所提框架具有显著实用优势:概念简单、计算高效、无需外部数据或辅助模型,并利用通用的能力驱动信号而非任务特定启发式。代码见 https://github.com/MH-Sameti/LLM_PostTraining.git。