论文
用人类策略解释和调整基于 Transformer 的算术任务中的 LLM
Explaining and Tuning Transformer-based LLMs in Arithmetic Tasks with Human Strategies
摘要
基于 Transformer 的 大语言模型 (LLM) 继续在各种自然语言处理任务中实现最先进的性能。然而,它们在基本算术等看似基本的问题上表现不佳,引发了人们对模型可靠性、安全性和道德部署的担忧。在这项研究中,我们证明了使用对人类学习者有效的方法可以提高在整数算术任务上训练的普通 Transformer 模型的性能。我们首先将算术任务分解为明确定义的子任务,并对每个子任务进行损失收敛阶分析和消融研究。我们的研究结果表明,LLM 表现出与人类学习者相似的学习模式,与更复杂的子任务相比,更简单的子任务的学习速度更快。此外,我们通过应用问题解决策略和认知赋权方法,成功提高了 LLM 的准确性,这些方法被证明可以提高人类学习者的表现。这表明基于 Transformer 的 LLM 可能与人类学习者共享算术认知过程。最后,我们全面展示了我们方法的有效性,包括显着的准确性改进实验、可视化验证和基于解释的分析,以阐明 LLM 在算术学习中的复杂性。总的来说,这项工作探讨了基于 Transformer 的 LLM 和人类学习者之间的潜在相似性,并由可解释的人工智能(XAI)验证支持,最终培养对关键和高风险应用程序的 LLM 的信任。