论文

名字里有什么?药理学中 LLM 的形态学捷径

What's in a Name? Morphological Shortcuts by LLMs in Pharmacology

模型评测模型行为与机制分析

摘要

单词的形态形式通常可以暗示其含义,但纯粹依赖这些映射可能会导致高风险领域的过度概括。例如,在医学领域,LLM 可以自信地仅根据虚构药物的词缀(例如 wugcillin)推理出虚构药物,并生成看似合理的临床内容。我们提出了 LLM 药理学“词缀启发法”的行为和机制研究。使用根据真实词缀构建的虚构药物名称,我们表明词缀信号本身就能引起类别水平的药理学反应。我们引入了一个框架,用于识别模型的药物语义是否主要由词缀、词干或整个药物名称驱动。我们的框架应用于 653 种药物,表明模型通常主要通过词缀线索来诱导药物含义,但很少明确表明这种依赖性,有时还会错误地将词缀共享药物的属性混为一谈。跨模型的激活补丁进一步将这种行为本地化到早中期层。这些发现表明,形态捷径对安全构成了微妙但可衡量的风险。