论文

你的AI,旋钮可控:用单个神经元控制LLM的投资偏差

Your AI, On a Dial: Controlling Investment Bias in LLMs with a Single Neuron

模型推理解码与生成控制

摘要

大语言模型(LLM)越来越多地被用于投资决策,但已有研究表明它们表现出系统性的、因模型而异的投资偏好。我们研究能否把一个模型的总体投资立场校准到指定的方向和强度。我们引入投资偏差旋钮(investment-bias dial),一种在单个神经元上的推理时干预,可连续调节模型级决策先验——即模型整体上偏买入还是偏卖出——而不针对特定公司或投资属性。利用匹配的正负证据,我们评估了五个开放权重LLM,发现该旋钮在不修改提示或模型参数的情况下产生投资立场的单调变化。在响应层面,该旋钮在相同输入下同时改变投资决策和所生成论证的证据侧重。在智能体检索场景中,该旋钮还会改变模型搜索什么信息、选择什么证据,以及哪些证据反映在最终分析中。在长上下文评估中,随着上下文长度增加,该旋钮保持稳定的立场控制,而匹配的系统提示指令则逐渐衰减。我们进一步在一项探索性回测中表明,旋钮的变化会传导到证券排名和下游组合构成上。总体而言,我们的结果表明,LLM的总体投资立场可以在推理时被校准到指定目标。

你的AI,旋钮可控:用单个神经元控制LLM的投资偏差:论文配图
图1:所提出的投资偏差旋钮概览。我们在 MLP 块中对候选激活坐标进行干预,并改变干预系数 Δ,以测量模型的投资决策如何变化。候选坐标首先按决策相关性筛选,可行候选按留出校准误差排序。随后将选定的坐标校准到目标看空、中性或看多的投资偏好。