论文

LIBRA:面向个性化治疗规划的语言模型引导赌博机追索算法

LIBRA: Language Model Informed Bandit Recourse Algorithm for Personalized Treatment Planning

智能体系统Agent 规划

摘要

我们提出一个统一框架,无缝整合算法追索、上下文赌博机与大语言模型(LLM),以支持个性化医疗等高风险场景中的序贯决策。我们首先提出追索赌博机问题,其中决策者必须同时选择一个治疗动作以及对可变患者特征的可行、最小修改。为解决该问题,我们开发了广义线性追索赌博机(GLRB)算法。在此基础上,我们提出 LIBRA,一种将 LLM 领域知识与赌博机学习的统计严谨性策略性结合的语言模型引导赌博机追索算法。LIBRA 提供三项关键保证:(i) 热启动保证,表明当 LLM 建议接近最优时,LIBRA 显著减少初始遗憾;(ii) LLM 付出保证,证明算法仅以 O(log^2 T) 的次数咨询 LLM,其中 T 为时间跨度,确保长期自主性;(iii) 稳健性保证,表明即便 LLM 不可靠,LIBRA 也绝不逊于纯赌博机算法。我们进一步建立了刻画追索赌博机问题根本难度的匹配下界,并证明我们算法的近优性。在合成环境与真实高血压管理案例研究上的实验证实,与标准上下文赌博机及纯 LLM 基准相比,GLRB 与 LIBRA 改善了遗憾、治疗质量与样本效率。我们的结果凸显了追索感知、LLM 辅助的赌博机算法在个性化高风险决策中实现可信赖 LLM-赌博机协作的前景。

LIBRA:面向个性化治疗规划的语言模型引导赌博机追索算法
图1:Recourse Bandit(GLRB)与 LIBRA 框架的示意图。GLRB 为患者提供算法化补救方案(recourses),以改善其健康状况、实现更有效的治疗(GLRB 算法细节见 § 2)。LIBRA 基于不确定性估计有选择地咨询 LLM,实现 LLM 知识与 AI 建议的数据驱动融合(LIBRA 算法及其理论性质的细节见 § 3)。