论文
JustLLMGRPO:面向胸片X光生成的放射学控制
JustLLMGRPO: Radiographic Control for Chest X-Ray Generation
摘要
文本条件的胸片X光生成旨在合成忠实呈现指定病灶的真实放射影像。现有工作主要通过更新图像生成器来提升质量,隐含地将提示词(prompt)视为在CXR领域适配之后即固定不变。我们表明,这种以生成器为中心的视角让一个相当可观的优化维度未被充分探索。在冻结CXR适配的Sana生成器的情况下,未修改的LLM单次改写提示词即可将RadDINO-FID从54.225降至27.572。提示词分析显示,LLM抑制了时间比较、不确定性以及其他不可渲染的报告内容,同时强调可见的放射学发现。然而,无约束的改写使BioViL-T与源提示词的对齐度从0.695降至0.609。因此,我们提出JustLLMGRPO,仅将标准的群体相对策略优化(GRPO)应用于LLM提示词策略,同时保持Sana冻结。群体相对的放射学感知图像反馈在保留视觉聚焦的同时维持了与源提示词的对齐。在CheXGenBench上,JustLLMGRPO将RadDINO-FID降至26.780,较直接提示词提升50.6%,同时保持对齐(0.696对0.695)。它还取得了最先进的分布覆盖与下游分类效用。这些结果表明,相当大的性能潜力可以潜藏于向已适配生成器表达放射学信息的方式之中。代码公开于 https://github.com/pxcai/JustLLMGRPO。
