论文

DiMOS:Doob 引导的多目标推理时科学设计搜索

DiMOS: Doob-Guided Inference-Time Multi-Objective Search for Scientific Design

模型推理推理搜索与路径规划

摘要

科学设计往往需要共同满足多个目标和约束。预训练的掩蔽扩散模型为此任务提供了生成基础,但微调满足这些目标和约束会产生额外的训练成本,从而激励推理时使用冻结模型进行指导。然而,此类指导面临两个挑战:通过或失败约束和黑盒奖励模型可能无法提供有用的 梯度,而共同满足多个要求可能会留下一个小的可行区域,使得在有限的推理预算内难以找到可行的设计。为了应对这些挑战,我们引入了 DiMOS,这是一个用于多目标科学设计的无需训练框架。使用来自候选完成的联合奖励,DiMOS 执行近似 Doob 引导的局部重采样,而不需要奖励 梯度。为了有效地分配计算,它使用预算有效的轨迹搜索将计算集中在有希望的延续上。在六项 DNA、蛋白质和 RNA 任务中,DiMOS 在可比较的生成时间内获得了最高的联合成功率,达到了 DNA 和蛋白质最强基线 $1.98\times$,同时保持了较高的序列独特性和自然性。

DiMOS:Doob 引导的多目标推理时科学设计搜索的原论文方法或结果图
图 2:DiMOS 概述。上图:具有冻结先验的多目标设计。中:$K$ 从步骤 $s$ 分支,具有奖励引导的细化。底部:使用先验权重和奖励权重对 $M$ token 候选进行枚举、完成和随机重新采样。