论文
DiMOS:Doob 引导的多目标推理时科学设计搜索
DiMOS: Doob-Guided Inference-Time Multi-Objective Search for Scientific Design
摘要
科学设计往往需要共同满足多个目标和约束。预训练的掩蔽扩散模型为此任务提供了生成基础,但微调满足这些目标和约束会产生额外的训练成本,从而激励推理时使用冻结模型进行指导。然而,此类指导面临两个挑战:通过或失败约束和黑盒奖励模型可能无法提供有用的 梯度,而共同满足多个要求可能会留下一个小的可行区域,使得在有限的推理预算内难以找到可行的设计。为了应对这些挑战,我们引入了 DiMOS,这是一个用于多目标科学设计的无需训练框架。使用来自候选完成的联合奖励,DiMOS 执行近似 Doob 引导的局部重采样,而不需要奖励 梯度。为了有效地分配计算,它使用预算有效的轨迹搜索将计算集中在有希望的延续上。在六项 DNA、蛋白质和 RNA 任务中,DiMOS 在可比较的生成时间内获得了最高的联合成功率,达到了 DNA 和蛋白质最强基线 $1.98\times$,同时保持了较高的序列独特性和自然性。
