论文
匹配前思考:一般人重新识别的强化推理范式
Thinking Before Matching: A Reinforcement Reasoning Paradigm Towards General Person Re-Identification
摘要
学习具有多场景通用性的身份歧视表示已成为行人重新识别(ReID)的一个关键目标。然而,主流的感知驱动范式倾向于从大量注释数据中识别拟合,而不是识别因果线索理解,这对多重干扰提出了脆弱的表示。在这项工作中,ReID-R 被提出作为一种新颖的推理驱动范例,通过将思想链纳入 ReID 管道来实现明确的身份理解和推理。具体来说,ReID-R 包括两个阶段的贡献:(i)判别推理预热,以 CoT 无标签方式训练模型以获得身份感知特征理解; (ii) 高效强化学习,提出了一种非平凡的采样来构建场景通用数据。在此基础上,ReID-R利用高质量的奖励信号来引导模型关注ID相关线索,实现准确推理和正确响应。对多个 ReID 基准的大量实验表明,ReID-R 仅使用 14.3K 重要数据(现有数据规模的 20.9%)即可实现竞争性身份识别,作为一种优越的方法。此外,受益于固有推理,ReID-R 可以为结果提供高质量的解释。