论文
TraMP-LLaMA:用于面部表情质量评估的解耦指令调整的生成可解释性
TraMP-LLaMA: Generative Interpretability with Decoupled Instruction Tuning for Facial Expression Quality Assessment
摘要
现有的面部表情质量评估 (FEQA) 方法通常仅产生严重性评分,而没有明确传达支持预测的可观察面部运动证据。这限制了可解释性,并使检查帕金森病评估中模型输出的基础变得困难。为了解决这一差距,我们提出了 TraMP-LLaMA,这是一个统一的多模式框架,可以联合预测严重程度评分并根据面部运动线索生成结构化文本报告。该框架集成了RGB外观和地标轨迹线索,并采用解耦的指令调整策略来减少严重性预测和语言生成之间的任务干扰。为了支持这项任务,我们用专家指导的文本运动描述进一步扩展了 PFED5 数据集,并构建了 PFED5-plus。 PFED5-plus 上的实验表明,TraMP-LLaMA 在报告生成方面优于竞争性视频语言基线,并在联合多表达训练下的比较方法中实现了最佳的严重性预测性能,与所有竞争方法相比,Spearman 的排名相关性提高了至少 4.39%。文本注释和代码可在 https://github.com/shuchaoduan/TraMP-LLaMA 获取。