论文
基于LLM的面部动作单元-文本语义融合的多模态人格识别
LLM-based Multimodal Personality Recognition via Facial Action Unit-Text Semantic Fusion
摘要
由于异步视频面试 (AVI) 在现代招聘中的广泛采用,个性识别变得越来越重要。现有方法通常依赖 大语言模型 (LLM) 来分析 AVI 中受访者的文本响应。然而,单模型方法经常遭受信息丢失(例如,忽略面部线索)。相比之下,采用全脸图像或稀疏采样帧的多模态方法可以丢弃对于准确的个性评估至关重要的细粒度时间动态。为了克服这些限制,我们提出了一个基于 LLM 的框架,该框架在语义上融合面部动作单元(AU)与 AVI 的文本响应。所有序列首先被转换为可解释的文本描述,然后通过 LLM 与参与者的文本响应融合。轻量级回归头将所得嵌入转换为连续的个性分数,而不会破坏底层语义空间。 AVI-6 基准测试的实验表明,与大多数基线相比,得到了一致的改进,预测误差更低,多个特征与人类评分的相关性更强。进一步的分析表明,AU 衍生的语义表示为文本响应提供了补充的非语言线索。将 LLM 内的语义理解与回归预测解耦还可以带来更高的训练稳定性和更清晰的可解释性。总的来说,这些发现表明 AU-文本融合为 AVI 中的个性识别提供了一个基于心理学且计算高效的框架。