论文
LoCar:通过细粒度的社会语言控制对车载助手进行本地化感知评估
LoCar: Localization-Aware Evaluation of In-Vehicle Assistants through Fine-Grained Sociolinguistic Control
摘要
虽然 大语言模型 (LLM) 越来越多地集成到车载对话系统中,但由于缺乏针对实际部署要求量身定制的特定领域评估标准,确定最佳模型仍然具有挑战性。在本文中,我们提出了一种新颖的车载助手评估框架,特别关注韩语本地化。我们的实证分析揭示了模型行为的显着模式。首先,细粒度的韩语敬语控制在当前的 LLM 中仍然不稳定,这表明必须在本地化设置中明确评估精确的语音级别实现。其次,模型在澄清和主动性等战略对话指标方面表现较差。我们的分析表明,这源于这些任务固有的主观复杂性,我们的框架采用保守的评估立场来优先考虑可靠性。总之,我们的研究结果强调,汽车人工智能必须超越一般能力,转向精确的语言定制和可靠、以安全为导向的交互管理。