论文
评估 LLM 在实际消费设备维修问题上的有效性
Evaluating LLMs' Effectiveness on Real-World Consumer Device Repair Questions
摘要
消费类设备维修是 大语言模型 (LLM) 的一个重要但尚未充分开发的测试平台。修复任务需要对不完整的问题描述、特定于硬件的诊断、可操作的故障排除和安全关键决策进行推理,其中不正确的建议可能会导致设备损坏、电池危险或永久数据丢失。我们引入了来自 Reddit 的 991 个实际维修问题的基准,涵盖电话维修、计算机维修和数据恢复,每个问题都配有技术人员编写的参考解决方案,并提供孟加拉语翻译来评估跨语言性能。我们使用四个特定修复标准来评估六个最先进的英语和孟加拉语 LLM:正确性、完整性、实用性和安全性。我们的结果表明,虽然 LLM 可以提供有用的维修帮助,但如果没有严格的评估和明确的安全保障措施,它们对于高风险的现实维修任务仍然不可靠。手机维修是最困难和安全敏感的领域,所有型号在板级诊断、维修优先级和安全恢复过程中都会犯重大错误。在各个领域和模型中,孟加拉语响应的表现始终比英语响应差。在评估的模型中,GPT-5.4 总体表现最好。