论文

AI 流畅度的悖论

A paradox of AI fluency

模型评测模型行为与机制分析

摘要

用户的人工智能技能对人工智能实际为他们提供的服务有多大影响?这个问题对于用户、人工智能产品构建者和整个社会来说至关重要,但仍然没有得到充分探索。使用来自 WildChat-4.8M 的 27K 转录本的丰富注释样本,我们表明流利的用户比新手承担更复杂的任务,并采用根本不同的交互模式:他们与 AI 协作迭代,完善目标并批判性地评估输出,而新手则采取被动立场。这些差异导致了人工智能流畅度的悖论:流畅的用户比新手经历更多的失败——但他们的失败往往是可见的(他们参与的直接后果),他们更有可能导致部分恢复,并且他们在复杂任务上取得更大的成功。相比之下,新手更经常经历看不见的失败:对话看似成功结束,但实际上却没有达到目标。总而言之,这些结果重新定义了人工智能的成功取决于什么。个人应该采取积极参与的立场,而不是被动接受的立场。人工智能产品构建者应该认识到,他们设计的不仅仅是模型行为,还有用户行为;鼓励深度参与,而不是无摩擦的体验,将带来更大的整体成功。我们的代码和数据可在 https://github.com/bigspinai/bigspin-fluency-outcomes 获取