论文

使用机器心理意象来表示情景对话中的共同点

Using Machine Mental Imagery for Representing Common Ground in Situated Dialogue

摘要

情景对话要求说话者保持对共享上下文的可靠表示,而不是仅对孤立的话语进行推理。当前的对话代理经常难以满足这一要求,特别是当必须在直接上下文窗口之外保留共同点时。在这种情况下,细粒度的区别经常被压缩为纯粹的文本表示,导致一种我们称为\emph{表示模糊}的关键故障模式,其中相似但不同的实体被混同为可互换的描述。这种语义扁平化造成了一种已建立共同语境的错觉,即代理看起来局部一致,但无法随着时间的推移持续跟踪共享上下文。受心理意象在人类推理中的作用的启发,并基于多模态模型可用性的增加,我们探索是否可以赋予会话代理类似的能力,在对话期间构建一些描述性中间表示,以解决这些限制。因此,我们引入了一个主动视觉脚手架框架,该框架逐步将对话状态转换为持久的视觉历史记录,稍后可以检索该历史记录以生成基础响应。对 IndiRef 基准的评估表明,增量外化本身比全对话推理有所改进,而视觉脚手架通过减少表征模糊和执行具体场景承诺提供了额外的收益。同时,文本表示对于不可描述的信息仍然具有优势,并且混合多模态设置可以产生最佳的整体性能。总之,这些发现表明,对话代理受益于整合了描述性信息和命题性信息的共同点的明确多模态表示。