论文

4B端侧深度研究:曝光决定忠实、检索决定覆盖

On-Device Deep Research at 4B: Exposure Bounds Faithfulness, Retrieval Bounds Coverage

模型评测鲁棒性、公平性与可信度评测

摘要

端侧研究智能体在个人笔记本上搜索语料、阅读来源并撰写带引用的简报。对一个可部署的小模型,其引用是否忠实、代价如何,尚无测量。本研究把一个4B生成器固定在24GB笔记本上,追问什么使其引用忠实。它把通常报成一个数的两个量分开:被引论断忠实性——被引来源是否支撑该论断;可信覆盖——智能体是否也引用了正确的来源。研究交叉两个因素:生成器对每个来源看到多少(400对1500字符)与所供来源的质量(金标论文对检索论文)。两个杠杆浮现且作用于不同结果。曝光设定忠实性:每来源更多内容把检索来源上的忠实性从0.45提到0.58、金标来源上从0.37提到0.58,且两设定收敛——忠实性受曝光约束,而非来源是否正确。曝光提升对第二名独立裁判稳健;精确的收敛在主裁判下紧凑、在第二裁判下仅近似。检索设定覆盖:无论曝光如何,检索来源上的可信覆盖保持在约0.22——因为召回被钉在约0.40,曝光无法修正引用了哪些来源。额外曝光的代价约为235个输出token。实用配方:先把每来源曝光廉价地提上去,再把检索召回当作唯一剩余杠杆。