论文
HYVE:面向机器数据LLM上下文工程的混合视图
HYVE: Hybrid Views for LLM Context Engineering over Machine Data
摘要
机器数据是现代计算系统可观测性与诊断的核心,出现在日志、指标、遥测轨迹和配置快照中。当提供给大语言模型(LLM)时,这些数据通常以自然语言与结构化载荷(如JSON或Python/AST字面量)混合的形式到达。然而LLM在这类输入上依然脆弱,尤其是当输入很长、嵌套很深且以重复结构为主时。我们提出HYVE(HYbrid ViEw),一个受数据库管理原则启发的框架,用于对包含大型机器数据载荷的输入进行LLM上下文工程。HYVE以协同的预处理和后处理环绕模型调用,核心是一个以模式信息增强的请求级数据存储。在预处理阶段,HYVE检测原始输入中的重复结构,将其物化到数据存储中,转换为列式与行式混合视图,并只选择性地向LLM暴露最相关的表示。在后处理阶段,HYVE要么直接返回模型输出,要么查询数据存储以恢复被省略的信息,要么执行一次有界的额外LLM调用进行SQL增强的语义合成。我们在涵盖知识问答、图表生成、异常检测和多步网络排障的多样真实工作负载上评估HYVE。在这些基准上,HYVE将token使用量降低50-90%,同时保持或提升输出质量。在结构化生成任务上,它将图表生成准确率最多提升132%,延迟最多降低83%。总体而言,对于由大型机器数据载荷主导的提示,HYVE提供了一种对有效无界上下文窗口的实用近似。
