论文

HYVE:面向机器数据LLM上下文工程的混合视图

HYVE: Hybrid Views for LLM Context Engineering over Machine Data

上下文与知识上下文工程

摘要

机器数据是现代计算系统可观测性与诊断的核心,出现在日志、指标、遥测轨迹和配置快照中。当提供给大语言模型(LLM)时,这些数据通常以自然语言与结构化载荷(如JSON或Python/AST字面量)混合的形式到达。然而LLM在这类输入上依然脆弱,尤其是当输入很长、嵌套很深且以重复结构为主时。我们提出HYVE(HYbrid ViEw),一个受数据库管理原则启发的框架,用于对包含大型机器数据载荷的输入进行LLM上下文工程。HYVE以协同的预处理和后处理环绕模型调用,核心是一个以模式信息增强的请求级数据存储。在预处理阶段,HYVE检测原始输入中的重复结构,将其物化到数据存储中,转换为列式与行式混合视图,并只选择性地向LLM暴露最相关的表示。在后处理阶段,HYVE要么直接返回模型输出,要么查询数据存储以恢复被省略的信息,要么执行一次有界的额外LLM调用进行SQL增强的语义合成。我们在涵盖知识问答、图表生成、异常检测和多步网络排障的多样真实工作负载上评估HYVE。在这些基准上,HYVE将token使用量降低50-90%,同时保持或提升输出质量。在结构化生成任务上,它将图表生成准确率最多提升132%,延迟最多降低83%。总体而言,对于由大型机器数据载荷主导的提示,HYVE提供了一种对有效无界上下文窗口的实用近似。

HYVE:面向机器数据LLM上下文工程的混合视图:论文配图
图 1:HYVE 架构。预处理器将嵌入结构化段的输入字符串解析为混合表格视图;请求范围的数据存储保留完整数据;后处理器检查 LLM 输出,并在需要时查询数据存储以丰富响应。