论文

LLM2Jev:LLM 已经是 Jev 风格的决策模型——何时以及如何对其进行微调

LLM2Jev: LLMs Are Already Jev-Style Decision Models -- When and How to Fine-Tune Them

模型推理模型训练监督微调与指令调优判别式推理与决策

摘要

Jev 风格的决策模型返回预定义选项的分类概率分布,而不生成自由格式的文本,使软件系统能够直接对其输出采取行动。在这项工作中,我们调查了通用大语言模型在多大程度上已经具备这种开箱即用的能力,以及何时实际上需要进行微调。我们提出了 LLM2Jev,一个保留架构的框架,它直接从括号内的数字标识符上的下一个标记概率中提取校准决策。 LLM2Jev 提供免训练推理方法和微调目标,通过树分解列表损失优化候选选择,同时使用 KL 散度惩罚将辅助预测锚定到基本模型。对 Qwen3.5-4B 和 Qwen3-0.6B 进行评估,我们发现现代 LLM 本质上是有效的决策模型:未经训练,4B 模型与基于同一主干的社区 Jev 风格模型相匹配,优于字母 logit 读数,支持任意选项计数,并本机处理图像上的多模态决策。微调提供了有针对性的而不是普遍的好处——显着改善较弱的模型和特定任务(例如多选项意图路由),但为强大的骨干网带来的回报递减。至关重要的是,我们的 KL 锚点可以防止会话文本生成中的行为退化,LoRA 在有能力的模型上提供最强的性能。