返回沙丘智库使用文档

研究方法论

本页汇集沙丘智库各研究内容所采用的方法论,帮助你了解研究结论的形成方式、适用范围和阅读重点。

场景分析方法

沙丘智库从业务价值和可行性两个维度分析大模型应用场景,并将场景划分为战略投资、机会探索、创新试验三类。

场景类型判断依据使用建议
战略投资兼具较高可行性和业务价值企业投入后获得回报的可能性较高,可优先纳入重点规划。
机会探索可行性和业务价值处于中等水平,或其中一个维度表现突出企业可结合自身情况识别机会,并通过进一步调研或小范围试用验证价值。
创新试验可行性和业务价值较低,或仅其中一个维度表现突出投资回报存在较大不确定性,应在明确风险承受范围后开展探索。

企业应结合自身的技术成熟度、资源投入能力、风险承受能力和数字化转型目标,判断适合优先推进的应用场景。

模型评估方法

沙丘智库以真实工作中常见的任务形式评估大模型的任务交付能力、可靠性和资源使用情况,帮助用户理解不同模型在相同条件下的相对表现,为模型初筛和试点设计提供参考。

评测使用 SQBench v1.0 的 220 道标准化任务。所有模型在相同任务版本、输入材料、工具环境、资源限制和评分规则下完成单次全量测试;测试任务经过脱敏、改写或合成处理,不包含真实客户数据或个人敏感信息。

评估范围

任务层级重点关注任务数综合权重
基础能力层(L1)指令理解、长上下文、代码逻辑和鲁棒性等基础能力10020%
复合技能层(L2)办公协作、深度研究、数据分析和软件工程等多步骤任务6060%
业务场景层(L3)金融、工业、医疗、政务等业务流程中的端到端任务6020%

主要观察维度

维度说明报告中的对应内容
任务交付能力模型是否能完成任务要求,并提交可用结果实战能力、任务完成分、最终表现分,以及分层能力分析
可靠性与风险模型在完成任务时是否出现事实错误、遗漏约束、越权、不可复核等可核验问题可靠度、风险触发率、幻觉率和 10D 风险矩阵
资源使用模型完成本次完整测试所消耗的成本、时间和 Token成本与运行情况、性价比分析

其中,实战能力反映模型在各层任务中达到完整交付要求的比例,并按 L1 20%、L2 60%、L3 20% 加权;任务完成分反映未扣除风险前的功能完成度;最终表现分则反映纳入风险后的可交付水平。两者之间的差距可以帮助判断模型是否存在“能完成、但仍需较多检查”的情况。

可靠度表示本次测试中未触发已确认风险的任务比例。风险识别覆盖事实与溯源、指令遵循、合规与安全、资源使用、工具操作、任务完成、可解释性和上下文管理等十类问题。资源指标不参与能力评分,用于辅助比较不同模型的使用成本和运行效率。

如何阅读评测报告

建议先阅读执行摘要,了解模型的总体表现、适用方向和主要限制;再结合分层能力分析、风险类型和典型案例,判断模型是否适合具体任务。性价比分析中的四张图分别比较实战能力与可靠度、评测成本、完成耗时和 Token 消耗:每张图只说明一个维度上的相对位置,不能合成为单一的“性价比”结论。

评测结果描述的是当前任务集、模型版本、推理配置和运行条件下的表现,不代表模型在所有业务场景中的绝对能力,也不替代企业在自身数据、流程、权限和合规要求下的验证。对于高风险或关键流程,建议在试点中增加人工复核、结果校验、权限控制和异常回退机制。