论文
廉价的探针何时预示着昂贵的训练?探测 3D-CT 编码器以生成文本
When Do Cheap Probes Predict Expensive Training? Probing 3D-CT Encoders for Text Generation
摘要
构建 3D CT 视觉语言模型首先要选择要构建的图像编码器。如今,每个候选者都通过 微调 通过完整的语言模型并比较下游分数来做出选择,这是一项极其昂贵的搜索。对编码器表示的廉价探测有望找到一条出路,但它是否预测昂贵的结果从未得到测试。我们使用 CheapCT 在报告生成和 MeasureVQA(我们构建的新 VQA 数据集)上对此进行测试。 MeasureVQA 一次对一项功能的结果进行评分,其答案是根据分割掩模和亨斯菲尔德单位测量的。报告生成立即对整个报告进行评分,并主要反映疾病。 CheapCT 预测每种能力的训练都将花费昂贵的费用。改变探针读数和语言模型主干后,预测仍然存在。 CheapCT 和 微调 之间的排名一致性始终保持较高水平,从 rho = 0.90 到 0.97。用于选择编码器时,CheapCT 选择几乎与最佳编码器一样好的编码器,而 微调 则选择单个候选编码器,计算量要少几个数量级。我们在 https://github.com/renjie-liang/CheapCT 发布了代码和 MeasureVQA。