论文

Fiorillo:用许可可复用临床试验材料训练校准决策模型

Calibrated Answers About Randomized Trials From a 4-Billion-Parameter Open Model: A Registered Test and a License-Clean Release

应用与实践行业应用

摘要

Fiorillo v0.5 是一个开放模型,可以回答键入的问题以及每个答案的概率。其主要专家阅读了一篇随机试验的文章,削减为 6,144 token,并回答干预措施是否显着增加、显着减少或没有显着改变对照者的结果(证据推理 2.0,EI)。它是带有低秩适配器和决策头的 Qwen3-4B-Base,仅在 2,657 篇训练文章中的 1,431 篇(其自己的许可证允许重复使用)上针对 EI 进行了微调。在该版本的测试预测决定发布之前,在开放科学框架上注册了四个标准,第二个标准是根据 EI 的测试分割进行判断的,其标签是公开的。在该分组中(333 篇文章中的 1,218 条提示),预期校准误差为 0.0168,而限制为 0.05;对数损失低于先前的 0.8603(95% 区间 0.8104 至 0.9078),并且低于 Gemma 4 31B-it(读取相同输入)0.1829(0.1164 至 0.2598);宏观 F1 为 0.9248,对 0.8668,因此所有四个标准均通过。 训练相同的配方仅在清洁物品上花费 0.0123 的准确度(0.0034 至 0.0207;描述性)。由于没有文章,宏观F1跌至0.4384;仅标题就将其提高了 0.0939(0.0655 至 0.1234),说明试验结果或 召回率 的标题可以解释这一点;交换干预和比较器反转了其方向答案的 0.6652。发布后运行,文件与预先设置的限制内的评估预测相匹配。该版本遵循 Apache License 2.0(数字对象标识符 10.57967/hf/10722)。