推文
@shao__meng · 2026-09-19 07:59
Bespoke Labs 复刻 TypeSafe Jev 发布 Bespoke Nimble 作为 Open Jev,Bespoke Nimble 的数据、模型权重、训练配方全部公开,整个项目只花了两天时间“公开构建”。 @bespokelabsai 通过一个高质量的数据配方 + 极简推理工程,在“快速结构化决策”这个垂直任务上,用 9B 小模型逼近了 Jev 表现。 开源地址 https://github.com/bespokelabsai/nimble 模型 https://huggingface.co/bespokelabs/Bespoke-Nimble-9B 核心创新:最小差异样本对训练 · 做法:构造近乎相同的样本对,只微调一个“焦点事实”(改动不超过 8 个词),使正确标签翻转。这迫使模型学会“哪些证据真正应该改变决策”,从而判别能力更强。 · 隐式校准:正因为模型学会了区分微小差异,概率输出天然更可靠,作者称"calibration is implicit"。 · 不需要概率标签:传统方法训练概率输出往往需要带概率的标注数据,这里用对比结构绕开了这一要求。 · 质量保障管线:四步流程,检查决策规则、构造样本对、验证两个样本(包括逐句删除证据句确认没有“泄漏”)、程序化打标签。全部数据为合成,共约 2,676 条训练样本,覆盖 10 个类别。 训练与推理工程 · 训练:在 Qwen3.5-9B 上做 LoRA(rank 16)微调,仅一个 epoch。没有从 Jev 蒸馏,Jev 只用来做评测参照,这在版权和学术上都干净。也还没上 RL。 · 推理:采用 NielsRogge 和 harshagundal 建议的并行约束解码,每个选项映射到单个 token,直接读取这些 token 的 logits 做 softmax,根本不“生成”文本。Mac 上用 MLX 把共享上下文预填充一次、所有字段并行打分。 结果(324 条保留评测集,与参考标签一致率) · Qwen3.5-9B(原始):准确率 66.4% · Qwen3.5-27B(原始):准确率 84.9% · Nimble-9B(微调后):准确率 90.1% · Jev(闭源参照):准确率 93.2%
曝光 3284 · 评论 1 · 点赞 20 · 书签 26