推文
@kafkaup · 2026-10-08 16:58
Hugging Face 上带 heretic 标签的模型已经超过 5000 个,全部由同一个命令行工具产出。这个数字本身就说明了它的门槛有多低。 Heretic 做的事是 abliteration:不做后训练,直接在权重层面做定向消融,把模型里负责"拒绝"的那个方向抹掉。新东西在于它把调参这一步自动化了。 ▸ 用 Optuna 的 TPE 优化器搜索消融参数,不需要你理解 transformer 内部结构 ▸ 同时最小化两个目标:有害提示的拒答次数,和无害提示上相对原模型的 KL 散度 ▸ 换句话说,它在"解除拒答"和"别把模型弄傻"之间自动找平衡点 ▸ 内置评估功能,heretic --model 原模型 --evaluate-model 目标模型 就能复现指标 ▸ 支持大部分稠密模型、不少多模态模型、几种 MoE 架构,以及 Qwen3.5 这类混合架构 README 给的对照数据值得看:gemma-3-12b-it 原版 100 条有害提示拒了 97 条,两个人工 abliterated 版本都降到 3 条,但 KL 分别是 1.04 和 0.45;Heretic 自动跑出来同样是 3 条,KL 只有 0.16。差距主要体现在对原模型能力的破坏程度上。 用法是 pip install -U heretic-llm,然后 heretic 加模型名。需要 Python 3.10+ 和 PyTorch 2.2 以上,gpt-oss 这种 MXFP4 量化模型要 2.6 以上,因为用到 torch.accelerator。 限制也写得清楚:纯状态空间模型和一些研究性架构不支持。另外搜参是真的要跑推理的,显卡和耐心都得准备好,README 里那组数字是在 RTX 5090 上跑的。 适合想在本地跑无拒答模型、或者研究对齐方向在权重里如何表示的人。不适合指望点一下就出结果的场景。 今日 +257 star · Python · 总计 33,143 #LLM #abliteration https://github.com/p-e-w/heretic
曝光 222 · 评论 1 · 点赞 1 · 书签 0 · 曝光/时 10.279109209140884