推文
@MinLiBuilds · 2026-10-09 22:27
本周,我花了80加个GPU小时,做了三轮,Qwen 3.8 Flash Next 125B的测试。 我测了7个量化权重, 并给出了相应的部署建议: 4090 48G:UD-IQ4_XS / UD-Q4_K_XL 5090 5080: GSQ-RCO IQ3_S 8G/12G/16G卡: ISTA IQ2_XS > ISTA Q2_0 > Swift 1.5 IQ2_XS > Swift 1.5 Q2_0 这是一个超有意思的模型,强大、巨大 比最火的Qwen 3.8 27B -Dense还强。 🔥 新的推理框架Strata,让gpu、cpu、内存、磁盘、主板总线每一个细胞都在工作,把不可能装到消费级显存的125B模型硬生生装进去了。 详细测试帖放到线程里了 👇
曝光 591 · 评论 2 · 点赞 0 · 书签 2 · 曝光/时 155.9159270937494