让Ling-3.1-flash部署低显存大模型
AI科技 · 1 篇公开推文 · 1 位作者 · 曝光 885 · 评论 6 · 点赞 11 · 书签 0
用户分享让Ling-3.1-flash处理文档、硬件和权重选择,尝试在12GB显卡运行125B Qwen。
创作角度
- 低显存运行大模型的配置过程
- AI代理能否完成从读文档到下载权重的部署
相关公开推文
@foxbaby666
12GB 显卡跑 125B 的 Qwen?一行命令都没敲,全程交给 Ling-3.1-flash。 Ling-3.1-flash读文档、查硬件、选权重、下载、安装、排错、测速、验收,一整套超长流程跑到底,中间上下文压缩了好几轮,它没断过一次。 560B 总参数、A25B、1M 上下文,Coding 和长流程 Agent 是Ling-3.1-flash的重点强化方向。 最顺手的是兼容 Anthropic API,改几个环境变量,就能把 Claude Code 背后的模型换成它。Ling-3.1-flash两周免费试用,每天送 50 万 token。 以后本地模型只会越来越多,我不打算一个个去学怎么装——让 Agent 自己来。
曝光 885 · 评论 6 · 点赞 11 · 书签 0
查看原帖