推文
@AYi_AInotes · 2026-10-10 00:24
不用买几百块的视频剪辑 SaaS, 也不用人肉在剪映里一秒一秒对时间线,风渡老师(@fengdu2077)今天正式把一整套端到端的短视频自动化流水线给全盘跑通了,核心只用了 Codex 加本地开源 TTS。 看他推文里放出来的这支全自动成片,声音质感挺干净自然的,一点AI味都没有, 从选题写文案、自动设计分镜、调用模型批量生图, 到本地用克隆好的声音自动生成配音、毫秒级识别字幕, 最后由 Codex 自动调度本地环境把图片、声音和字幕压制合成完整的高清视频, 整个过程一键串联到底,人完全不需要插手。 最值钱的是他帮大家肉身实测了 4 款主流开源声音克隆模型的真实梯队: IndexTTS 2.0 和 voxcpm2 并列第一梯队,声音自然度与克隆像真度最高; 阿里开源的 qwen3-tts 1.7B 紧随其后排在第二梯队; 而看似版本号更高的 IndexTTS 2.5 在实操中反而表现稍逊。 这套极简工作流之所以值得抄作业,是因为它彻底把短视频的生产门槛打到了地板上: 过去做一条图文解说视频,文案、配音、找图、剪辑四个环节要在四个软件之间来回倒腾,耗掉大半天; 现在把 Codex 当成全能调度总指挥, 让本地开源小模型解决免费配音,让代码脚本解决压制合成, 单条视频的制作边际成本直接压缩到了接近于零。 流水线一旦焊死,剩下的工作就不再是拼体力做视频, 而是把你的精力全部释放出来,每天专注去挑最抓人的选题。 这套极简架构与 4 款 TTS 模型的避坑细节全整理在一楼了,做自媒体和出海视频的兄弟建议立即收藏。
曝光 1792 · 评论 3 · 点赞 10 · 书签 17 · 曝光/时 97.49442636178608