TwKit

推文

@AYi_AInotes · 2026-10-10 00:24

不用买几百块的视频剪辑 SaaS, 也不用人肉在剪映里一秒一秒对时间线,风渡老师(@fengdu2077)今天正式把一整套端到端的短视频自动化流水线给全盘跑通了,核心只用了 Codex 加本地开源 TTS。 看他推文里放出来的这支全自动成片,声音质感挺干净自然的,一点AI味都没有,
从选题写文案、自动设计分镜、调用模型批量生图,
到本地用克隆好的声音自动生成配音、毫秒级识别字幕,
最后由 Codex 自动调度本地环境把图片、声音和字幕压制合成完整的高清视频,
整个过程一键串联到底,人完全不需要插手。 最值钱的是他帮大家肉身实测了 4 款主流开源声音克隆模型的真实梯队:
IndexTTS 2.0 和 voxcpm2 并列第一梯队,声音自然度与克隆像真度最高;
阿里开源的 qwen3-tts 1.7B 紧随其后排在第二梯队;
而看似版本号更高的 IndexTTS 2.5 在实操中反而表现稍逊。 这套极简工作流之所以值得抄作业,是因为它彻底把短视频的生产门槛打到了地板上:
过去做一条图文解说视频,文案、配音、找图、剪辑四个环节要在四个软件之间来回倒腾,耗掉大半天;
现在把 Codex 当成全能调度总指挥,
让本地开源小模型解决免费配音,让代码脚本解决压制合成,
单条视频的制作边际成本直接压缩到了接近于零。 流水线一旦焊死,剩下的工作就不再是拼体力做视频,
而是把你的精力全部释放出来,每天专注去挑最抓人的选题。 这套极简架构与 4 款 TTS 模型的避坑细节全整理在一楼了,做自媒体和出海视频的兄弟建议立即收藏。

曝光 1792 · 评论 3 · 点赞 10 · 书签 17 · 曝光/时 97.49442636178608

TwKit
正在加载数据