AI 视频生成器
e3d-pod2vid
AI驱动的开源管道,将识别后的音频(播客、访谈)转换为YouTube就绪的MP4,包含语义化B-roll、烧录字幕和可选的语音合成。
e3d-pod2vid
什么是 e3d-pod2vid?
e3d-pod2vid是一个开源AI管道,将经过说话人分离的音频文件(如NotebookLM、播客、访谈)转换为YouTube就绪的视频,每个语句配有语义匹配的Pexels B-roll、烧录字幕和可选的OpenAI TTS语音替换。它还支持根据实时信号自动生成YouTube Shorts,并一键发布到多个社交平台。
e3d-pod2vid 与相似工具比较
| 计价模式 | 免费 | 免费, 免费试用, 定制定价 | 定制定价 | 免费, Freemium |
| 免费额度 | ||||
| 主要功能 |
|
|
|
|
| 优点 |
|
|
|
|
| 缺点 |
|
|
|
|
| 适合对象 |
|
|
|
|
如何使用 e3d-pod2vid?
- 1克隆仓库并安装Python/Node依赖。
- 2将.env.example复制为.env并填写你的API密钥(AssemblyAI、OpenAI、Pexels等)。
- 3运行`python3 pod2vid.py input.m4a output.mp4`将音频转换为视频。
- 4可选:运行`python3 tts_replace.py`使用自定义OpenAI TTS替换语音。
- 5运行`node yt_upload.js output.mp4 "标题"`上传到YouTube。
- 6使用`python3 make_short.py`生成YouTube Short。
- 7使用`node announce.js`发布到社交平台(Discord、Telegram、X、LinkedIn)。
e3d-pod2vid 主要功能
- 使用GPT-4o-mini查询每句话语义匹配Pexels B-roll
- 烧录字幕(无需ffmpeg libass,纯Pillow实现)
- 可选的OpenAI TTS语音替换(每个说话人可自定义语音)
- YouTube上传并更新描述和缩略图
- 一键多平台社交发布(Discord、Telegram、X、LinkedIn)
- 根据实时E3D Maps信号自动生成YouTube Shorts
- API结果缓存,支持快速重新运行
- 可自定义字幕标签、语音选择和视频参数
e3d-pod2vid 使用场景
- 将播客剧集转换为带有吸引人B-roll的YouTube视频
- 创建访谈精彩片段并自动生成字幕
- 根据趋势信号自动生成每日YouTube Shorts
- 用自然的TTS替换AI语音(例如NotebookLM)
- 同时在多个社交渠道发布视频内容
e3d-pod2vid 价格与免费额度
e3d-pod2vid 目前采用 免费 模式。
此工具完全免费使用
e3d-pod2vid 优缺点
优点
- 开源且可定制
- 从音频到社交发布的端到端管道
- 支持多个社交平台
- 语义化B-roll选择提升观众参与度
- 缓存减少重复运行的API成本
缺点
- 需要多个付费API订阅
- 仅命令行界面(无图形界面)
- 设置需要编程知识(Python、Node.js、环境变量)
- B-roll质量取决于Pexels可用性和GPT查询质量
e3d-pod2vid 最适合哪些用途?
- 希望扩展到YouTube的播客制作者
- 自动化视频制作的内容创作者
- 构建AI驱动媒体管道的开发者
- 重新利用音频内容的社交媒体管理者