分享一下自用的播客翻译工具

4 月 15 日
 R0sin

TL;DR

去年通勤时想听一些国外的播客,vibe search 了一圈好像没啥特别钟意的播客翻译工具,后来本地跑了个简陋的 ASR + 翻译 + TTS 的流水线应付了下。

年初 qwen3-tts 发布后便有心让 AI 搓一个方便复用的工具,最近抽空薅 OpenAI Codex 羊毛做了个 CLI 自己用着感觉还可以。为了快速跑通和效果稳定,TTS 直接用的阿里云服务,后续有空或者需求的话再支持本地模型部署或者其他渠道。

快速开始

首先需要准备一个阿里云的 API Key:https://www.alibabacloud.com/help/zh/model-studio/get-api-key。

环境中还需要安装 ffmpeg。

# 使用 uv 安装 CLI
uv tool install git+https://github.com/R0sin/podtran
# 初始化配置,默认路径为 ~/.podtran/podtran.toml
podtran init

初始化时需要填写 HF_TOKEN,主要为了使用 WhisperX 的人声分离模型,引导中有跳转链接。

初始化完成后可以在配置文件中修改 ASR 模型配置,默认是 cpu 跑的参数。

安装完依赖就能用了:

# 截取前五分钟跑流水线
podtran <audio_path> --preview
# 跑完整音频翻译流水线
podtran <audio_path>

套壳所以原生支持 mp4 等媒体格式输入。

其他 CLI 用法可以参考 README 和 help 信息。

其他补充

欢迎使用和提建议,有用的话麻烦点个 star ,谢谢!

也欢迎分享一些有意思的播客频道。

可能的迭代方向

相关链接

博客原文:https://r0sin.pages.dev/podcast-translator-cli(需代理访问)

GitHub:https://github.com/R0sin/podtran

1489 次点击
所在节点    分享创造
4 条回复
azhangbing
4 月 15 日
star 了 fork 一个做一下本地的 qwen3 tts base 可怜 和 whisper 试试
TonyHoAspire
4 月 15 日
我有一个想法 做个 App 这样子大家可以直接复用&收听 你已经转好的播客节目,节省 LLM 成本和地球资源
R0sin
4 月 15 日
@azhangbing #1 感谢 star ,whisper 目前就是本地跑的,tts 的话后面我也看看本地如何集成方便。
R0sin
4 月 15 日
@TonyHoAspire #2 好主意,我初心的话还是做一个轻量的本地工具,让我想想一键发布到小宇宙之类的平台是否可行。

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://v2ex.ih06.com/t/1206002

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX