宝玉(@dotey)
这两天终于把 BaoCut 的视频画面翻译功能做了,这功能技术实现不复杂,但是交互比较麻烦,也没有同类产品借鉴参考,迭代了好几个版本终于觉得还不错了。 亮点是可以 Agent(推荐 Codex)自动...
8.5内容质量

TL;DR · AI 摘要
BaoCut实现视频画面翻译功能,通过Agent自动化和OCR优化提升效率,支持导出到剪映二次处理。
核心要点
- 使用Codex Agent实现自动化画面翻译,减少人工干预
- 批量处理优化使翻译效率提升数倍
- 采用字幕叠加方案替代画面替换,适应动态视频特性
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- BaoCut视频翻译功能
- 技术实现
- Codex Agent自动化
- OCR文字识别
- 交互设计
- 批量处理队列
- 人工勾选模式
- 方案决策
- 字幕叠加方案
- CapCut导出支持
金句 / Highlights
值得收藏与分享的关键句。
通过Agent自动化操作,翻译效率提升数倍
动态视频特性导致放弃画面替换方案,采用字幕叠加
支持批量处理和人工勾选双重翻译模式
#视频翻译#OCR#Agent#CapCut
打开原文宝玉 on X: "这两天终于把 BaoCut 的视频画面翻译功能做了,这功能技术实现不复杂,但是交互比较麻烦,也没有同类产品借鉴参考,迭代了好几个版本终于觉得还不错了。 亮点是可以 Agent(推荐 Codex)自动化操作,不用人工干预,另外翻译好的结果,可以直接导出到剪映(CapCut)二次处理。 用起来倒是很简单: 一种是自己去 Agent 那边,让 Agent 自己找出来需要翻译的画面帧,然后翻译后把翻译后的文字加到 OCR 出来的位置。 参考提示词: > 帮我转录翻译 <视频地址>,并为所有全屏的 slides (不是背景中的)也添加翻译 一种是自己从 GUI 主动在要翻译的位置暂停,然后点击播放器下面的 Screen Text 按钮,就能对当前画面进行 OCR,找出来所有文字位置,当然人工可以勾选哪些需要翻译的。 最开始的版本是一次翻译一张,后来发现太慢,现在改成了添加到队列,批量翻译,效率就快多了。 之所以没有做成图片翻译替换画面,是因为视频画面是动态的,如果只是替代一帧或者几帧,效果并不好,就折衷了一下,做成了字幕叠加在原始文字上,人工可以二次调整。 如果你还不是最新版本需要升级到最新版本(v0.8.2)。 下载地址:https://t.co/89Wi1b3hZT" / X
宝玉
@dotey
这两天终于把 BaoCut 的视频画面翻译功能做了,这功能技术实现不复杂,但是交互比较麻烦,也没有同类产品借鉴参考,迭代了好几个版本终于觉得还不错了。 亮点是可以 Agent(推荐 Codex)自动化操作,不用人工干预,另外翻译好的结果,可以直接导出到剪映(CapCut)二次处理。 用起来倒是很简单: 一种是自己去 Agent 那边,让 Agent 自己找出来需要翻译的画面帧,然后翻译后把翻译后的文字加到 OCR 出来的位置。 参考提示词: > 帮我转录翻译 <视频地址>,并为所有全屏的 slides (不是背景中的)也添加翻译 一种是自己从 GUI 主动在要翻译的位置暂停,然后点击播放器下面的 Screen Text 按钮,就能对当前画面进行 OCR,找出来所有文字位置,当然人工可以勾选哪些需要翻译的。 最开始的版本是一次翻译一张,后来发现太慢,现在改成了添加到队列,批量翻译,效率就快多了。 之所以没有做成图片翻译替换画面,是因为视频画面是动态的,如果只是替代一帧或者几帧,效果并不好,就折衷了一下,做成了字幕叠加在原始文字上,人工可以二次调整。 如果你还不是最新版本需要升级到最新版本(v0.8.2)。 下载地址:
baocut.app
Punkcan
@punkcan
Jul 15
Replying to
有一个点子,虽然我暂时不会用到 就是抓取画面上原文的内容,OCR之后,换成翻译的内容,可以呼叫Codex的图片生成
9:41 PM · Jul 24, 2026
1K
Views
2
4