宝玉(@dotey)

这两天终于把 BaoCut 的视频画面翻译功能做了,这功能技术实现不复杂,但是交互比较麻烦,也没有同类产品借鉴参考,迭代了好几个版本终于觉得还不错了。 亮点是可以 Agent(推荐 Codex)自动...

8.5内容质量
这两天终于把 BaoCut 的视频画面翻译功能做了,这功能技术实现不复杂,但是交互比较麻烦,也没有同类产品借鉴参考,迭代了好几个版本终于觉得还不错了。

亮点是可以 Agent(推荐 Codex)自动...

TL;DR · AI 摘要

BaoCut实现视频画面翻译功能,通过Agent自动化和OCR优化提升效率,支持导出到剪映二次处理。

核心要点

  • 使用Codex Agent实现自动化画面翻译,减少人工干预
  • 批量处理优化使翻译效率提升数倍
  • 采用字幕叠加方案替代画面替换,适应动态视频特性

结构提纲

按章节快速跳转。

  1. 介绍视频画面翻译功能开发的挑战与迭代过程

  2. 通过Codex Agent实现自动化翻译流程

  3. 从单帧翻译到批量处理的效率提升方案

  4. 采用字幕叠加替代画面替换的决策依据

  5. 支持翻译结果导出到CapCut进行二次处理

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • BaoCut视频翻译功能
    • 技术实现
      • Codex Agent自动化
      • OCR文字识别
    • 交互设计
      • 批量处理队列
      • 人工勾选模式
    • 方案决策
      • 字幕叠加方案
      • CapCut导出支持

金句 / Highlights

值得收藏与分享的关键句。

#视频翻译#OCR#Agent#CapCut
打开原文

宝玉 on X: "这两天终于把 BaoCut 的视频画面翻译功能做了,这功能技术实现不复杂,但是交互比较麻烦,也没有同类产品借鉴参考,迭代了好几个版本终于觉得还不错了。 亮点是可以 Agent(推荐 Codex)自动化操作,不用人工干预,另外翻译好的结果,可以直接导出到剪映(CapCut)二次处理。 用起来倒是很简单: 一种是自己去 Agent 那边,让 Agent 自己找出来需要翻译的画面帧,然后翻译后把翻译后的文字加到 OCR 出来的位置。 参考提示词: > 帮我转录翻译 <视频地址>,并为所有全屏的 slides (不是背景中的)也添加翻译 一种是自己从 GUI 主动在要翻译的位置暂停,然后点击播放器下面的 Screen Text 按钮,就能对当前画面进行 OCR,找出来所有文字位置,当然人工可以勾选哪些需要翻译的。 最开始的版本是一次翻译一张,后来发现太慢,现在改成了添加到队列,批量翻译,效率就快多了。 之所以没有做成图片翻译替换画面,是因为视频画面是动态的,如果只是替代一帧或者几帧,效果并不好,就折衷了一下,做成了字幕叠加在原始文字上,人工可以二次调整。 如果你还不是最新版本需要升级到最新版本(v0.8.2)。 下载地址:https://t.co/89Wi1b3hZT" / X

宝玉

@dotey

这两天终于把 BaoCut 的视频画面翻译功能做了,这功能技术实现不复杂,但是交互比较麻烦,也没有同类产品借鉴参考,迭代了好几个版本终于觉得还不错了。 亮点是可以 Agent(推荐 Codex)自动化操作,不用人工干预,另外翻译好的结果,可以直接导出到剪映(CapCut)二次处理。 用起来倒是很简单: 一种是自己去 Agent 那边,让 Agent 自己找出来需要翻译的画面帧,然后翻译后把翻译后的文字加到 OCR 出来的位置。 参考提示词: > 帮我转录翻译 <视频地址>,并为所有全屏的 slides (不是背景中的)也添加翻译 一种是自己从 GUI 主动在要翻译的位置暂停,然后点击播放器下面的 Screen Text 按钮,就能对当前画面进行 OCR,找出来所有文字位置,当然人工可以勾选哪些需要翻译的。 最开始的版本是一次翻译一张,后来发现太慢,现在改成了添加到队列,批量翻译,效率就快多了。 之所以没有做成图片翻译替换画面,是因为视频画面是动态的,如果只是替代一帧或者几帧,效果并不好,就折衷了一下,做成了字幕叠加在原始文字上,人工可以二次调整。 如果你还不是最新版本需要升级到最新版本(v0.8.2)。 下载地址:

baocut.app

Punkcan

@punkcan

Jul 15

Replying to

有一个点子,虽然我暂时不会用到 就是抓取画面上原文的内容,OCR之后,换成翻译的内容,可以呼叫Codex的图片生成

9:41 PM · Jul 24, 2026

1K

Views

2

4