宝玉(@dotey)
更多细节介绍 https://t.co/kWnheDCLu7
8.5内容质量

TL;DR · AI 摘要
OpenMOSS开源0.9B参数音频转写模型,支持90分钟长音频一次处理,单卡4090仅需30秒完成转写。
核心要点
- 9B参数模型支持最长90分钟音频单次处理,无需切片拼接
- 基于Whisper-Medium编码器+Qwen3-0.6B架构,RTF达0.017
- 4090单卡处理5-10分钟录音仅需30秒,效率提升显著
结构提纲
按章节快速跳转。
介绍OpenMOSS开源音频转写模型的发布时间和核心功能定位
披露0.9B参数规模、128K上下文长度和90分钟长音频处理能力
说明Whisper-Medium编码器与Qwen3-0.6B架构的结合方式
- ·性能指标
展示4090单卡30秒处理5-10分钟录音的RTF 0.017性能
- ›应用场景
适用于会议记录、访谈转写等需要长音频处理的场景
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- OpenMOSS音频转写模型
- 技术架构
- Whisper-Medium编码器
- Qwen3-0.6B架构
- 性能指标
- 0.9B参数
- RTF 0.017
- 90分钟单次处理
- 应用场景
- 会议记录
- 多语言访谈
金句 / Highlights
值得收藏与分享的关键句。
0.9B参数模型实现90分钟长音频单次处理,突破传统分段处理限制
Whisper-Medium编码器+Qwen3-0.6B架构组合提升跨语言识别准确率
4090单卡处理效率达RTF 0.017,5-10分钟录音30秒完成转写
#音频转写#开源模型#AI#语音处理
打开原文宝玉 on X: "更多细节介绍 https://t.co/kWnheDCLu7" / X
宝玉
@dotey
Replying to
更多细节介绍
Feiteng
@FeitengLi
Jul 9
OpenMOSS 开源 MOSS-Transcribe-Diarize-0.9B,多人长音频转写一次搞定「说了什么、谁说的、何时说的」。 0.9B 参数,128K 上下文,最长约 90 分钟音频一次喂进去,不切片不拼接。 4090 单卡,RTF 0.017,5–10 分钟录音 30 秒转完。 架构是 Whisper-Medium 编码器 + Qwen3-0.6B 风格
Show more
6:51 AM · Jul 19, 2026
5.5K
Views
4
0