宝玉(@dotey)

更多细节介绍 https://t.co/kWnheDCLu7

8.5内容质量
更多细节介绍
https://t.co/kWnheDCLu7

TL;DR · AI 摘要

OpenMOSS开源0.9B参数音频转写模型,支持90分钟长音频一次处理,单卡4090仅需30秒完成转写。

核心要点

  • 9B参数模型支持最长90分钟音频单次处理,无需切片拼接
  • 基于Whisper-Medium编码器+Qwen3-0.6B架构,RTF达0.017
  • 4090单卡处理5-10分钟录音仅需30秒,效率提升显著

结构提纲

按章节快速跳转。

  1. 介绍OpenMOSS开源音频转写模型的发布时间和核心功能定位

  2. 披露0.9B参数规模、128K上下文长度和90分钟长音频处理能力

  3. 说明Whisper-Medium编码器与Qwen3-0.6B架构的结合方式

  4. 展示4090单卡30秒处理5-10分钟录音的RTF 0.017性能

  5. 适用于会议记录、访谈转写等需要长音频处理的场景

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • OpenMOSS音频转写模型
    • 技术架构
      • Whisper-Medium编码器
      • Qwen3-0.6B架构
    • 性能指标
      • 0.9B参数
      • RTF 0.017
      • 90分钟单次处理
    • 应用场景
      • 会议记录
      • 多语言访谈

金句 / Highlights

值得收藏与分享的关键句。

#音频转写#开源模型#AI#语音处理
打开原文

宝玉 on X: "更多细节介绍 https://t.co/kWnheDCLu7" / X

宝玉

@dotey

Replying to

更多细节介绍

Feiteng

@FeitengLi

Jul 9

OpenMOSS 开源 MOSS-Transcribe-Diarize-0.9B,多人长音频转写一次搞定「说了什么、谁说的、何时说的」。 0.9B 参数,128K 上下文,最长约 90 分钟音频一次喂进去,不切片不拼接。 4090 单卡,RTF 0.017,5–10 分钟录音 30 秒转完。 架构是 Whisper-Medium 编码器 + Qwen3-0.6B 风格

Show more

6:51 AM · Jul 19, 2026

5.5K

Views

4

0