Logan Kilpatrick(@OfficialLoganK)

Introducing Gemini 3.5 Transcribe, our new speech to text model with smart transcription, function c...

8.5内容质量
Introducing Gemini 3.5 Transcribe, our new speech to text model with smart transcription, function c...

TL;DR · AI 摘要

Gemini 3.5 Transcribe 是 Google 推出的新一代语音转文字模型,支持 85 种语言、实时流媒体和多说话人识别。

核心要点

  • 支持 85 种语言及多说话人识别,适用全球化场景
  • 词错误率(WER)降低,提升转录准确性
  • 实时流媒体功能满足低延迟场景需求

结构提纲

按章节快速跳转。

  1. 宣布推出 Gemini 3.5 Transcribe 语音转文字模型

  2. 支持 85 种语言和多说话人识别

  3. 词错误率(WER)降低,提升转录准确性

  4. 支持自定义词汇和函数调用功能

  5. 实时流媒体支持满足低延迟需求

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • Gemini 3.5 Transcribe
    • 核心功能
      • 85种语言支持
      • 多说话人识别
    • 技术优势
      • WER降低
      • 实时流媒体
    • 应用场景
      • 全球化项目
      • 实时语音处理

金句 / Highlights

值得收藏与分享的关键句。

#Gemini#语音识别#AI模型#多语言支持
打开原文

Logan Kilpatrick on X: "推出 Gemini 3.5 Transcribe,我们的新语音转文本模型,具备智能转录、函数调用、更精准的转录(更低的 WER)、自定义词汇支持、多说话人识别以及支持 85 种以上语言!还支持实时流媒体传输... / X

Logan Kilpatrick

@OfficialLoganK

推出 Gemini 3.5 Transcribe,我们的新语音转文本模型,具备智能转录、函数调用、更精准的转录(更低的 WER)、自定义词汇支持、多说话人识别以及支持 85 种以上语言!还支持实时流媒体传输!

下午5:10 · 2026年8月26日

172.2K

浏览量

169

128

2.4K

504