X:Sundar Pichai (@sundarpichai) · 2026/8/27

Gemini 3.5 Transcribe 发布:支持85+语言多说话人转录

Google 发布了 Gemini 3.5 Transcribe,一款支持多语言语音转录的 API。该模型可自动检测85种以上语言,支持多说话人场景,并提供自定义词汇适配功能,适用于专业领域术语。API已在 Google AI Studio、Gemini Enterprise 平台提供,用户也可在 macOS 和 Android 的相关应用中试用。

向 Gemini 3.5 Transcribe 问好!

- 构建能理解用户语音/意图的应用,即使有多位说话人也行! - 开箱即用,自动检测 85+ 种语言 - 针对专业术语的自定义词汇适配……SGTM:)

API 现已在 Google AI Studio 和 Gemini Enterprise 中提供,也可在 macOS 上的 Gemini 应用或 Android 上的 Rambler 中试用!

更多详情:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/

FDE 判断

对 FDE 而言,Gemini 3.5 Transcribe 提供了开箱即用的多语言转录能力,可加速企业客户项目中语音类数据的处理。其自定义词汇适配功能有助于应对垂直行业术语,降低集成交付门槛,提升现场部署效率。