关于 Gemini 3.5 Transcribe 的报道
共 4 篇相关报道
谷歌AI发布Gemini 3.5 Transcribe:一个报告85多种语言平均WER 2.6%的语音转文本模型
Google AI Releases Gemini 3.5 Transcribe: A Speech-to-Text Model Reporting 2.6% Average WER Across 85+ Languages
AI 洞察谷歌AI发布了Gemini 3.5 Transcribe,一个语音转文本模型,该模型报告在85多种语言中平均WER 2.6%。该模型分为两个端点:流式端点和批处理端点。流式端点提供亚秒级的转录,但不支持语者识别和单词时间戳。批处理端点支持这两个功能,但成本是流式端点的一半。谷歌报告称,流式端点的WER为4.0%,非流式端点的WER为2.6%,比Chirp 3快70%。谷歌AI发布了Gemini 3.5 Transcribe,一个支持85多种语言的语音转文本模型。Gemini 3.5 Transcribe的发布意味着谷歌AI在语音转文本领域取得了重大突破,尤其是在多语言支持方面。该模型的低WER和高效转录速度将有助于改善语音助手和转录管道的性能。- 开发者将获得更好的语音转文本模型,能够支持多种语言。
接下来,我们可以期待谷歌AI在语音转文本领域的进一步创新和改进,特别是在多语言支持和模型效率方面。重要度 85/100Google 的 Gemini 3.5 Transcribe 将语音转换为 85 种语言的文本,同时自动纠正您的言语错误
Google's Gemini 3.5 Transcribe turns speech to text in 85 languages while auto-correcting your verbal stumbles
AI 洞察Google 的 Gemini 3.5 Transcribe 可以识别 85 种语言,并在实时语音转换中纠正 filler words 和 slips of the tongue。它在流媒体模式下达到 4.0% 的单词错误率,比前代产品 Chirp 3 延迟降低了 70%。此外,通过函数调用,可以把任务交给其他 Gemini 模型。谷歌宣布推出Gemini 3.5 Transcribe,实现人工智能驱动的语音转文字功能
Google announces Gemini 3.5 Transcribe for AI-powered speech-to-text
AI 洞察谷歌宣布推出Gemini 3.5 Transcribe,实现人工智能驱动的语音转文字功能。该技术将应用于更多Google产品,包括Chrome。Gemini 3.5 Transcribe的推出标志着谷歌在语音识别领域的进一步深入。智能转录与Gemini 3.5 Transcribe
Intelligent transcription with Gemini 3.5 Transcribe
AI 洞察谷歌 DeepMind 公布了 Gemini 3.5 Transcribe,进一步提升了智能转录能力。Gemini 3.5 Transcribe 的推出标志着谷歌在语音识别技术上的又一重大进步。该技术的改进将为语音转文本应用带来更高的准确率和效率。