Noticias sobre Google AI
1 artículos relacionados
Google AI Releases Gemini 3.5 Transcribe: A Speech-to-Text Model Reporting 2.6% Average WER Across 85+ Languages
AI InsightGoogle AI ha lanzado Gemini 3.5 Transcribe, un modelo de voz a texto que reporta un WER promedio del 2,6% en más de 85 idiomas. El modelo se divide en dos puntos finales: el punto final de flujo y el punto final de procesamiento por lotes. El punto final de flujo proporciona una transcripción de menos de un segundo, pero no admite la identificación de hablantes y los sellos de tiempo de palabras. El punto final de procesamiento por lotes admite estas dos funciones, pero cuesta la mitad que el punto final de flujo. Google informa que el WER del punto final de flujo es del 4,0%, mientras que el WER del punto final no flujo es del 2,6%, un 70% más rápido que Chirp 3.Google AI releases Gemini 3.5 Transcribe, a speech-to-text model supporting 85+ languages.The release of Gemini 3.5 Transcribe marks a significant breakthrough for Google AI in the field of speech-to-text, particularly in terms of multilingual support. The model's low WER and fast transcription speed will help improve the performance of voice agents and transcription pipelines.- DevelopersWill get access to a better speech-to-text model that supports multiple languages.
Next, we can expect Google AI to continue innovating and improving in the field of speech-to-text, particularly in terms of multilingual support and model efficiency.Importancia 85/100