Sarvam AI ha puesto Saaras V4 a disposición de sus clientes mediante API. El modelo admite las 22 lenguas incluidas en el Octavo Anexo de la Constitución de India y acentos globales del inglés. Cuesta ₹30 por hora de audio; con diarización, la tarifa sube a ₹45. Sus pesos no son públicos y la documentación para instalarlo en SageMaker todavía corresponde a Saaras V3.
La novedad apunta a un problema concreto. En India, una conversación puede mezclar idiomas, cambiar de escritura y tener ruido de fondo. Saaras V4 busca abordar parte de esa complejidad dentro del propio sistema, en lugar de producir una transcripción básica para que otras herramientas la procesen después. Sarvam publica resultados favorables, aunque todavía no hay una reproducción independiente de sus pruebas.
Un modelo pensado para idiomas que suelen quedar al margen
Saaras V4 procesa audio en 22 idiomas indios —entre ellos hindi, bengalí, tamil y maratí— y en inglés, incluidos acentos globales. La amplitud de la cobertura importa: los servicios de reconocimiento pueden anunciar compatibilidad con muchos idiomas, pero su calidad varía de uno a otro.
Sarvam afirma que V4 alcanza resultados de última generación en las 22 lenguas. La compañía ha publicado evaluaciones y comparaciones basadas en sus propios ensayos; aún falta que un tercero repita las pruebas con el mismo audio, las mismas reglas de normalización y las mismas métricas.
Los acentos, los cambios de idioma dentro de una frase y las diferencias de escritura pueden complicar la transcripción y tareas posteriores como la búsqueda, el subtitulado, el análisis de llamadas o la atención al cliente. Un modelo que cubra varias lenguas puede simplificar esas integraciones, aunque los dialectos, los registros informales y la calidad de las grabaciones siguen poniendo a prueba cualquier sistema.
La cobertura es la promesa más clara de V4; su precisión en cada caso de uso todavía requiere comprobación externa. Si una empresa automatiza llamadas médicas, trámites o soporte financiero, un error puede cambiar el sentido de una instrucción o dejar fuera un nombre propio.
El interés de la noticia está en ese foco. Durante años, los idiomas con menos presencia en los grandes conjuntos de datos han recibido menos atención. Saaras V4 intenta competir en ese terreno; queda por comprobar si su cobertura se traduce en resultados consistentes fuera de las pruebas de la compañía.
Qué ocurre entre el audio y la transcripción
La arquitectura de Saaras V4 combina un codificador de audio con un decodificador lingüístico. El codificador transforma la forma de onda en representaciones numéricas que conservan información acústica y fonética. Después, un adaptador reduce la longitud de esa secuencia y la proyecta al espacio de representaciones que entiende el modelo de lenguaje. La reducción temporal busca que grabaciones largas quepan en el contexto disponible para el decodificador.
Ese decodificador es Sarvam-3B, un modelo híbrido de espacio de estados con 3.000 millones de parámetros, entrenado desde cero por la compañía. Recibe las características del audio junto con una instrucción textual y genera la transcripción token a token: predice una pieza, la incorpora a la entrada y continúa con la siguiente. Es un enfoque autorregresivo, combinado aquí con una ruta de audio diseñada para manejar secuencias extensas.
El número de parámetros no basta para valorar el sistema: un modelo de 3B puede ser suficiente para ciertas tareas y quedarse corto en otras. Importa cómo responde al ruido, al habla rápida, a los nombres poco comunes y a los cambios de idioma, además del coste de usarlo a escala. Como Sarvam no publica los pesos de V4, los equipos no pueden inspeccionar el modelo ni evaluar por su cuenta el proceso completo de inferencia.
“Entrenado desde cero” y “modelo abierto” describen cosas distintas. Lo primero alude al origen del sistema, según Sarvam; lo segundo permitiría descargar los pesos y ejecutarlo bajo control propio. V4 se ofrece por ahora como servicio de API. La documentación disponible para el despliegue en SageMaker llega hasta Saaras V3.
Los clientes deben optar entre la facilidad de una API gestionada y esperar una opción de autoalojamiento para V4. En sectores con requisitos estrictos de residencia de datos, latencia o auditoría, esa diferencia puede pesar más que una mejora modesta de WER. La arquitectura explica cómo está construido el sistema, pero no resuelve las dudas sobre los pesos, las condiciones de servicio y el control operativo.
Las métricas pintan bien; falta que alguien las replique
Para inglés, Sarvam evaluó siete conjuntos de datos. Seis proceden del Open ASR Leaderboard de Hugging Face: AMI, GigaSpeech, LibriSpeech clean, LibriSpeech other, SPGISpeech y VoxPopuli. El séptimo es Svarah, de AI4Bharat, centrado en inglés con acento indio. Según la compañía, Saaras V4 obtuvo el menor WER promedio entre los modelos incluidos en la comparación. El cálculo siguió el código de normalización del leaderboard.
WER, o tasa de error por palabra, cuenta sustituciones, inserciones y omisiones respecto a una transcripción de referencia. Es una métrica conocida, pero puede penalizar diferencias ortográficas o de formato que no cambian el significado. Esto es especialmente relevante en lenguas indias, donde la escritura y las convenciones de transcripción pueden complicar las comparaciones directas.
Para esas lenguas, Sarvam reporta resultados sobre Vistaar en diez idiomas con WER y LLM-WER. Esta última métrica añade una comprobación semántica para distinguir errores que alteran el sentido de variaciones de escritura consideradas inocuas. La metodología también requiere transparencia sobre cómo se determina esa equivalencia.
La prueba más llamativa de la empresa es Kathbath Noisy. En ese conjunto de audio comprimido, recortado o cargado de sonido de fondo, Sarvam asegura que Saaras V4 registra menos de la mitad del error de Deepgram Nova-3 y GPT-4o Transcribe, medido con LLM-WER. En identificación de idioma sobre muestras verificadas de IndicVoices, informa de un error del 2,9 % para los diez idiomas principales y del 5,22 % al cubrir los 22.
Son resultados prometedores, pero no se ha publicado una reproducción externa de las cifras. Para comparar proveedores también importan el tamaño de cada conjunto, las condiciones de grabación, las versiones exactas de los competidores y el margen de incertidumbre. El ranking puede orientar una evaluación propia, pero no sustituye esas comprobaciones.
Cinco salidas y una función para nombres difíciles
Una misma grabación puede producir cinco formatos, seleccionados con el parámetro mode. transcribe, la opción predeterminada, genera texto en la escritura nativa y normaliza números y fechas. verbatim conserva cada palabra tal como se pronunció, incluidas las muletillas y los números dichos en voz alta. La diferencia puede ser decisiva para subtítulos o archivos de investigación: el texto limpio no siempre es el texto fiel.
codemix mantiene las palabras inglesas en inglés y escribe el resto en la escritura nativa. translit convierte toda la frase a caracteres latinos, y translate entrega una traducción al inglés con números normalizados. Estos modos cubren usos distintos, desde transcripciones legibles hasta datos preparados para indexación o análisis.
Sarvam sostiene que resolver esos formatos en el modelo reduce los pasos de posprocesamiento y los errores que puede acumular una cadena de transformaciones. Habría que medirlo frente a una arquitectura modular bien afinada. Un modo integrado puede ahorrar trabajo, aunque también hacer menos evidente dónde se originó un fallo; por ejemplo, al cambiar una palabra durante la traducción o la normalización.
V4 añade indicaciones mediante palabras clave, una función disponible solo en saaras:v4. La petición admite una lista JSON de hasta 50 términos, con un máximo de 64 caracteres por elemento. Sirve para orientar el reconocimiento hacia nombres de marcas, personas o expresiones técnicas poco frecuentes. La indicación influye en la transcripción, pero no garantiza que el término aparezca bien escrito.
Para una marca como PhonePe, Sarvam recomienda combinar la indicación con el modo codemix si se necesita conservar el nombre en alfabeto latino. En IndicContextEval, un trabajo presentado para Interspeech 2026, la empresa informa de un WER del 16,03 % en el escenario L5 de prompting de palabras clave y lo describe como la mejor puntuación del benchmark. El resultado depende del contexto completo del conjunto y de su validación; un prompt no vuelve infalible la transcripción de nombres difíciles.
API, streaming y precios: lo que se puede usar hoy
Saaras V4 ya se puede invocar desde la API de Sarvam con model="saaras:v4". La forma de las solicitudes es la misma que en V3, por lo que cambiar de versión requiere, en principio, modificar una línea. Esa compatibilidad no garantiza que las salidas se comporten igual ni que una aplicación existente tolere cambios de formato, puntuación o selección de idioma.
Hay tres rutas de procesamiento. WebSocket ofrece streaming con resultados parciales y un tiempo hasta el primer token inferior a 150 milisegundos, según Sarvam. REST sirve para transcripciones síncronas de clips de hasta 30 segundos. El modo batch acepta archivos de hasta dos horas y puede añadir diarización para separar quién habló. Hay SDK para Python 3.9 o posterior y Node.js 18 o posterior, además de integraciones con LiveKit Agents, Pipecat y Vercel AI SDK.
La tarifa publicada para transcripción es ₹30 por hora de audio en tiempo real, streaming y batch. Con diarización, asciende a ₹45 por hora. La comparación de precios depende del volumen, la región, la duración de las sesiones, la precisión requerida y los costes de integrar el proveedor en una aplicación.
En la comparación publicada por Sarvam —con información de documentación y precios de cada proveedor consultada el 26 de septiembre de 2026— aparecen Deepgram Nova-3, ElevenLabs Scribe v2 y OpenAI GPT-4o Transcribe. La tabla atribuye a Saaras V4 cobertura de las 22 lenguas indias, frente a 11 para Nova-3 y 14 para Scribe v2; para OpenAI no se indica un desglose por lengua. También compara precios: Deepgram figura a 0,0052 dólares por minuto para audio multilingüe pregrabado; Scribe v2, a 0,22 dólares por hora en batch; y GPT-4o Transcribe, aproximadamente a 0,006 dólares por minuto.
Los productos no son equivalentes: cambian las condiciones, las modalidades y las prestaciones, y las cifras de latencia y calidad son en parte afirmaciones de los propios proveedores. V4 ofrece una opción para quienes necesitan lenguas indias y varios formatos de salida. El autoalojamiento documentado, en cambio, sigue disponible solo para V3.
¿Merece la pena prestarle atención?
Saaras V4 reúne cobertura lingüística amplia, varios formatos de salida y reconocimiento de audio ruidoso en un solo servicio. Para equipos que trabajan con llamadas, medios o asistentes de voz en India, puede reducir las integraciones con varios proveedores. El streaming por WebSocket, la diarización por lotes y el soporte para palabras clave completan una oferta orientada a aplicaciones.
La falta de pesos públicos y de documentación de autoalojamiento para V4 puede ser decisiva para organizaciones que necesitan inspeccionar el modelo, mantenerlo dentro de su infraestructura o justificar su rendimiento ante auditorías. Antes de migrar, conviene probarlo con audio propio: llamadas con ruido de fondo, acentos habituales, nombres de productos, mezclas de idiomas y grabaciones con interrupciones. Además de WER, se pueden revisar los errores que cambian el sentido, el comportamiento de codemix y la consistencia entre modos. La latencia anunciada por debajo de 150 ms también debe medirse en la red y la región donde funcionará el servicio.
La API ya está disponible para esas pruebas. El rendimiento de Saaras V4 en datos de clientes dependerá de cuánto coincidan con los conjuntos y las condiciones de evaluación publicados por Sarvam.
