Separa hablantes sin perder las marcas de tiempo.
Transcribe un audio o vídeo autorizado en español y recibe JSON con texto, marcas de tiempo por palabra y etiquetas anónimas de hablante. El contrato público describe únicamente el endpoint verificado.
Diarización
Etiquetas como SPEAKER_00 marcan turnos de voz; no identifican personas.
Tiempos
Cada palabra incluye inicio y fin para revisión, subtítulos y búsqueda interna.
Integración
Una operación multipart en OpenAPI 3.1, con ejemplos curl, Python y Node.
Cuándo utilizarla
Equipos de producto, investigación, soporte o contenido que ya tienen una grabación permitida y necesitan distinguir hablantes, revisar fragmentos o generar SRT y WebVTT. No se debe usar para identificar voces, vigilar personas ni procesar grabaciones sin derechos, aviso o consentimiento aplicable.
Cómo funciona
- Confirma derechos, aviso o consentimiento antes de seleccionar el archivo.
- Crea una clave dedicada y comprueba el precio y saldo actuales.
- Envía una única solicitud con idioma
esydiarize=true. - Revisa texto, tiempos y turnos antes de utilizar el resultado.
La API se cobra por uso. Los clientes seguros no repiten automáticamente una solicitud ambigua porque el reenvío puede generar otro cargo.
Preguntas frecuentes
¿Qué archivos? Los ejemplos aceptan archivos locales regulares .mp3, .wav, .m4a, .mp4, .mpeg, .mpga, .webm y .ogg, con un límite de 25 MB.
¿Esta página envía mi audio? No. La landing y la referencia son de solo lectura. El envío ocurre únicamente cuando ejecutas conscientemente un cliente con tu clave.
¿Hay reintentos automáticos? No en los clientes publicados. Comprueba el uso de la cuenta antes de decidir un reenvío manual.