Pega tu guion, elige una voz y descarga la narración
0/20.000 caracteres
Todo guion empieza como texto y tiene que terminar como narración. Esta página es ese paso: pega el guion, elige una voz y recibe una pista hablada lista para soltar en la línea de tiempo. Nada que instalar, ninguna cuenta que crear y ninguna marca de agua leída por encima.
El audio se genera en los servidores de la propia KlipTools con Supertonic 3, un modelo neuronal de voz abierto y compacto, de unos 99 millones de parámetros, ejecutado sobre ONNX Runtime. El trabajo no ocurre en tu equipo, así que un guion largo no tarda más desde un móvil en el tren que desde un ordenador de sobremesa.
Cada generación admite hasta 20.000 caracteres -- unos veinte minutos de habla, es decir, un guion largo completo y no un párrafo cada vez. El resultado vuelve como MP3 de 128 kbps y como WAV sin comprimir, ambos de la misma generación: publica uno y edita a partir del otro.
Hasta 20.000 caracteres por generación, que son unos veinte minutos de habla. Para la mayoría de canales eso es un guion largo entero en un único trabajo. Si el tuyo es más largo, córtalo en un cambio de sección, genera cada parte y únelas con el Unir Audio -- el corte entre secciones es justo donde una pausa tiene sentido.
Porque la voz se genera en los servidores de KlipTools y no en tu navegador, y esos servidores atienden los trabajos enviados por orden. Mientras tanto la página muestra tu posición en la cola y una barra de progreso, y el audio aparece cuando el trabajo termina. Un guion corto suele ser una espera corta; uno de 20.000 caracteres tarda más por la misma razón por la que un vídeo más largo tarda más en exportarse.
La Alta recorre más pasos de difusión sobre el mismo texto, lo que tarda más y da una lectura más limpia y estable. La Estándar es la rápida de las dos y es la opción sensata mientras aún estás probando voces o montando una pista provisional para cronometrar el corte. Cambia a Alta para la versión que va de verdad en el vídeo publicado.
El WAV. Es el master sin comprimir de esa generación, así que todo lo que venga después -- niveles, uniones, una música de fondo -- parte del archivo a calidad completa. El MP3 es de 128 kbps y está para cuando solo necesitas la narración en algún sitio rápidamente. Los dos salen de la misma generación, o sea que son la misma interpretación.
Sí, y por eso las voces están numeradas. Elige una voz, apunta el número y vuelve a usarlo en el siguiente episodio: F3 seguirá siendo la misma F3 el mes que viene, en cualquiera de los dos sitios de KlipTools, sin perfil ni inicio de sesión que lo ate a ti. Nada de la voz cambia entre sesiones.
Es gratis cada día, sin cuenta, sin registro, sin tarjeta y sin marca de agua. Cada visitante recibe una asignación diaria de créditos gratuitos compartida entre todas las herramientas de KlipTools en ambos sitios, y una voz en off cuesta 3 créditos por carácter. Cuando se agota puedes volver mañana o pegar un código de créditos de KlipTools para seguir al momento.
Seis horas, y después se borran. Es tiempo de sobra para terminar el montaje que tienes entre manos y lo bastante poco como para que tu narración no pase semanas en un servidor. Descarga el MP3 y el WAV mientras están ahí -- volver a generar el mismo guion más tarde es un trabajo nuevo y vuelve a costar créditos.
Sí. Los pesos del modelo Supertonic se publican bajo la licencia OpenRAIL-M, y el audio que generas puede ir en vídeos monetizados, trabajos para clientes, anuncios y productos que vendas. Lo que la licencia descarta es usarlo para engañar, para causar daño o para suplantar a una persona real sin su consentimiento.
No. Aquí no hay clonación de voz, y eso es una decisión, no una función que falte. Tienes diez voces fijas ya entrenadas; no hay ningún sitio donde subir una muestra, así que no hay nada que nadie pueda hacer en esta página que hubiera que advertir.
Funciona. La lista ofrece 17 idiomas y el modelo cubre 31, así que el guion puede estar en cualquiera de ellos. Cada una de las diez voces habla todos los idiomas, y eso es lo que hace que la versión traducida de un vídeo suene al mismo canal y no a otro distinto.
Con el control de velocidad, que va de 0.7x a 2.0x, y con la puntuación. Una coma es una pausa corta y un punto una más larga, así que el guion que leerías en voz alta es el guion que vuelve sonando bien. Cambiar la velocidad obliga a generar otra vez, así que cierra primero el texto y luego el ritmo.
Sí, y conviene hacerlo. Los créditos se cobran por carácter, así que probar un párrafo en dos o tres voces cuesta una fracción del guion completo. Usa las primeras líneas del vídeo real, no una frase de prueba -- lo que estás juzgando es cómo se lleva la voz con tu manera de escribir.
Supertonic 3, un modelo neuronal abierto de texto a voz de unos 99 millones de parámetros, ejecutándose sobre ONNX Runtime en los servidores de KlipTools. Es pequeño para lo que hace, y por eso un guion de veinte minutos es una espera de minutos y no un render de madrugada, y por eso el mismo trabajo cuesta lo mismo lo envíes desde un portátil o desde un móvil.
Dos salidas, y la primera suele ser mejor. Quita palabras del guion y genera otra vez: una narración que cabe porque dice menos casi siempre suena mejor que una narración apretada. Si el plano es fijo y el texto no es negociable, sube un poco la velocidad -- 1.1x cuesta de notar, y el control llega a 2.0x si lo necesitas.