Cole o roteiro, escolha uma voz e baixe a narração
0/20.000 caracteres
Todo roteiro começa como texto e precisa terminar como narração. Esta página é essa etapa: cole o roteiro, escolha uma voz e receba uma faixa falada para colocar direto na linha do tempo. Nada para instalar, nenhuma conta para criar e nenhuma marca d'água lida por cima.
O áudio é gerado nos servidores da própria KlipTools com o Supertonic 3, um modelo neural de fala aberto e compacto, de cerca de 99 milhões de parâmetros, rodando no ONNX Runtime. O trabalho não acontece na sua máquina, então um roteiro longo não demora mais pelo celular no ônibus do que pelo desktop.
Cada geração aceita até 20.000 caracteres -- cerca de vinte minutos de fala, ou seja, um roteiro longo inteiro, e não um parágrafo de cada vez. O resultado volta como MP3 de 128 kbps e como WAV sem compressão, os dois da mesma geração: publique um e edite a partir do outro.
Até 20.000 caracteres por geração, o que dá mais ou menos vinte minutos de fala. Para a maioria dos canais isso é um roteiro longo inteiro em um único trabalho. Se o seu for maior, corte em uma quebra de seção, gere cada parte e junte tudo com o Juntador de Áudio -- a quebra entre seções é justamente onde uma pausa faz sentido.
Porque a fala é gerada nos servidores da KlipTools, e não no seu navegador, e esses servidores atendem os trabalhos enviados em ordem. A página mostra sua posição na fila e uma barra de progresso enquanto isso, e o áudio aparece quando o trabalho termina. Um roteiro curto costuma ser uma espera curta; um de 20.000 caracteres demora mais pelo mesmo motivo que um vídeo mais longo demora mais para exportar.
A Alta roda mais passos de difusão sobre o mesmo texto, o que demora mais e entrega uma leitura mais limpa e estável. A Padrão é a mais rápida das duas e é a escolha sensata enquanto você ainda está testando vozes ou montando uma faixa provisória para cronometrar o corte. Mude para Alta na versão que vai de fato para o vídeo publicado.
O WAV. Ele é o master sem compressão daquela geração, então tudo o que vier depois -- nível, junções, uma trilha por baixo -- parte do arquivo em qualidade cheia. O MP3 é de 128 kbps e existe para quando você só precisa da narração em algum lugar rapidinho. Os dois vêm da mesma geração, ou seja, é a mesma interpretação.
Sim, e é por isso que as vozes são numeradas. Escolha uma voz, anote o número e use de novo no próximo episódio: F3 continua sendo a mesma F3 no mês que vem, nos dois sites da KlipTools, sem perfil nem login ligando isso a você. Nada na voz muda de uma sessão para outra.
É grátis todo dia, sem conta, sem cadastro, sem cartão e sem marca d'água. Cada visitante recebe uma cota diária de créditos gratuitos compartilhada entre todas as ferramentas da KlipTools nos dois sites, e uma narração custa 3 créditos por caractere. Quando a cota acaba, você pode voltar amanhã ou colar um código de créditos da KlipTools para continuar na hora.
Seis horas, e depois são apagados. É tempo suficiente para terminar a edição em que você está e curto o bastante para a sua narração não ficar semanas em um servidor. Baixe o MP3 e o WAV enquanto estão lá -- gerar o mesmo roteiro de novo mais tarde é um trabalho novo e custa créditos de novo.
Pode. Os pesos do modelo Supertonic são publicados sob a licença OpenRAIL-M, e o áudio que você gera pode ir para vídeos monetizados, trabalhos de cliente, anúncios e produtos que você vende. O que a licença proíbe é usar isso para enganar, para causar dano ou para se passar por uma pessoa real sem o consentimento dela.
Não. Não há clonagem de voz aqui, e isso é uma decisão, não uma funcionalidade faltando. Você tem dez vozes fixas, já treinadas; não existe lugar para enviar uma amostra, então não há nada que alguém possa fazer nesta página que exigisse um aviso.
Funciona. A lista oferece 17 idiomas e o modelo cobre 31, então o roteiro pode estar em qualquer um deles. Cada uma das dez vozes fala todos os idiomas, e é isso que faz a versão traduzida de um vídeo soar como o mesmo canal, e não como outro.
Com o controle de velocidade, de 0.7x a 2.0x, e com a pontuação. Uma vírgula é uma pausa curta e um ponto é uma pausa mais longa, então o roteiro que você leria em voz alta é o roteiro que volta soando certo. Mudar a velocidade exige gerar de novo, então acerte o texto primeiro e o ritmo depois.
Dá, e vale a pena. Os créditos são cobrados por caractere, então testar um parágrafo em duas ou três vozes custa uma fração do roteiro completo. Use as primeiras linhas do vídeo de verdade, não uma frase de teste -- o que você está julgando é como a voz lida com a sua escrita.
O Supertonic 3, um modelo neural aberto de texto para fala com cerca de 99 milhões de parâmetros, rodando no ONNX Runtime nos servidores da KlipTools. Ele é pequeno para o que faz, e é por isso que um roteiro de vinte minutos é uma espera de minutos e não uma renderização de madrugada, e por isso o mesmo trabalho custa o mesmo vindo de um notebook ou de um celular.
Duas saídas, e a primeira costuma ser melhor. Corte palavras do roteiro e gere de novo: narração que cabe porque diz menos quase sempre soa melhor do que narração espremida. Se a cena é fixa e o texto é inegociável, suba um pouco a velocidade -- 1.1x é difícil de notar, e o controle vai até 2.0x se você precisar.