Gerador de Locução

Cole o roteiro, escolha uma voz e baixe a narração

0/20.000 caracteres

Transforme um roteiro escrito em narração

Todo roteiro começa como texto e precisa terminar como narração. Esta página é essa etapa: cole o roteiro, escolha uma voz e receba uma faixa falada para colocar direto na linha do tempo. Nada para instalar, nenhuma conta para criar e nenhuma marca d'água lida por cima.

O áudio é gerado nos servidores da própria KlipTools com o Supertonic 3, um modelo neural de fala aberto e compacto, de cerca de 99 milhões de parâmetros, rodando no ONNX Runtime. O trabalho não acontece na sua máquina, então um roteiro longo não demora mais pelo celular no ônibus do que pelo desktop.

Cada geração aceita até 20.000 caracteres -- cerca de vinte minutos de fala, ou seja, um roteiro longo inteiro, e não um parágrafo de cada vez. O resultado volta como MP3 de 128 kbps e como WAV sem compressão, os dois da mesma geração: publique um e edite a partir do outro.

Como criar a narração do seu roteiro

  1. Cole o roteiro -- até 20.000 caracteres por geração. A pontuação é o que molda a leitura, então mantenha as vírgulas e os pontos onde você realmente pausaria.
  2. Escolha uma voz -- são dez, cinco femininas (F1-F5) e cinco masculinas (M1-M5). Anote qual você usou se o vídeo faz parte de uma série.
  3. Escolha o idioma -- 17 na lista, e todas as vozes falam todos eles.
  4. Defina qualidade e velocidade -- Padrão gera mais rápido, Alta gasta mais passos de difusão no mesmo texto. A velocidade vai de 0.7x a 2.0x.
  5. Envie -- o trabalho entra em uma fila. A página mostra sua posição e uma barra de progresso, e o áudio aparece quando termina.
  6. Baixe os dois arquivos -- MP3 para usar na hora, WAV como master. Eles são apagados do servidor seis horas depois.

Para que os criadores usam

O resto do trabalho de áudio

Perguntas Frequentes

Quanto de roteiro cabe em uma narração?

Até 20.000 caracteres por geração, o que dá mais ou menos vinte minutos de fala. Para a maioria dos canais isso é um roteiro longo inteiro em um único trabalho. Se o seu for maior, corte em uma quebra de seção, gere cada parte e junte tudo com o Juntador de Áudio -- a quebra entre seções é justamente onde uma pausa faz sentido.

Por que entra em uma fila em vez de tocar na hora?

Porque a fala é gerada nos servidores da KlipTools, e não no seu navegador, e esses servidores atendem os trabalhos enviados em ordem. A página mostra sua posição na fila e uma barra de progresso enquanto isso, e o áudio aparece quando o trabalho termina. Um roteiro curto costuma ser uma espera curta; um de 20.000 caracteres demora mais pelo mesmo motivo que um vídeo mais longo demora mais para exportar.

Qual é a diferença entre qualidade Padrão e Alta?

A Alta roda mais passos de difusão sobre o mesmo texto, o que demora mais e entrega uma leitura mais limpa e estável. A Padrão é a mais rápida das duas e é a escolha sensata enquanto você ainda está testando vozes ou montando uma faixa provisória para cronometrar o corte. Mude para Alta na versão que vai de fato para o vídeo publicado.

São dois downloads -- qual deles vai para o editor?

O WAV. Ele é o master sem compressão daquela geração, então tudo o que vier depois -- nível, junções, uma trilha por baixo -- parte do arquivo em qualidade cheia. O MP3 é de 128 kbps e existe para quando você só precisa da narração em algum lugar rapidinho. Os dois vêm da mesma geração, ou seja, é a mesma interpretação.

Consigo manter o mesmo narrador em toda a série?

Sim, e é por isso que as vozes são numeradas. Escolha uma voz, anote o número e use de novo no próximo episódio: F3 continua sendo a mesma F3 no mês que vem, nos dois sites da KlipTools, sem perfil nem login ligando isso a você. Nada na voz muda de uma sessão para outra.

Quanto custa?

É grátis todo dia, sem conta, sem cadastro, sem cartão e sem marca d'água. Cada visitante recebe uma cota diária de créditos gratuitos compartilhada entre todas as ferramentas da KlipTools nos dois sites, e uma narração custa 3 créditos por caractere. Quando a cota acaba, você pode voltar amanhã ou colar um código de créditos da KlipTools para continuar na hora.

Por quanto tempo meus arquivos ficam no servidor?

Seis horas, e depois são apagados. É tempo suficiente para terminar a edição em que você está e curto o bastante para a sua narração não ficar semanas em um servidor. Baixe o MP3 e o WAV enquanto estão lá -- gerar o mesmo roteiro de novo mais tarde é um trabalho novo e custa créditos de novo.

Posso usar a narração em um vídeo monetizado?

Pode. Os pesos do modelo Supertonic são publicados sob a licença OpenRAIL-M, e o áudio que você gera pode ir para vídeos monetizados, trabalhos de cliente, anúncios e produtos que você vende. O que a licença proíbe é usar isso para enganar, para causar dano ou para se passar por uma pessoa real sem o consentimento dela.

Ele consegue copiar a minha voz, ou a de alguém específico?

Não. Não há clonagem de voz aqui, e isso é uma decisão, não uma funcionalidade faltando. Você tem dez vozes fixas, já treinadas; não existe lugar para enviar uma amostra, então não há nada que alguém possa fazer nesta página que exigisse um aviso.

Meu roteiro não está em inglês. Funciona mesmo assim?

Funciona. A lista oferece 17 idiomas e o modelo cobre 31, então o roteiro pode estar em qualquer um deles. Cada uma das dez vozes fala todos os idiomas, e é isso que faz a versão traduzida de um vídeo soar como o mesmo canal, e não como outro.

Como eu controlo o ritmo da leitura?

Com o controle de velocidade, de 0.7x a 2.0x, e com a pontuação. Uma vírgula é uma pausa curta e um ponto é uma pausa mais longa, então o roteiro que você leria em voz alta é o roteiro que volta soando certo. Mudar a velocidade exige gerar de novo, então acerte o texto primeiro e o ritmo depois.

Dá para ouvir uma voz antes de comprometer o roteiro inteiro?

Dá, e vale a pena. Os créditos são cobrados por caractere, então testar um parágrafo em duas ou três vozes custa uma fração do roteiro completo. Use as primeiras linhas do vídeo de verdade, não uma frase de teste -- o que você está julgando é como a voz lida com a sua escrita.

O que gera a voz, na prática?

O Supertonic 3, um modelo neural aberto de texto para fala com cerca de 99 milhões de parâmetros, rodando no ONNX Runtime nos servidores da KlipTools. Ele é pequeno para o que faz, e é por isso que um roteiro de vinte minutos é uma espera de minutos e não uma renderização de madrugada, e por isso o mesmo trabalho custa o mesmo vindo de um notebook ou de um celular.

A narração ficou mais longa que a cena em que ela precisa caber. E agora?

Duas saídas, e a primeira costuma ser melhor. Corte palavras do roteiro e gere de novo: narração que cabe porque diz menos quase sempre soa melhor do que narração espremida. Se a cena é fixa e o texto é inegociável, suba um pouco a velocidade -- 1.1x é difícil de notar, e o controle vai até 2.0x se você precisar.