Collez votre script, choisissez une voix, téléchargez la narration
0/20 000 caractères
Un script commence en texte et doit finir en narration. Cette page, c'est cette étape : collez le script, choisissez une voix, et récupérez une piste parlée à poser directement sur la timeline. Rien à installer, aucun compte à créer, aucun filigrane lu par-dessus.
L'audio est généré sur les serveurs de KlipTools avec Supertonic 3, un modèle neuronal de parole ouvert et compact, d'environ 99 millions de paramètres, exécuté via ONNX Runtime. Le calcul ne se fait pas sur votre machine : un script long ne met pas plus de temps depuis un téléphone dans le train que depuis un ordinateur de bureau.
Chaque génération accepte jusqu'à 20 000 caractères -- environ vingt minutes de parole, soit un script long entier plutôt qu'un paragraphe à la fois. Le résultat revient en MP3 128 kbps et en WAV non compressé, issus de la même génération : publiez l'un, montez à partir de l'autre.
Jusqu'à 20 000 caractères par génération, soit environ vingt minutes de parole. Pour la plupart des chaînes, c'est un script long complet en une seule tâche. Si le vôtre est plus long, coupez-le à un changement de section, générez chaque partie et assemblez-les avec Assembleur Audio -- la coupure entre deux sections est justement l'endroit où une pause a sa place.
Parce que la parole est générée sur les serveurs de KlipTools et non dans votre navigateur, et que ces serveurs traitent les tâches dans l'ordre d'arrivée. La page affiche pendant ce temps votre position dans la file et une barre de progression, et l'audio apparaît quand la tâche est finie. Un script court, c'est une attente courte ; un script de 20 000 caractères prend plus de temps, pour la même raison qu'une vidéo plus longue met plus de temps à s'exporter.
La Haute effectue plus d'étapes de diffusion sur le même texte : c'est plus lent et la lecture est plus propre et plus stable. La Standard est la plus rapide des deux et c'est le réglage raisonnable tant que vous testez encore des voix ou que vous fabriquez une piste provisoire pour caler le montage. Passez en Haute pour la version qui part réellement dans la vidéo publiée.
Le WAV. C'est le master non compressé de cette génération : tout ce qui suit -- niveaux, assemblages, une musique en dessous -- part du fichier en pleine qualité. Le MP3 est en 128 kbps et sert aux fois où il faut simplement la narration quelque part, vite. Les deux viennent de la même génération, donc c'est la même interprétation.
Oui, et c'est pour cela que les voix sont numérotées. Choisissez une voix, notez son numéro et reprenez-le à l'épisode suivant : F3 sera encore la même F3 le mois prochain, sur l'un comme sur l'autre site KlipTools, sans profil ni connexion qui vous y rattache. Rien dans la voix ne dérive d'une session à l'autre.
C'est gratuit tous les jours, sans compte, sans inscription, sans carte et sans filigrane. Chaque visiteur reçoit une allocation quotidienne de crédits gratuits partagée entre tous les outils KlipTools sur les deux sites, et une voix off coûte 3 crédits par caractère. Une fois l'allocation épuisée, revenez demain ou collez un code de crédits KlipTools pour continuer tout de suite.
Six heures, puis ils sont supprimés. C'est assez pour terminer le montage en cours, et assez court pour que votre narration ne dorme pas des semaines sur un serveur. Téléchargez le MP3 et le WAV tant qu'ils sont là -- regénérer le même script plus tard est une nouvelle tâche et coûte de nouveau des crédits.
Oui. Les poids du modèle Supertonic sont publiés sous licence OpenRAIL-M, et l'audio que vous générez peut aller dans des vidéos monétisées, des travaux de commande, des publicités et des produits que vous vendez. Ce que la licence exclut, c'est de s'en servir pour tromper, pour nuire, ou pour se faire passer pour une personne réelle sans son consentement.
Non. Il n'y a pas de clonage de voix ici, et c'est un choix, pas une fonction manquante. Vous disposez de dix voix fixes, déjà entraînées ; il n'existe nulle part où déposer un échantillon, donc rien de ce qu'on peut faire sur cette page n'appelle un avertissement.
Oui. La liste propose 17 langues et le modèle en couvre 31 : le script peut être dans n'importe laquelle d'entre elles. Chacune des dix voix parle toutes les langues, et c'est ce qui fait que la version traduite d'une vidéo sonne comme la même chaîne et non comme une autre.
Avec le contrôle de vitesse, de 0.7x à 2.0x, et avec la ponctuation. Une virgule est une pause courte, un point une pause plus longue : le script que vous liriez à voix haute est celui qui revient en sonnant juste. Changer la vitesse impose de regénérer, alors arrêtez d'abord le texte, le rythme ensuite.
Oui, et ça vaut le coup. Les crédits se comptent au caractère : tester un paragraphe dans deux ou trois voix coûte une fraction du script complet. Prenez les premières lignes de la vraie vidéo plutôt qu'une phrase de test -- ce que vous jugez, c'est la façon dont la voix se débrouille avec votre écriture.
Supertonic 3, un modèle neuronal ouvert de synthèse vocale d'environ 99 millions de paramètres, exécuté sous ONNX Runtime sur les serveurs de KlipTools. Il est petit pour ce qu'il fait : c'est pour cela qu'un script de vingt minutes se compte en minutes d'attente et non en rendu nocturne, et que la même tâche coûte pareil qu'elle parte d'un portable ou d'un téléphone.
Deux solutions, et la première est en général la meilleure. Enlevez des mots du script et regénérez : une narration qui tient parce qu'elle en dit moins sonne presque toujours mieux qu'une narration comprimée. Si le plan est figé et le texte non négociable, montez un peu la vitesse -- 1.1x se remarque difficilement, et le réglage va jusqu'à 2.0x s'il le faut.