Qu'est-ce que Irodori-TTS ? Fonctions, précautions et mode d'emploi

28 juillet 2026

Qu'est-ce que Irodori-TTS ? Fonctions, précautions et mode d'emploi


dog

Quel genre de logiciel de synthèse vocale IA est Irodori-TTS ?

Beaucoup d'entre vous s'interrogent probablement sur le nouveau logiciel de synthèse vocale IA « Irodori-TTS ».

Dans cet article, nous expliquerons de manière simple les caractéristiques, les possibilités, les points d'attention et l'utilisation de Irodori-TTS.

De plus, pour ceux qui pensent que « la configuration semble difficile », nous présentons également une méthode de synthèse vocale utilisable immédiatement sans installation.

Ce que vous apprendrez dans cet article

  1. Quel genre de logiciel est Irodori-TTS ?
  2. Ce que l'on peut faire avec Irodori-TTS et les points d'attention
  3. Comment utiliser Irodori-TTS (de la configuration au réglage de la voix)
  4. Méthode recommandée lorsque la configuration de l'environnement est difficile

Qu'est-ce que Irodori-TTS ? Explication du logiciel de synthèse vocale IA japonais

Qu'est-ce que Irodori-TTS ? Explication du logiciel de synthèse vocale IA japonais

Tout d'abord, nous allons expliquer brièvement les caractéristiques de Irodori-TTS en tant que logiciel de synthèse vocale IA.

Irodori-TTS est un modèle de synthèse vocale IA fonctionnant localement

Irodori-TTS est un logiciel de synthèse vocale IA spécialisé dans le japonais.

Le développeur est Aratako, et il est publié gratuitement en open source (licence MIT).

Sa caractéristique principale est de pouvoir effectuer un « fonctionnement local », où la synthèse vocale est réalisée uniquement sur votre propre PC.

Comme tout le traitement de génération vocale est effectué sur votre PC, le texte et les données vocales générées ne sont jamais envoyés à un serveur externe.

Après la configuration initiale, il est possible de générer des voix sans connexion Internet, et il n'y a aucune limite sur le nombre de générations.

Cependant, la configuration nécessite des outils de programmation tels que Python et Git.

De plus, pour un fonctionnement rapide, un PC haute performance équipé d'un GPU (carte graphique) est recommandé.

Ce que l'on peut faire et ne pas faire avec Irodori-TTS

Ce que l'on peut faire et ne pas faire avec Irodori-TTS

Ensuite, nous expliquerons ce qu'il est possible de faire et ce qu'il n'est pas possible de faire avec Irodori-TTS.

Ce que l'on peut faire avec Irodori-TTS

Comme Irodori-TTS fonctionne dans un environnement local, vous pouvez générer des voix de manière illimitée, autant de fois que vous le souhaitez.

Même dans un environnement sans connexion Internet, une fois la configuration initiale terminée, vous pouvez créer des voix librement.

Plusieurs méthodes sont disponibles pour indiquer quel type de voix créer, et en utilisant la fonction de légende (caption), vous pouvez créer la qualité de voix de votre choix uniquement par des instructions textuelles.

Il est également possible de reproduire une voix existante par clonage vocal ou d'ajouter des expressions émotionnelles avec des emojis.

Comme il est sous licence MIT, l'utilisation commerciale des voix générées est également possible.

Points d'attention de Irodori-TTS

D'un autre côté, il y a des points d'attention à connaître avant d'utiliser Irodori-TTS.

La voix pouvant être créée en une fois est d'environ 30 secondes maximum

La lecture pouvant être générée en une seule fois est d'environ 30 secondes maximum.

Si vous souhaitez lire un texte long, il est nécessaire de diviser le texte et de générer la voix en plusieurs fois.

Il est difficile d'obtenir exactement la voix ou la façon de parler souhaitée

Irodori-TTS offre une grande liberté, mais en contrepartie, aucune voix par défaut (voix de base) n'est fournie.

Par conséquent, si vous ne spécifiez pas de légende ou de voix de référence, le sexe et l'âge changeront de manière aléatoire à chaque génération.

Lorsque vous souhaitez lire avec la même voix, il est nécessaire de charger une voix de référence.

De plus, il n'y a pas de fonction pour ajuster manuellement l'inflexion ou l'intonation.

La langue prise en charge est uniquement le japonais

La langue prise en charge est uniquement le japonais ; les langues étrangères comme l'anglais ne sont pas supportées.

De plus, des erreurs de lecture de kanji peuvent survenir, il faut donc être vigilant.

PC haute performance avec GPU recommandé

Selon les spécifications du PC, la génération de la voix peut prendre du temps.

Sur un PC non équipé de GPU, la génération peut prendre environ 1 minute, même pour un texte court.

Avec des CPU d'entrée de gamme comme Celeron ou N100, l'utilisation pratique semble difficile.

Comment utiliser Irodori-TTS (flux de configuration)

Voici une explication simple de la façon d'utiliser Irodori-TTS.

Le flux global de configuration est le suivant :

  1. Installer les logiciels nécessaires
  2. Créer un dossier de travail
  3. Cloner Irodori-TTS depuis GitHub
  4. Installer les packages nécessaires
  5. Lancer Irodori-TTS
  6. Charger le modèle IA
  7. Lire le texte

1. Installer les logiciels nécessaires pour Irodori-TTS

Une préparation est nécessaire pour configurer Irodori-TTS.

Tout d'abord, installez ces trois types de logiciels :

  • Python 3.10 ou supérieur : Langage de programmation
  • Git : Système de gestion de versions (nécessaire pour télécharger Irodori-TTS)
  • uv : Gestionnaire de packages pour Python

Pour installer Python, Git et uv, commencez par faire un clic droit sur le menu Démarrer et cliquez sur « Terminal » (il n'est pas nécessaire de l'exécuter en tant qu'administrateur).

Cliquer sur « Terminal »

L'écran du terminal (PowerShell) s'ouvre alors.

Terminal (PowerShell)

Dans cet écran, saisissez et exécutez les commandes suivantes :

winget install --id Git.Git -e

winget install --id=astral-sh.uv -e

Exécution de la commande

Vous avez maintenant installé ce qui est nécessaire pour configurer Irodori-TTS.

※ Comme Python est géré par uv, il sera installé automatiquement lors de la configuration.

Une fois installé, fermez le terminal (PowerShell) et rouvrez-le (pour « mettre à jour le chemin d'accès »).

2. Créer un dossier de travail

Ensuite, créez un dossier de travail.

C'est ici que Irodori-TTS sera installé.

Cette fois, nous avons créé un dossier nommé « irodori-tts » directement à la racine du lecteur C.

Créer un dossier de travail

Une fois le dossier créé, déplacez-vous dans ce dossier via le terminal.

cd C:\irodori-tts

Se déplacer dans le dossier de travail

3. Cloner Irodori-TTS depuis GitHub

Saisissez la commande suivante dans le terminal pour cloner le dépôt Irodori-TTS depuis GitHub.

git clone https://github.com/Aratako/Irodori-TTS.git

Cloner le dépôt depuis GitHub

Le clonage du dépôt se termine en quelques secondes.

Saisissez la commande suivante pour vous déplacer dans le dossier du dépôt cloné.

cd Irodori-TTS

Se déplacer dans le dossier

4. Installer les packages nécessaires

Saisissez et exécutez la commande suivante pour installer les packages nécessaires au fonctionnement de Irodori-TTS.

uv sync

Installer les packages

Cela prendra du temps car un grand nombre de packages doivent être téléchargés et installés.

Écran pendant l'installation des packages

Le noyau Python est également installé à cette étape.

Pendant le téléchargement et l'installation, attendez sans fermer l'écran du terminal.

Comme vous téléchargez des fichiers d'une taille proche de 3 Go, il est recommandé de procéder à la configuration dans un endroit où la connexion est bonne.

5. Lancer Irodori-TTS

Une fois le téléchargement et l'installation des packages terminés, la configuration est finie.

Lancez Irodori-TTS.

Saisissez et exécutez la commande suivante, puis attendez un peu le lancement.

uv run python gradio_app.py --server-name 0.0.0.0 --server-port 7860

Le lancement est terminé lorsque l'affichage suivant apparaît dans le terminal :

Écran de lancement terminé

Running on local URL: http://0.0.0.0:7860

Ouvrez votre navigateur web et accédez à http://localhost:7860.

L'écran de Irodori-TTS (WebUI) s'ouvre alors.

WebUI de Irodori-TTS

6. Charger le modèle IA

Cliquez sur « Load Model » pour charger le modèle IA utilisé pour la lecture de texte.

Load Model

Lors de la première utilisation, le téléchargement du modèle IA commence en appuyant sur ce bouton.

Le chargement du modèle IA est terminé lorsqu'un message de confirmation s'affiche dans Model Status (la zone encadrée en rouge sur l'image suivante).

Model Status

7. Lire du texte avec Irodori-TTS

Avec Irodori-TTS, vous pouvez donner des instructions sur la façon de lire, y compris des expressions émotionnelles, mais commençons par un exemple de lecture sans instruction.

Faites défiler vers le bas pour trouver la zone de saisie de texte et entrez la phrase que vous souhaitez lire.

Saisir le texte

Cette fois, nous allons faire lire : « こんにちは、これはイロドリTTSで作成された音声です。 » (Bonjour, ceci est une voix créée avec Irodori-TTS.)

(Comme l'écriture en alphabet « Irodori-TTS » ne permettait pas une lecture correcte, nous l'avons écrit en katakana « イロドリTTS »)

Appuyez sur le bouton « Generate » pour lancer la génération de la voix.

Lancer la génération

Irodori-TTS génère la voix en utilisant le CPU ou le GPU (carte graphique) de votre PC.

Par conséquent, le temps nécessaire à la génération varie considérablement selon les performances du PC.

Dans ce cas, comme la génération a été faite sur un ordinateur portable sans GPU, cela a pris environ 1 minute pour cette phrase courte.

Référence : Test de génération effectué dans l'environnement CPU : Ryzen 5 4650U, Mémoire : DDR4 32GB, Windows 11 Pro 24H2.

Une fois la génération terminée, la forme d'onde de la voix s'affiche et vous pouvez lire l'audio.

Génération terminée

Exemple de lecture de « こんにちは、これはイロドリTTSで作成された音声です。 »

Si l'écoute est satisfaisante, appuyez sur le bouton de téléchargement (icône de flèche vers le bas) pour enregistrer le fichier audio.

Le fichier audio est enregistré au format WAV.

Vous avez ainsi réussi à synthétiser une voix en utilisant Irodori-TTS.

Comment ajuster la voix dans Irodori-TTS

Dans Irodori-TTS, vous pouvez ajuster le sexe, les émotions et d'autres expressions de diverses manières.

Spécifier des expressions émotionnelles avec des emojis

En cliquant sur « Emoji Palette » sous la zone de saisie de texte, vous pouvez choisir des emojis.

Emoji Palette

Chaque emoji est associé à une expression émotionnelle.

  • 😊 Joyeusement, avec bonheur
  • 😭 Sanglots, pleurs
  • 😰 Précipitation, agitation
  • ⏩ Parler rapidement
  • 📖 Narration, monologue

Il suffit d'insérer un emoji dans la zone de saisie de texte pour lire avec l'expression émotionnelle spécifiée.

Exemple de lecture de « 😊 こんにちは、これはイロドリTTSで作成された音声です。 »

Exemple de lecture de « 📖 こんにちは、これはイロドリTTSで作成された音声です。 »

Cependant, en spécifiant uniquement des emojis, vous ne pouvez pas définir précisément le sexe ou l'âge.

Charger une voix de référence pour lire avec la même voix

Dans Irodori-TTS, vous pouvez charger un fichier de voix de référence pour que la lecture s'en inspire.

La voix de référence se charge via la zone indiquant 「音声をここにドロップ - または - クリックしてアップロード」 (Déposez l'audio ici - ou - Cliquez pour télécharger).

Charger une voix de référence

En plus de pouvoir lire avec la même voix, cela permet d'obtenir une qualité sonore plus claire par rapport à l'absence de spécification.

Il est également possible d'ajuster directement le style de lecture avec la fonction de légende

Dans Irodori-TTS, vous pouvez également spécifier directement par texte le type de voix souhaité.

Pour utiliser la fonction de légende, il est nécessaire de lancer la « version VoiceDesign », ce qui change la commande de lancement de Irodori-TTS dans le terminal.

uv run python gradio_app_voicedesign.py --server-name 0.0.0.0 --server-port 7861

Lancer la version VoiceDesign

L'exécution de cette commande lance l'interface de la version VoiceDesign.

Comme la version VoiceDesign utilise un modèle IA différent de la version standard, lors de la première utilisation, vous devez cliquer sur « Load Model » pour télécharger le modèle spécifique à cette version.

La taille du modèle IA étant d'environ 2 Go, il est recommandé de le télécharger dans un endroit avec une bonne connexion.

L'interface de la version VoiceDesign contient une zone de texte « Caption / Style Prompt (optional) ».

Caption / Style Prompt (optional)

C'est ici que vous décrivez le type de voix que vous souhaitez.

  • Veuillez lire d'une voix de femme calme, avec une proximité douce et naturelle.
  • Veuillez parler d'une voix d'homme énergique, de manière claire et vive.
  • Veuillez lire d'une voix d'homme grave, de manière monotone comme un présentateur de JT.

De cette façon, vous pouvez spécifier le type de voix pour la lecture.

Par exemple, en spécifiant 「落ち着いた女性の声で、近い距離感でやわらかく自然に読み上げてください。」 (Veuillez lire d'une voix de femme calme, avec une proximité douce et naturelle), on obtient ce genre de voix :

Exemple avec la spécification « Calme, proximité douce et naturelle »

Ici aussi, nous avons pu obtenir une voix claire et facile à écouter.

Cependant, il y a un point d'attention concernant la fonction de légende.

La fonction de légende prend plus de temps pour générer la voix que les autres méthodes.

Lors de notre test sur ordinateur portable, la génération de cette phrase courte a pris environ 5 minutes.

L'utilisation d'un PC haute performance équipé d'un GPU est recommandée pour la fonction de légende.

Que se passe-t-il si l'on fait lire du texte en anglais ?

Irodori-TTS est un logiciel de lecture uniquement compatible avec le japonais.

Alors, que se passe-t-il si l'on essaie de lire un texte en anglais ?

Essayons d'entrer une phrase d'exemple simple.

Exemple de lecture de « Hello, this is a voice recording created using Irodori-TTS. »

Comme on peut l'entendre, le mot « Hello » prend une prononciation japonaise en katakana (« Harō »), et la partie « recording » devient inaudible, empêchant une lecture correcte.

Si vous souhaitez lire du texte en anglais, il est recommandé d'utiliser un service de synthèse vocale IA compatible avec les langues étrangères.

Méthode de synthèse vocale recommandée quand « la configuration est difficile »

En lisant jusqu'ici, certains d'entre vous ont peut-être trouvé que la configuration de Irodori-TTS semblait un peu laborieuse.

Si vous n'êtes pas habitué aux manipulations du terminal, préparer des outils comme Python et Git, installer des packages et télécharger des modèles IA peut prendre beaucoup de temps.

De plus, si vous ne possédez pas un PC équipé d'un GPU, la synthèse d'une seule voix prend trop de temps, ce qui rend difficile son utilisation pour des narrations de vidéos, par exemple.

Les textes longs doivent être divisés en segments d'environ 30 secondes et générés de nombreuses fois.

Pour ceux qui souhaitent créer des voix à partir de texte sans installation ni configuration, nous présentons ici un service de synthèse vocale IA utilisable via navigateur.

『Ondoku』, une voix IA utilisable sans installation

Ondoku

Pour synthétiser facilement des voix avec une IA de pointe, nous recommandons le service de synthèse vocale IA 『Ondoku』.

『Ondoku』 est un service de synthèse vocale IA où il suffit d'ouvrir son navigateur et de coller son texte pour créer une voix.

Vous pouvez créer gratuitement des voix dès maintenant sur PC, smartphone ou tablette.

La génération de la voix se faisant dans le cloud (côté serveur), il n'y a aucun problème si votre PC n'est pas équipé d'un GPU.

Voix d'hommes, de femmes, d'enfants... de nombreuses voix sont prêtes dès le départ, vous pouvez donc lire immédiatement en choisissant simplement une voix, sans avoir à préparer de voix de référence ou de légendes.

Les textes longs peuvent également être lus tels quels.

De plus, Ondoku est compatible avec l'anglais !

Il prend en charge de nombreuses langues comme le français, l'espagnol, le coréen, le chinois, etc., et peut donc être utilisé pour des lectures autres que le japonais.

De plus, avec la voix IA de nouvelle génération (OndokuBeta), vous pouvez expérimenter une lecture encore plus naturelle.

Si vous cherchez un moyen de transformer du texte en voix, pourquoi ne pas essayer 『Ondoku』, utilisable gratuitement et facilement ?

Comparaison des différences entre Ondoku et Irodori-TTS

Enfin, voici une comparaison des principales différences entre Ondoku et Irodori-TTS.

👆 Faites défiler horizontalement
Élément Ondoku Irodori-TTS
Mode de fonctionnement Cloud (via navigateur) Local (traitement sur votre PC)
Configuration Inutile Configuration d'environnement nécessaire (Python, Git, etc.)
Langues prises en charge Plus de 35 langues Uniquement japonais
Choix de la voix Sélection parmi plusieurs voix Spécification par clonage, légende, emojis
Limite par génération Compatible textes longs Environ 30 secondes maximum
Utilisation commerciale Possible (crédit requis pour l'utilisation gratuite) Possible (licence MIT)
Appareils compatibles PC, smartphone, tablette PC (GPU recommandé)
Tarifs Plan gratuit disponible (augmentation des caractères avec les plans payants) Gratuit (car fonctionnement local)

En comparant, on peut dire que Ondoku est idéal pour sa simplicité et son utilisation immédiate, tandis que Irodori-TTS convient si vous possédez un PC performant et souhaitez peaufiner les voix en détail.

Pour ceux qui veulent une voix tout de suite, qui ont besoin de lectures multilingues, ou qui souhaitent utiliser un smartphone ou une tablette, Ondoku est recommandé.

Il convient également à ceux qui veulent lire des textes longs d'un coup, qui ne veulent pas passer du temps sur la configuration, ou dont le PC n'est pas équipé de GPU.

Puisqu'il suffit d'ouvrir votre navigateur pour générer immédiatement des voix de haute qualité, pourquoi ne pas essayer Ondoku gratuitement ?

Résumé des caractéristiques, de la configuration et de l'utilisation de Irodori-TTS

Dans cet article, nous avons expliqué Irodori-TTS, un logiciel de synthèse vocale IA fonctionnant localement et spécialisé dans le japonais.

Irodori-TTS est un outil séduisant pour ceux qui accordent de l'importance à l'expression vocale, avec son clonage vocal, son design de qualité de voix par légendes et son contrôle des émotions par emojis.

Cependant, la méthode de configuration et l'utilisation s'adressent aux utilisateurs avancés, nécessitant la mise en place d'un environnement Python ou Git.

De plus, sur un PC sans GPU, la génération de la voix prend du temps.

Pour ceux qui souhaitent « utiliser la synthèse vocale facilement et immédiatement », nous recommandons 『Ondoku』, utilisable uniquement via navigateur.

Avec une synthèse vocale IA gratuite et simple d'utilisation, pourquoi ne pas créer vous aussi des voix de haute qualité ?

■ Logiciel de synthèse vocale IA « Ondoku »

"Ondoku" est un outil de synthèse vocale en ligne qui peut être utilisé sans frais initiaux.

  • Prend en charge environ 50 langues, dont le japonais, l'anglais, le chinois, le coréen, l'espagnol, le français et l'allemand.
  • Disponible sur PC et smartphone
  • Convient pour les affaires, l'éducation, le divertissement, etc.
  • Aucune installation requise, peut être utilisé immédiatement depuis votre navigateur
  • Prend également en charge la lecture d'images

Pour l'utiliser, saisissez simplement du texte ou téléchargez un fichier depuis le site. Générez des fichiers sonores naturels en quelques secondes. Vous pouvez utiliser gratuitement la synthèse vocale jusqu’à 5 000 caractères, alors essayez-la d’abord.

Le logiciel de synthèse vocale "Ondoku" peut lire gratuitement 5000 caractères chaque mois avec la voix AI. Vous pouvez facilement télécharger des MP3 et une utilisation commerciale est également possible. Si vous vous inscrivez gratuitement, vous pouvez convertir gratuitement jusqu'à 5 000 caractères par mois du texte en parole. Essayez Ondoku maintenant.
HP: ondoku3.com
Email: ondoku3.com@gmail.com
Articles connexes

Logiciel de synthèse vocale Ondoku. Il s'agit d'un service de synthèse vocale qui ne nécessite aucune installation et qui peut être utilisé par n'importe qui gratuitement. Si vous vous inscrivez gratuitement, vous pouvez obtenir jusqu'à 5 000 caractères gratuits chaque mois. Enregistrez-vous gratuitement maintenant