Was ist Irodori-TTS? Funktionen und Anleitung einfach erklärt

28. Juli 2026

Was ist Irodori-TTS? Funktionen und Anleitung einfach erklärt


dog

Was für eine AI Text-to-Speech Software ist Irodori-TTS eigentlich?

Sicherlich sind viele von Ihnen gespannt auf die neue AI Text-to-Speech Software „Irodori-TTS“.

In diesem Artikel erklären wir leicht verständlich die Merkmale, Möglichkeiten, Vorsichtsmaßnahmen und die Bedienung von Irodori-TTS.

Darüber hinaus stellen wir für diejenigen, die das Gefühl haben, dass das „Setup schwierig aussieht“, eine Methode zur Voice Synthesis vor, die ohne Installation sofort einsatzbereit ist.

Was Sie in diesem Artikel erfahren

  1. Was für eine Software ist Irodori-TTS?
  2. Möglichkeiten und Vorsichtsmaßnahmen bei Irodori-TTS
  3. Bedienung von Irodori-TTS (vom Setup bis zur Audio-Anpassung)
  4. Empfohlene Methode, wenn der Aufbau der Umgebung schwierig ist

Was ist Irodori-TTS? Erklärung der japanischen AI Voice Synthesis Software

Was ist Irodori-TTS? Erklärung der japanischen AI Voice Synthesis Software

Zunächst erklären wir kurz die Merkmale von Irodori-TTS und was für eine AI Voice Synthesis Software es ist.

Irodori-TTS ist ein lokal laufendes AI Voice Synthesis Modell

Irodori-TTS ist eine auf Japanisch spezialisierte AI Voice Synthesis Software.

Der Entwickler ist Aratako, und die Software ist als Open Source (MIT-Lizenz) kostenlos verfügbar.

Das größte Merkmal ist, dass die Voice Synthesis lokal auf dem eigenen PC abgeschlossen werden kann.

Da die gesamte Verarbeitung zur Erzeugung der Stimme auf dem lokalen PC erfolgt, werden Texte oder erzeugte Audiodaten nicht an externe Server gesendet.

Nach dem ersten Setup können Stimmen ohne Internetverbindung erzeugt werden, und es gibt keine Begrenzung für die Anzahl der Erzeugungen.

Für das Setup sind jedoch Programmier-Tools wie Python oder Git erforderlich.

Zudem wird ein Hochleistungs-PC mit einer GPU (Grafikkarte) empfohlen, um einen schnellen Betrieb zu gewährleisten.

Was Irodori-TTS kann und was nicht

Was Irodori-TTS kann und was nicht

Als Nächstes erklären wir, was mit Irodori-TTS möglich ist und was nicht.

Was mit Irodori-TTS möglich ist

Da Irodori-TTS in einer lokalen Umgebung läuft, können Sie unbegrenzt oft Stimmen erzeugen.

Nach dem ersten Setup können Sie auch in Umgebungen ohne Internetverbindung frei Stimmen erstellen.

Es gibt mehrere Möglichkeiten anzuweisen, welche Art von Stimme erstellt werden soll. Mit der Caption-Funktion können Sie allein durch Textanweisungen die gewünschte Sprachqualität erzeugen.

Zudem ist es möglich, vorhandene Stimmen durch Voice Cloning zu reproduzieren oder Emotionen mithilfe von Emojis auszudrücken.

Da es unter der MIT-Lizenz steht, ist auch die kommerzielle Nutzung der erzeugten Audiodaten möglich.

Vorsichtsmaßnahmen bei Irodori-TTS

Andererseits gibt es bei Irodori-TTS auch Punkte, die man vor der Nutzung wissen sollte.

Pro Erzeugung können maximal ca. 30 Sekunden Audio erstellt werden

Die Lesedauer pro Erzeugung ist auf etwa 30 Sekunden begrenzt.

Wenn Sie lange Texte vorlesen lassen möchten, müssen Sie den Text aufteilen und mehrmals erzeugen.

Es ist schwierig, genau die gewünschte Stimme oder Sprechweise zu treffen

Irodori-TTS bietet zwar eine hohe Freiheit, verfügt aber über keine voreingestellte Standardstimme (Basisstimme).

Wenn Sie also keine Captions oder Referenz-Audios angeben, ändern sich Geschlecht und Alter bei jeder Erzeugung zufällig.

Wenn Sie mit derselben Stimme vorlesen möchten, müssen Sie ein Referenz-Audio laden.

Zudem gibt es keine Funktion, um Intonation oder Betonung manuell anzupassen.

Unterstützte Sprache ist nur Japanisch

Die unterstützte Sprache ist ausschließlich Japanisch; Fremdsprachen wie Englisch werden nicht unterstützt.

Zudem ist Vorsicht geboten, da es gelegentlich zu Fehlern bei der Lesung von Kanji kommen kann.

Hochleistungs-PC mit GPU empfohlen

Je nach PC-Spezifikationen kann die Erzeugung der Stimme Zeit in Anspruch nehmen.

Auf PCs ohne GPU dauert die Erzeugung selbst bei kurzen Sätzen etwa eine Minute.

Bei CPUs der Einstiegsklasse wie Celeron oder N100 erscheint uns die praktische Nutzung als schwierig.

So nutzen Sie Irodori-TTS (Ablauf des Setups)

Hier erklären wir kurz die Bedienung von Irodori-TTS.

Der gesamte Ablauf des Setups ist wie folgt:

  1. Notwendige Software installieren
  2. Arbeitsordner erstellen
  3. Irodori-TTS von GitHub klonen
  4. Notwendige Pakete installieren
  5. Irodori-TTS starten
  6. AI-Modell laden
  7. Text vorlesen lassen

1. Notwendige Software für Irodori-TTS installieren

Für das Setup von Irodori-TTS sind Vorbereitungen erforderlich.

Zuerst installieren Sie diese drei Arten von Software:

  • Python 3.10 oder höher: Programmiersprache
  • Git: Versionsverwaltungssystem (erforderlich zum Herunterladen von Irodori-TTS)
  • uv: Paketmanager für Python

Um Python, Git und uv zu installieren, klicken Sie zunächst mit der rechten Maustaste auf das Startmenü und dann auf „Terminal“ (ein Start als Administrator ist nicht erforderlich).

Auf „Terminal“ klicken

Es öffnet sich das Terminal-Fenster (PowerShell).

Terminal (PowerShell)

Geben Sie in diesem Fenster die folgenden Befehle ein und führen Sie sie aus:

winget install --id Git.Git -e

winget install --id=astral-sh.uv -e

Befehl wird ausgeführt

Damit haben Sie die für das Setup von Irodori-TTS erforderlichen Komponenten installiert.

*Python wird von uv verwaltet und daher beim Setup automatisch installiert.

Schließen Sie nach der Installation das Terminal (PowerShell) einmal und öffnen Sie es erneut (um den „Pfad zu aktualisieren“).

2. Arbeitsordner erstellen

Als Nächstes erstellen Sie einen Arbeitsordner.

Hier wird Irodori-TTS installiert.

In diesem Beispiel haben wir einen Ordner namens „irodori-tts“ direkt unter dem Laufwerk C erstellt.

Arbeitsordner erstellen

Nachdem der Ordner erstellt wurde, wechseln Sie im Terminal in diesen Ordner.

cd C:\irodori-tts

In Arbeitsordner wechseln

3. Irodori-TTS von GitHub klonen

Geben Sie den folgenden Befehl im Terminal ein, um das Repository von Irodori-TTS von GitHub zu klonen.

git clone https://github.com/Aratako/Irodori-TTS.git

Repository von GitHub klonen

Das Klonen des Repositorys dauert nur wenige Sekunden.

Geben Sie den nächsten Befehl ein, um in den Ordner des geklonten Repositorys zu wechseln.

cd Irodori-TTS

Ordner wechseln

4. Notwendige Pakete installieren

Geben Sie den folgenden Befehl ein und führen Sie ihn aus, um die für den Betrieb von Irodori-TTS erforderlichen Pakete zu installieren.

uv sync

Pakete installieren

Da eine große Menge an Paketen heruntergeladen und installiert wird, nimmt dies einige Zeit in Anspruch.

Bildschirm während der Paketinstallation

Auch Python selbst wird hier installiert.

Warten Sie, ohne das Terminal-Fenster zu schließen, während der Download und die Installation laufen.

Da Dateien mit einer Größe von fast 3 GB heruntergeladen werden, empfiehlt es sich, das Setup an einem Ort mit guter Internetverbindung durchzuführen.

5. Irodori-TTS starten

Wenn der Download und die Installation der Pakete abgeschlossen sind, ist das Setup fertig.

Starten Sie Irodori-TTS.

Geben Sie den folgenden Befehl ein, führen Sie ihn aus und warten Sie einen Moment bis zum Start.

uv run python gradio_app.py --server-name 0.0.0.0 --server-port 7860

Wenn im Terminal Folgendes angezeigt wird, ist der Start abgeschlossen.

Bildschirm nach erfolgreichem Start

Running on local URL: http://0.0.0.0:7860

Öffnen Sie einen Webbrowser und rufen Sie http://localhost:7860 auf.

Die Benutzeroberfläche (WebUI) von Irodori-TTS öffnet sich.

WebUI von Irodori-TTS

6. AI-Modell laden

Um das für das Vorlesen verwendete AI-Modell zu laden, klicken Sie auf „Load Model“.

Load Model

Bei der ersten Verwendung beginnt nach dem Drücken dieses Buttons der Download des AI-Modells.

Sobald im Model Status (der im nächsten Bild rot umrandete Bereich) eine Abschlussmeldung erscheint, ist das Laden des AI-Modells fertig.

Model Status

7. Mit Irodori-TTS Text vorlesen lassen

In Irodori-TTS können Sie Anweisungen zur Sprechweise, einschließlich emotionaler Ausdrücke, geben. Lassen Sie uns jedoch zunächst als Beispiel ohne Anweisungen vorlesen.

Wenn Sie nach unten scrollen, finden Sie ein Texteingabefeld, in das Sie den gewünschten Text eingeben können.

Text eingeben

In diesem Fall lassen wir „こんにちは、これはイロドリTTSで作成された音声です。“ (Guten Tag, dies ist eine mit Irodori-TTS erstellte Stimme) vorlesen.

(Da die Lesung bei der Schreibung „Irodori-TTS“ in lateinischen Buchstaben nicht korrekt funktionierte, haben wir es in Katakana als „イロドリTTS“ geschrieben.)

Durch Drücken des „Generate“-Buttons beginnt die Erzeugung der Stimme.

Start der Erzeugung

Irodori-TTS nutzt die CPU oder GPU (Grafikkarte) Ihres PCs, um die Stimme zu erzeugen.

Daher variiert die benötigte Zeit für die Erzeugung stark je nach Leistung des PCs.

Da wir die Erzeugung in diesem Fall auf einem Laptop ohne GPU durchgeführt haben, dauerte es selbst für diesen kurzen Satz etwa eine Minute.

Referenz: Test-Erzeugung in der Umgebung CPU: Ryzen 5 4650U, Arbeitsspeicher: DDR4 32GB, Windows 11 Pro 24H2.

Nach Abschluss der Erzeugung wird die Wellenform des Audios angezeigt, und Sie können das Audio abspielen.

Erzeugung abgeschlossen

Beispiel für das Vorlesen von „こんにちは、これはイロドリTTSで作成された音声です。“

Wenn das Probehören kein Problem ergibt, speichern Sie die Audiodatei durch Drücken des Download-Buttons (Pfeilsymbol nach unten).

Die Audiodatei wird im WAV-Format gespeichert.

Damit konnten Sie mit Irodori-TTS eine Stimme synthetisieren.

So passen Sie die Stimme in Irodori-TTS an

In Irodori-TTS können Sie Geschlecht, Emotionen und andere Ausdrucksformen auf verschiedene Weise anpassen.

Emotionen mit Emojis festlegen

Wenn Sie auf „Emoji Palette“ unter dem Texteingabefeld klicken, können Sie Emojis auswählen.

Emoji Palette

Jedem Emoji ist ein bestimmter emotionaler Ausdruck zugewiesen.

  • 😊 Fröhlich, freudig
  • 😭 Schluchzen, Weinen
  • 😰 Hastig, erschüttert
  • ⏩ Schnelles Sprechen
  • 📖 Narration, Monolog

Indem Sie einfach ein Emoji in das Texteingabefeld einfügen, können Sie den Text mit dem angegebenen emotionalen Ausdruck vorlesen lassen.

Beispiel für „😊 こんにちは、これはイロドリTTSで作成された音声です。“

Beispiel für „📖 こんにちは、これはイロドリTTSで作成された音声です。“

Bitte beachten Sie jedoch, dass allein durch die Angabe eines Emojis Geschlecht oder Alter nicht spezifisch festgelegt werden können.

Referenz-Audio laden und mit derselben Stimme vorlesen lassen

In Irodori-TTS können Sie eine Referenz-Audiodatei laden und den Text basierend auf dieser Stimme vorlesen lassen.

Das Referenz-Audio wird über den Bereich geladen, in dem „Audio hierher ziehen - oder - zum Hochladen klicken“ steht.

Referenz-Audio laden

Dadurch können Sie nicht nur mit derselben Stimme vorlesen, sondern im Vergleich zu keiner Angabe auch eine klarere Klangqualität erzielen.

Direkte Anpassung des Vorlesestils mit der Caption-Funktion möglich

In Irodori-TTS können Sie auch direkt per Text angeben, mit welcher Art von Stimme vorgelesen werden soll.

Wenn Sie die Caption-Funktion nutzen möchten, müssen Sie die „VoiceDesign-Version“ starten. Der Befehl zum Starten von Irodori-TTS im Terminal ändert sich entsprechend.

uv run python gradio_app_voicedesign.py --server-name 0.0.0.0 --server-port 7861

VoiceDesign-Version starten

Durch Ausführung dieses Befehls startet die Bedienoberfläche der VoiceDesign-Version.

Da die VoiceDesign-Version ein anderes AI-Modell als die Standardversion verwendet, müssen Sie bei der ersten Nutzung auf „Load Model“ klicken, um das Modell separat herunterzuladen.

Die Kapazität des AI-Modells beträgt etwa 2 GB, daher wird der Download an einem Ort mit guter Internetverbindung empfohlen.

In der Bedienoberfläche der VoiceDesign-Version gibt es ein Textfeld „Caption / Style Prompt (optional)“.

Caption / Style Prompt (optional)

Hier geben Sie in Sätzen ein, mit welcher Art von Stimme Sie das Vorlesen wünschen.

  • Bitte lesen Sie mit einer ruhigen Frauenstimme, in einer nahen Distanz, weich und natürlich vor.
  • Bitte sprechen Sie mit einer lebhaften Männerstimme, hell und deutlich.
  • Bitte lesen Sie mit einer tiefen Männerstimme, sachlich wie ein Nachrichtensprecher.

Auf diese Weise können Sie angeben, wie das Audio klingen soll.

Wenn wir beispielsweise „Bitte lesen Sie mit einer ruhigen Frauenstimme, in einer nahen Distanz, weich und natürlich vor.“ angeben, erhalten wir ein solches Audio.

Beispiel für die Angabe von „Bitte lesen Sie mit einer ruhigen Frauenstimme...“

Auch hier konnte eine gut verständliche Stimme mit klarer Klangqualität erzeugt werden.

Die Caption-Funktion hat jedoch auch Nachteile.

Die Caption-Funktion benötigt im Vergleich zu anderen Methoden mehr Zeit für die Erzeugung des Audios.

Bei unserem Test auf einem Laptop dauerte die Erzeugung dieses kurzen Satzes etwa 5 Minuten.

Wenn Sie die Caption-Funktion nutzen, wird ein Hochleistungs-PC mit GPU empfohlen.

Was passiert, wenn man englischen Text vorlesen lässt?

Irodori-TTS ist eine Software, die nur Japanisch unterstützt.

Was passiert also, wenn man versucht, englischen Text vorlesen zu lassen?

Lassen Sie uns testweise einen einfachen Beispielsatz eingeben.

Beispiel für „Hello, this is a voice recording created using Irodori-TTS.“

Wie Sie hören können, wurde „Hello“ mit einer japanischen Katakana-Aussprache („Haroo“) gelesen, und der Teil „recording“ war kaum verständlich. Ein korrektes Vorlesen war nicht möglich.

Wenn Sie englische Texte vorlesen lassen möchten, empfiehlt es sich, einen AI Text-to-Speech Dienst zu nutzen, der Fremdsprachen unterstützt.

Empfohlene Voice Synthesis Methode, wenn das „Setup schwierig“ ist

Nachdem Sie bis hierher gelesen haben, haben vielleicht einige das Gefühl, dass das Setup von Irodori-TTS doch etwas mühsam aussieht.

Wenn Sie nicht an die Terminal-Bedienung gewöhnt sind, können allein die Vorbereitung von Tools wie Python oder Git, die Installation der Pakete und der Download des AI-Modells viel Zeit in Anspruch nehmen.

Zudem ist es ohne einen PC mit GPU schwierig, die Software für Zwecke wie Video-Narrationen zu nutzen, da die Voice Synthesis pro Vorgang zu lange dauert.

Lange Texte müssen in Abschnitte von etwa 30 Sekunden unterteilt und mehrmals erzeugt werden.

Für alle, die ohne Installation oder Setup Stimmen aus Texten erstellen möchten, stellen wir im Folgenden einen im Browser nutzbaren AI Voice Synthesis Dienst vor.

『Ondoku』: AI Voice ohne Installation nutzbar

Ondoku

Wenn Sie mit modernster AI einfach eine Voice Synthesis durchführen möchten, empfehlen wir den AI Voice Synthesis Dienst 『Ondoku』.

『Ondoku』 ist ein AI Voice Synthesis Dienst, bei dem Sie einfach den Browser öffnen und Text einfügen, um Audio zu erstellen.

Auf dem PC, Smartphone oder Tablet können Sie sofort kostenlos Audio erstellen.

Da die Erzeugung der Stimme in der Cloud (serverseitig) erfolgt, ist es kein Problem, wenn Ihr PC keine GPU besitzt.

Da von Anfang an mehrere Stimmen wie Männerstimmen, Frauenstimmen oder Kinderstimmen zur Verfügung stehen, können Sie diese einfach auswählen und sofort vorlesen lassen, ohne Referenz-Audios oder Captions vorbereiten zu müssen.

Lange Texte können ebenfalls direkt vorgelesen werden.

Zudem unterstützt Ondoku auch Englisch!

Da es viele Sprachen wie Französisch, Spanisch, Koreanisch und Chinesisch unterstützt, kann es auch für andere Sprachen als Japanisch verwendet werden.

Darüber hinaus können Sie mit der AI-Stimme der nächsten Generation (OndokuBeta) ein noch natürlicheres Vorlesen erleben.

Wenn Sie nach einer Methode suchen, Text in Sprache umzuwandeln, warum probieren Sie nicht das kostenlos und einfach nutzbare 『Ondoku』 aus?

Unterschiede zwischen Ondoku und Irodori-TTS im Vergleich

Abschließend vergleichen wir die Hauptunterschiede zwischen Ondoku und Irodori-TTS.

👆 Seitlich scrollen möglich
Punkt Ondoku Irodori-TTS
Betriebsmodus Cloud (Bedienung über Browser) Lokal (Verarbeitung auf eigenem PC)
Setup Nicht erforderlich Aufbau der Umgebung (Python, Git etc.) erforderlich
Unterstützte Sprachen Über 35 Sprachen Nur Japanisch
Wahl der Stimme Einfach aus mehreren Stimmen wählen Angabe durch Voice Cloning, Captions, Emojis
Limit pro Erzeugung Unterstützt lange Texte Bis ca. 30 Sekunden
Kommerzielle Nutzung Möglich (bei kostenloser Nutzung Quellenangabe erforderlich) Möglich (MIT-Lizenz)
Unterstützte Geräte PC, Smartphone, Tablet PC (GPU empfohlen)
Preis Kostenloser Plan vorhanden (kostenpflichtige Pläne für mehr Zeichen) Kostenlos (da lokaler Betrieb)

Im Vergleich lässt sich sagen: Ondoku eignet sich für Einfachheit und sofortige Einsatzbereitschaft, während Irodori-TTS ideal ist, wenn Sie einen Hochleistungs-PC besitzen und Stimmen detailliert gestalten möchten.

Für alle, die sofort Audio benötigen,多言語 (Multilingualität) brauchen oder die Software auf dem Smartphone oder Tablet nutzen möchten, ist Ondoku zu empfehlen.

Es eignet sich auch für diejenigen, die lange Texte direkt vorlesen lassen möchten, keine Zeit für das Setup aufwenden wollen oder keinen PC mit GPU besitzen.

Da Sie durch einfaches Öffnen des Browsers sofort hochwertige Stimmen erzeugen können, probieren Sie Ondoku doch erst einmal kostenlos aus?

Zusammenfassung zu Merkmalen, Setup und Bedienung von Irodori-TTS

In diesem Artikel haben wir Irodori-TTS vorgestellt, eine auf Japanisch spezialisierte, lokal laufende AI Voice Synthesis Software.

Irodori-TTS ist ein attraktives Tool für alle, die Wert auf stimmlichen Ausdruck legen, etwa durch Voice Cloning, Stimmdesign mittels Captions oder Emotionssteuerung durch Emojis.

Allerdings sind Setup und Bedienung eher für Fortgeschrittene gedacht, da der Aufbau einer Umgebung mit Python und Git erforderlich ist.

Zudem nimmt die Erzeugung der Stimme auf PCs ohne GPU viel Zeit in Anspruch.

Allen, die „jetzt sofort und einfach Voice Synthesis nutzen“ möchten, empfehlen wir den rein browserbasierten Dienst 『Ondoku』.

Möchten auch Sie mit einer einfach zu bedienenden, kostenlosen AI Voice Synthesis hochwertige Audios erstellen?

■ KI-Sprachsynthesesoftware „Ondoku“

„Ondoku“ ist ein Online-Text-to-Speech-Tool, das ohne Anfangskosten genutzt werden kann.

  • Unterstützt etwa 50 Sprachen, darunter Japanisch, Englisch, Chinesisch, Koreanisch, Spanisch, Französisch und Deutsch.
  • Verfügbar sowohl vom PC als auch vom Smartphone
  • Geeignet für Business, Bildung, Unterhaltung usw.
  • Keine Installation erforderlich, kann sofort über Ihren Browser verwendet werden
  • Unterstützt auch das Auslesen von Bildern

Um es zu verwenden, geben Sie einfach Text ein oder laden Sie eine Datei von der Website hoch. Erstellen Sie in Sekundenschnelle natürliche Klangdateien. Sie können die Sprachsynthese für bis zu 5.000 Zeichen kostenlos nutzen, also probieren Sie es bitte zuerst aus.

Die Text-to-Speech-Software „Ondoku“ kann jeden Monat 5000 Zeichen mit KI-Stimme kostenlos vorlesen. Sie können MP3s problemlos herunterladen und auch eine kommerzielle Nutzung ist möglich. Wenn Sie sich kostenlos anmelden, können Sie bis zu 5.000 Zeichen pro Monat kostenlos von Text in Sprache umwandeln. Probieren Sie Ondoku jetzt aus.
HP: ondoku3.com
Email: ondoku3.com@gmail.com
Ähnlicher Artikel.