Was ist Irodori-TTS? Funktionen und Anleitung einfach erklärt
28. Juli 2026
Was für eine AI Text-to-Speech Software ist Irodori-TTS eigentlich?
Sicherlich sind viele von Ihnen gespannt auf die neue AI Text-to-Speech Software „Irodori-TTS“.
In diesem Artikel erklären wir leicht verständlich die Merkmale, Möglichkeiten, Vorsichtsmaßnahmen und die Bedienung von Irodori-TTS.
Darüber hinaus stellen wir für diejenigen, die das Gefühl haben, dass das „Setup schwierig aussieht“, eine Methode zur Voice Synthesis vor, die ohne Installation sofort einsatzbereit ist.
Was Sie in diesem Artikel erfahren
- Was für eine Software ist Irodori-TTS?
- Möglichkeiten und Vorsichtsmaßnahmen bei Irodori-TTS
- Bedienung von Irodori-TTS (vom Setup bis zur Audio-Anpassung)
- Empfohlene Methode, wenn der Aufbau der Umgebung schwierig ist
Was ist Irodori-TTS? Erklärung der japanischen AI Voice Synthesis Software
Zunächst erklären wir kurz die Merkmale von Irodori-TTS und was für eine AI Voice Synthesis Software es ist.
Irodori-TTS ist ein lokal laufendes AI Voice Synthesis Modell
Irodori-TTS ist eine auf Japanisch spezialisierte AI Voice Synthesis Software.
Der Entwickler ist Aratako, und die Software ist als Open Source (MIT-Lizenz) kostenlos verfügbar.
Das größte Merkmal ist, dass die Voice Synthesis lokal auf dem eigenen PC abgeschlossen werden kann.
Da die gesamte Verarbeitung zur Erzeugung der Stimme auf dem lokalen PC erfolgt, werden Texte oder erzeugte Audiodaten nicht an externe Server gesendet.
Nach dem ersten Setup können Stimmen ohne Internetverbindung erzeugt werden, und es gibt keine Begrenzung für die Anzahl der Erzeugungen.
Für das Setup sind jedoch Programmier-Tools wie Python oder Git erforderlich.
Zudem wird ein Hochleistungs-PC mit einer GPU (Grafikkarte) empfohlen, um einen schnellen Betrieb zu gewährleisten.
Was Irodori-TTS kann und was nicht
Als Nächstes erklären wir, was mit Irodori-TTS möglich ist und was nicht.
Was mit Irodori-TTS möglich ist
Da Irodori-TTS in einer lokalen Umgebung läuft, können Sie unbegrenzt oft Stimmen erzeugen.
Nach dem ersten Setup können Sie auch in Umgebungen ohne Internetverbindung frei Stimmen erstellen.
Es gibt mehrere Möglichkeiten anzuweisen, welche Art von Stimme erstellt werden soll. Mit der Caption-Funktion können Sie allein durch Textanweisungen die gewünschte Sprachqualität erzeugen.
Zudem ist es möglich, vorhandene Stimmen durch Voice Cloning zu reproduzieren oder Emotionen mithilfe von Emojis auszudrücken.
Da es unter der MIT-Lizenz steht, ist auch die kommerzielle Nutzung der erzeugten Audiodaten möglich.
Vorsichtsmaßnahmen bei Irodori-TTS
Andererseits gibt es bei Irodori-TTS auch Punkte, die man vor der Nutzung wissen sollte.
Pro Erzeugung können maximal ca. 30 Sekunden Audio erstellt werden
Die Lesedauer pro Erzeugung ist auf etwa 30 Sekunden begrenzt.
Wenn Sie lange Texte vorlesen lassen möchten, müssen Sie den Text aufteilen und mehrmals erzeugen.
Es ist schwierig, genau die gewünschte Stimme oder Sprechweise zu treffen
Irodori-TTS bietet zwar eine hohe Freiheit, verfügt aber über keine voreingestellte Standardstimme (Basisstimme).
Wenn Sie also keine Captions oder Referenz-Audios angeben, ändern sich Geschlecht und Alter bei jeder Erzeugung zufällig.
Wenn Sie mit derselben Stimme vorlesen möchten, müssen Sie ein Referenz-Audio laden.
Zudem gibt es keine Funktion, um Intonation oder Betonung manuell anzupassen.
Unterstützte Sprache ist nur Japanisch
Die unterstützte Sprache ist ausschließlich Japanisch; Fremdsprachen wie Englisch werden nicht unterstützt.
Zudem ist Vorsicht geboten, da es gelegentlich zu Fehlern bei der Lesung von Kanji kommen kann.
Hochleistungs-PC mit GPU empfohlen
Je nach PC-Spezifikationen kann die Erzeugung der Stimme Zeit in Anspruch nehmen.
Auf PCs ohne GPU dauert die Erzeugung selbst bei kurzen Sätzen etwa eine Minute.
Bei CPUs der Einstiegsklasse wie Celeron oder N100 erscheint uns die praktische Nutzung als schwierig.
So nutzen Sie Irodori-TTS (Ablauf des Setups)
Hier erklären wir kurz die Bedienung von Irodori-TTS.
Der gesamte Ablauf des Setups ist wie folgt:
- Notwendige Software installieren
- Arbeitsordner erstellen
- Irodori-TTS von GitHub klonen
- Notwendige Pakete installieren
- Irodori-TTS starten
- AI-Modell laden
- Text vorlesen lassen
1. Notwendige Software für Irodori-TTS installieren
Für das Setup von Irodori-TTS sind Vorbereitungen erforderlich.
Zuerst installieren Sie diese drei Arten von Software:
- Python 3.10 oder höher: Programmiersprache
- Git: Versionsverwaltungssystem (erforderlich zum Herunterladen von Irodori-TTS)
- uv: Paketmanager für Python
Um Python, Git und uv zu installieren, klicken Sie zunächst mit der rechten Maustaste auf das Startmenü und dann auf „Terminal“ (ein Start als Administrator ist nicht erforderlich).
Es öffnet sich das Terminal-Fenster (PowerShell).
Geben Sie in diesem Fenster die folgenden Befehle ein und führen Sie sie aus:
winget install --id Git.Git -e
winget install --id=astral-sh.uv -e
Damit haben Sie die für das Setup von Irodori-TTS erforderlichen Komponenten installiert.
*Python wird von uv verwaltet und daher beim Setup automatisch installiert.
Schließen Sie nach der Installation das Terminal (PowerShell) einmal und öffnen Sie es erneut (um den „Pfad zu aktualisieren“).
2. Arbeitsordner erstellen
Als Nächstes erstellen Sie einen Arbeitsordner.
Hier wird Irodori-TTS installiert.
In diesem Beispiel haben wir einen Ordner namens „irodori-tts“ direkt unter dem Laufwerk C erstellt.
Nachdem der Ordner erstellt wurde, wechseln Sie im Terminal in diesen Ordner.
cd C:\irodori-tts
3. Irodori-TTS von GitHub klonen
Geben Sie den folgenden Befehl im Terminal ein, um das Repository von Irodori-TTS von GitHub zu klonen.
git clone https://github.com/Aratako/Irodori-TTS.git
Das Klonen des Repositorys dauert nur wenige Sekunden.
Geben Sie den nächsten Befehl ein, um in den Ordner des geklonten Repositorys zu wechseln.
cd Irodori-TTS
4. Notwendige Pakete installieren
Geben Sie den folgenden Befehl ein und führen Sie ihn aus, um die für den Betrieb von Irodori-TTS erforderlichen Pakete zu installieren.
uv sync
Da eine große Menge an Paketen heruntergeladen und installiert wird, nimmt dies einige Zeit in Anspruch.
Auch Python selbst wird hier installiert.
Warten Sie, ohne das Terminal-Fenster zu schließen, während der Download und die Installation laufen.
Da Dateien mit einer Größe von fast 3 GB heruntergeladen werden, empfiehlt es sich, das Setup an einem Ort mit guter Internetverbindung durchzuführen.
5. Irodori-TTS starten
Wenn der Download und die Installation der Pakete abgeschlossen sind, ist das Setup fertig.
Starten Sie Irodori-TTS.
Geben Sie den folgenden Befehl ein, führen Sie ihn aus und warten Sie einen Moment bis zum Start.
uv run python gradio_app.py --server-name 0.0.0.0 --server-port 7860
Wenn im Terminal Folgendes angezeigt wird, ist der Start abgeschlossen.
Running on local URL: http://0.0.0.0:7860
Öffnen Sie einen Webbrowser und rufen Sie http://localhost:7860 auf.
Die Benutzeroberfläche (WebUI) von Irodori-TTS öffnet sich.
6. AI-Modell laden
Um das für das Vorlesen verwendete AI-Modell zu laden, klicken Sie auf „Load Model“.
Bei der ersten Verwendung beginnt nach dem Drücken dieses Buttons der Download des AI-Modells.
Sobald im Model Status (der im nächsten Bild rot umrandete Bereich) eine Abschlussmeldung erscheint, ist das Laden des AI-Modells fertig.
7. Mit Irodori-TTS Text vorlesen lassen
In Irodori-TTS können Sie Anweisungen zur Sprechweise, einschließlich emotionaler Ausdrücke, geben. Lassen Sie uns jedoch zunächst als Beispiel ohne Anweisungen vorlesen.
Wenn Sie nach unten scrollen, finden Sie ein Texteingabefeld, in das Sie den gewünschten Text eingeben können.
In diesem Fall lassen wir „こんにちは、これはイロドリTTSで作成された音声です。“ (Guten Tag, dies ist eine mit Irodori-TTS erstellte Stimme) vorlesen.
(Da die Lesung bei der Schreibung „Irodori-TTS“ in lateinischen Buchstaben nicht korrekt funktionierte, haben wir es in Katakana als „イロドリTTS“ geschrieben.)
Durch Drücken des „Generate“-Buttons beginnt die Erzeugung der Stimme.
Irodori-TTS nutzt die CPU oder GPU (Grafikkarte) Ihres PCs, um die Stimme zu erzeugen.
Daher variiert die benötigte Zeit für die Erzeugung stark je nach Leistung des PCs.
Da wir die Erzeugung in diesem Fall auf einem Laptop ohne GPU durchgeführt haben, dauerte es selbst für diesen kurzen Satz etwa eine Minute.
Referenz: Test-Erzeugung in der Umgebung CPU: Ryzen 5 4650U, Arbeitsspeicher: DDR4 32GB, Windows 11 Pro 24H2.
Nach Abschluss der Erzeugung wird die Wellenform des Audios angezeigt, und Sie können das Audio abspielen.
Beispiel für das Vorlesen von „こんにちは、これはイロドリTTSで作成された音声です。“
Wenn das Probehören kein Problem ergibt, speichern Sie die Audiodatei durch Drücken des Download-Buttons (Pfeilsymbol nach unten).
Die Audiodatei wird im WAV-Format gespeichert.
Damit konnten Sie mit Irodori-TTS eine Stimme synthetisieren.
So passen Sie die Stimme in Irodori-TTS an
In Irodori-TTS können Sie Geschlecht, Emotionen und andere Ausdrucksformen auf verschiedene Weise anpassen.
Emotionen mit Emojis festlegen
Wenn Sie auf „Emoji Palette“ unter dem Texteingabefeld klicken, können Sie Emojis auswählen.
Jedem Emoji ist ein bestimmter emotionaler Ausdruck zugewiesen.
- 😊 Fröhlich, freudig
- 😭 Schluchzen, Weinen
- 😰 Hastig, erschüttert
- ⏩ Schnelles Sprechen
- 📖 Narration, Monolog
Indem Sie einfach ein Emoji in das Texteingabefeld einfügen, können Sie den Text mit dem angegebenen emotionalen Ausdruck vorlesen lassen.
Beispiel für „😊 こんにちは、これはイロドリTTSで作成された音声です。“
Beispiel für „📖 こんにちは、これはイロドリTTSで作成された音声です。“
Bitte beachten Sie jedoch, dass allein durch die Angabe eines Emojis Geschlecht oder Alter nicht spezifisch festgelegt werden können.
Referenz-Audio laden und mit derselben Stimme vorlesen lassen
In Irodori-TTS können Sie eine Referenz-Audiodatei laden und den Text basierend auf dieser Stimme vorlesen lassen.
Das Referenz-Audio wird über den Bereich geladen, in dem „Audio hierher ziehen - oder - zum Hochladen klicken“ steht.
Dadurch können Sie nicht nur mit derselben Stimme vorlesen, sondern im Vergleich zu keiner Angabe auch eine klarere Klangqualität erzielen.
Direkte Anpassung des Vorlesestils mit der Caption-Funktion möglich
In Irodori-TTS können Sie auch direkt per Text angeben, mit welcher Art von Stimme vorgelesen werden soll.
Wenn Sie die Caption-Funktion nutzen möchten, müssen Sie die „VoiceDesign-Version“ starten. Der Befehl zum Starten von Irodori-TTS im Terminal ändert sich entsprechend.
uv run python gradio_app_voicedesign.py --server-name 0.0.0.0 --server-port 7861
Durch Ausführung dieses Befehls startet die Bedienoberfläche der VoiceDesign-Version.
Da die VoiceDesign-Version ein anderes AI-Modell als die Standardversion verwendet, müssen Sie bei der ersten Nutzung auf „Load Model“ klicken, um das Modell separat herunterzuladen.
Die Kapazität des AI-Modells beträgt etwa 2 GB, daher wird der Download an einem Ort mit guter Internetverbindung empfohlen.
In der Bedienoberfläche der VoiceDesign-Version gibt es ein Textfeld „Caption / Style Prompt (optional)“.
Hier geben Sie in Sätzen ein, mit welcher Art von Stimme Sie das Vorlesen wünschen.
- Bitte lesen Sie mit einer ruhigen Frauenstimme, in einer nahen Distanz, weich und natürlich vor.
- Bitte sprechen Sie mit einer lebhaften Männerstimme, hell und deutlich.
- Bitte lesen Sie mit einer tiefen Männerstimme, sachlich wie ein Nachrichtensprecher.
Auf diese Weise können Sie angeben, wie das Audio klingen soll.
Wenn wir beispielsweise „Bitte lesen Sie mit einer ruhigen Frauenstimme, in einer nahen Distanz, weich und natürlich vor.“ angeben, erhalten wir ein solches Audio.
Beispiel für die Angabe von „Bitte lesen Sie mit einer ruhigen Frauenstimme...“
Auch hier konnte eine gut verständliche Stimme mit klarer Klangqualität erzeugt werden.
Die Caption-Funktion hat jedoch auch Nachteile.
Die Caption-Funktion benötigt im Vergleich zu anderen Methoden mehr Zeit für die Erzeugung des Audios.
Bei unserem Test auf einem Laptop dauerte die Erzeugung dieses kurzen Satzes etwa 5 Minuten.
Wenn Sie die Caption-Funktion nutzen, wird ein Hochleistungs-PC mit GPU empfohlen.
Was passiert, wenn man englischen Text vorlesen lässt?
Irodori-TTS ist eine Software, die nur Japanisch unterstützt.
Was passiert also, wenn man versucht, englischen Text vorlesen zu lassen?
Lassen Sie uns testweise einen einfachen Beispielsatz eingeben.
Beispiel für „Hello, this is a voice recording created using Irodori-TTS.“
Wie Sie hören können, wurde „Hello“ mit einer japanischen Katakana-Aussprache („Haroo“) gelesen, und der Teil „recording“ war kaum verständlich. Ein korrektes Vorlesen war nicht möglich.
Wenn Sie englische Texte vorlesen lassen möchten, empfiehlt es sich, einen AI Text-to-Speech Dienst zu nutzen, der Fremdsprachen unterstützt.
Empfohlene Voice Synthesis Methode, wenn das „Setup schwierig“ ist
Nachdem Sie bis hierher gelesen haben, haben vielleicht einige das Gefühl, dass das Setup von Irodori-TTS doch etwas mühsam aussieht.
Wenn Sie nicht an die Terminal-Bedienung gewöhnt sind, können allein die Vorbereitung von Tools wie Python oder Git, die Installation der Pakete und der Download des AI-Modells viel Zeit in Anspruch nehmen.
Zudem ist es ohne einen PC mit GPU schwierig, die Software für Zwecke wie Video-Narrationen zu nutzen, da die Voice Synthesis pro Vorgang zu lange dauert.
Lange Texte müssen in Abschnitte von etwa 30 Sekunden unterteilt und mehrmals erzeugt werden.
Für alle, die ohne Installation oder Setup Stimmen aus Texten erstellen möchten, stellen wir im Folgenden einen im Browser nutzbaren AI Voice Synthesis Dienst vor.
『Ondoku』: AI Voice ohne Installation nutzbar
Wenn Sie mit modernster AI einfach eine Voice Synthesis durchführen möchten, empfehlen wir den AI Voice Synthesis Dienst 『Ondoku』.
『Ondoku』 ist ein AI Voice Synthesis Dienst, bei dem Sie einfach den Browser öffnen und Text einfügen, um Audio zu erstellen.
Auf dem PC, Smartphone oder Tablet können Sie sofort kostenlos Audio erstellen.
Da die Erzeugung der Stimme in der Cloud (serverseitig) erfolgt, ist es kein Problem, wenn Ihr PC keine GPU besitzt.
Da von Anfang an mehrere Stimmen wie Männerstimmen, Frauenstimmen oder Kinderstimmen zur Verfügung stehen, können Sie diese einfach auswählen und sofort vorlesen lassen, ohne Referenz-Audios oder Captions vorbereiten zu müssen.
Lange Texte können ebenfalls direkt vorgelesen werden.
Zudem unterstützt Ondoku auch Englisch!
Da es viele Sprachen wie Französisch, Spanisch, Koreanisch und Chinesisch unterstützt, kann es auch für andere Sprachen als Japanisch verwendet werden.
Darüber hinaus können Sie mit der AI-Stimme der nächsten Generation (OndokuBeta) ein noch natürlicheres Vorlesen erleben.
Wenn Sie nach einer Methode suchen, Text in Sprache umzuwandeln, warum probieren Sie nicht das kostenlos und einfach nutzbare 『Ondoku』 aus?
Unterschiede zwischen Ondoku und Irodori-TTS im Vergleich
Abschließend vergleichen wir die Hauptunterschiede zwischen Ondoku und Irodori-TTS.
| Punkt | Ondoku | Irodori-TTS |
|---|---|---|
| Betriebsmodus | Cloud (Bedienung über Browser) | Lokal (Verarbeitung auf eigenem PC) |
| Setup | Nicht erforderlich | Aufbau der Umgebung (Python, Git etc.) erforderlich |
| Unterstützte Sprachen | Über 35 Sprachen | Nur Japanisch |
| Wahl der Stimme | Einfach aus mehreren Stimmen wählen | Angabe durch Voice Cloning, Captions, Emojis |
| Limit pro Erzeugung | Unterstützt lange Texte | Bis ca. 30 Sekunden |
| Kommerzielle Nutzung | Möglich (bei kostenloser Nutzung Quellenangabe erforderlich) | Möglich (MIT-Lizenz) |
| Unterstützte Geräte | PC, Smartphone, Tablet | PC (GPU empfohlen) |
| Preis | Kostenloser Plan vorhanden (kostenpflichtige Pläne für mehr Zeichen) | Kostenlos (da lokaler Betrieb) |
Im Vergleich lässt sich sagen: Ondoku eignet sich für Einfachheit und sofortige Einsatzbereitschaft, während Irodori-TTS ideal ist, wenn Sie einen Hochleistungs-PC besitzen und Stimmen detailliert gestalten möchten.
Für alle, die sofort Audio benötigen,多言語 (Multilingualität) brauchen oder die Software auf dem Smartphone oder Tablet nutzen möchten, ist Ondoku zu empfehlen.
Es eignet sich auch für diejenigen, die lange Texte direkt vorlesen lassen möchten, keine Zeit für das Setup aufwenden wollen oder keinen PC mit GPU besitzen.
Da Sie durch einfaches Öffnen des Browsers sofort hochwertige Stimmen erzeugen können, probieren Sie Ondoku doch erst einmal kostenlos aus?
Zusammenfassung zu Merkmalen, Setup und Bedienung von Irodori-TTS
In diesem Artikel haben wir Irodori-TTS vorgestellt, eine auf Japanisch spezialisierte, lokal laufende AI Voice Synthesis Software.
Irodori-TTS ist ein attraktives Tool für alle, die Wert auf stimmlichen Ausdruck legen, etwa durch Voice Cloning, Stimmdesign mittels Captions oder Emotionssteuerung durch Emojis.
Allerdings sind Setup und Bedienung eher für Fortgeschrittene gedacht, da der Aufbau einer Umgebung mit Python und Git erforderlich ist.
Zudem nimmt die Erzeugung der Stimme auf PCs ohne GPU viel Zeit in Anspruch.
Allen, die „jetzt sofort und einfach Voice Synthesis nutzen“ möchten, empfehlen wir den rein browserbasierten Dienst 『Ondoku』.
Möchten auch Sie mit einer einfach zu bedienenden, kostenlosen AI Voice Synthesis hochwertige Audios erstellen?
■ KI-Sprachsynthesesoftware „Ondoku“
„Ondoku“ ist ein Online-Text-to-Speech-Tool, das ohne Anfangskosten genutzt werden kann.
- Unterstützt etwa 50 Sprachen, darunter Japanisch, Englisch, Chinesisch, Koreanisch, Spanisch, Französisch und Deutsch.
- Verfügbar sowohl vom PC als auch vom Smartphone
- Geeignet für Business, Bildung, Unterhaltung usw.
- Keine Installation erforderlich, kann sofort über Ihren Browser verwendet werden
- Unterstützt auch das Auslesen von Bildern
Um es zu verwenden, geben Sie einfach Text ein oder laden Sie eine Datei von der Website hoch. Erstellen Sie in Sekundenschnelle natürliche Klangdateien. Sie können die Sprachsynthese für bis zu 5.000 Zeichen kostenlos nutzen, also probieren Sie es bitte zuerst aus.
Email: ondoku3.com@gmail.com
Text-zu-Sprache-Software Ondoku.Es ist eine kostenlose Text-to-Speech-Anwendung ohne Installation. Wenn Sie sich kostenlos registrieren, können Sie jeden Monat bis zu 5000 Zeichen kostenlos erhalten. Registrieren Sie sich jetzt kostenlos
- Was ist Ondoku?
- den Text auf Ondoku vorlesen
- Kostenlose Anmeldung
- Tarif
- Liste der Artikel
- Andere kostenlose Services ausprobieren