Wat is Irodori-TTS? Mogelijkheden, tips en uitleg

28 juli 2026

Wat is Irodori-TTS? Mogelijkheden, tips en uitleg


hond

Wat voor soort AI-voorleessoftware is Irodori-TTS?

Veel mensen zijn waarschijnlijk benieuwd naar de nieuwe AI-voorleessoftware "Irodori-TTS".

In dit artikel leggen we de kenmerken, mogelijkheden, aandachtspunten en het gebruik van Irodori-TTS op een begrijpelijke manier uit.

Bovendien introduceren we voor degenen die denken dat de "setup ingewikkeld lijkt", een spraak-synthesemethode die direct kan worden gebruikt zonder installatie.

Wat je in dit artikel leert

  1. Wat voor soort software is Irodori-TTS?
  2. Wat je kunt doen met Irodori-TTS en belangrijke aandachtspunten
  3. Hoe je Irodori-TTS gebruikt (van setup tot aanpassing van de stem)
  4. Aanbevolen methode wanneer het opbouwen van de omgeving lastig is

Wat is Irodori-TTS? Uitleg over de Japanse AI-spraaksynthesesoftware

Wat is Irodori-TTS? Uitleg over de Japanse AI-spraaksynthesesoftware

Allereerst leggen we kort uit wat voor soort AI-spraaksynthesesoftware Irodori-TTS is en wat de kenmerken zijn.

Irodori-TTS is een lokaal draaiend AI-spraaksynthesemodel

Irodori-TTS is AI-voorleessoftware die gespecialiseerd is in de Japanse taal.

De ontwikkelaar is Aratako, en de software is gratis beschikbaar als open source (MIT licentie).

Het belangrijkste kenmerk is dat het "lokaal kan werken", wat betekent dat de spraaksynthese volledig op je eigen PC wordt voltooid.

Omdat alle verwerking voor het genereren van spraak op je lokale PC plaatsvindt, worden tekst- of gegenereerde spraakgegevens niet naar een externe server verzonden.

Na de eerste setup kun je spraak genereren zonder internetverbinding, en er is geen limiet aan het aantal generaties.

Voor de setup zijn echter programmeertools zoals Python en Git vereist.

Bovendien wordt een krachtige PC met een GPU (grafische kaart) aanbevolen om de software snel te laten werken.

Wat je wel en niet kunt doen met Irodori-TTS

Wat je wel en niet kunt doen met Irodori-TTS

Vervolgens leggen we uit wat wel en niet mogelijk is met Irodori-TTS.

Wat je kunt doen met Irodori-TTS

Omdat Irodori-TTS in een lokale omgeving werkt, kun je onbeperkt en zo vaak als je wilt spraak genereren.

Zelfs in een omgeving zonder internetverbinding kun je, zodra de eerste setup is voltooid, vrijuit spraak maken.

Er zijn meerdere manieren om instructies te geven over welke stem je wilt maken. Met de caption-functie kun je puur door tekstinstructies een stemkwaliteit naar eigen smaak creëren.

Het is ook mogelijk om bestaande stemmen te reproduceren via voice cloning of om emoties toe te voegen met emoji.

Dankzij de MIT licentie is commercieel gebruik van de gegenereerde spraak ook toegestaan.

Aandachtspunten bij Irodori-TTS

Aan de andere kant zijn er ook aandachtspunten die je moet weten voordat je Irodori-TTS gebruikt.

De per keer te genereren spraak is beperkt tot ongeveer 30 seconden

Per generatie kan er ongeveer 30 seconden aan tekst worden voorgelezen.

Als je lange teksten wilt laten voorlezen, moet je de tekst opsplitsen en meerdere keren genereren.

Het is lastig om precies de gewenste stem of manier van praten te krijgen

Omdat Irodori-TTS veel vrijheid biedt, zijn er geen standaardstemmen (basisstemmen) vooraf ingesteld.

Daarom zullen het geslacht en de leeftijd bij elke generatie willekeurig veranderen als je geen captions of referentie-audio opgeeft.

Als je met dezelfde stem wilt laten voorlezen, moet je referentie-audio inladen.

Bovendien is er geen functie om de intonatie of nadruk handmatig aan te passen.

Alleen de Japanse taal wordt ondersteund

De ondersteunde taal is uitsluitend Japans; vreemde talen zoals Engels worden niet ondersteund.

Ook moet je oppassen voor verkeerde uitspraken van Kanji.

Krachtige PC met GPU aanbevolen

Afhankelijk van de PC-specificaties kan het genereren van spraak tijd kosten.

Op een PC zonder GPU duurt het genereren van zelfs een korte tekst ongeveer een minuut.

Bij instapmodellen CPU's zoals Celeron of N100 voelt praktisch gebruik moeizaam aan.

Irodori-TTS gebruiken (Setup flow)

Vanaf hier leggen we kort uit hoe je Irodori-TTS gebruikt.

De algemene flow van de setup is als volgt:

  1. Benodigde software installeren
  2. Een werkmap maken
  3. Irodori-TTS klonen van GitHub
  4. Benodigde pakketten installeren
  5. Irodori-TTS opstarten
  6. Het AI-model inladen
  7. Tekst laten voorlezen

1. Benodigde software voor Irodori-TTS installeren

Voor de setup van Irodori-TTS is enige voorbereiding nodig.

Installeer eerst deze drie zaken:

  • Python 3.10 of hoger: De programmeertaal
  • Git: Versiebeheersysteem (nodig om Irodori-TTS te downloaden)
  • uv: Package manager voor Python

Om Python, Git en uv te installeren, klik je eerst met de rechtermuisknop op het startmenu en klik je op "Terminal" (je hoeft dit niet als administrator uit te voeren).

Klik op 'Terminal'

Er opent dan een Terminal (PowerShell) venster.

Terminal (PowerShell)

Voer in dit scherm de volgende commando's uit:

winget install --id Git.Git -e

winget install --id=astral-sh.uv -e

Commando wordt uitgevoerd

Nu heb je de benodigdheden voor de setup van Irodori-TTS geïnstalleerd.

※Python wordt beheerd door uv, dus dit wordt automatisch geïnstalleerd tijdens de setup.

Sluit na de installatie de Terminal (PowerShell) één keer en open deze opnieuw (om het 'pad' bij te werken).

2. Een werkmap maken

Maak vervolgens een werkmap aan.

Hierin wordt Irodori-TTS geïnstalleerd.

In dit voorbeeld hebben we direct onder de C-schijf een map genaamd "irodori-tts" gemaakt.

Werkmap maken

Nadat de map is gemaakt, navigeer je in de Terminal naar die map.

cd C:\irodori-tts

Navigeren naar werkmap

3. Irodori-TTS klonen van GitHub

Voer het volgende commando in de Terminal in om de repository van Irodori-TTS van GitHub te klonen.

git clone https://github.com/Aratako/Irodori-TTS.git

Repository klonen van GitHub

Het klonen van de repository duurt slechts enkele seconden.

Voer het volgende commando in om naar de map van de gekloonde repository te gaan.

cd Irodori-TTS

Map wijzigen

4. Benodigde pakketten installeren

Voer het volgende commando in om de benodigde pakketten te installeren die nodig zijn om Irodori-TTS te laten werken.

uv sync

Pakketten installeren

Dit duurt even omdat er een grote hoeveelheid pakketten wordt gedownload en geïnstalleerd.

Scherm tijdens pakketinstallatie

Python zelf wordt hier ook geïnstalleerd.

Wacht tot het downloaden en installeren klaar is zonder het Terminal-scherm te sluiten.

Omdat er bijna 3 GB aan bestanden wordt gedownload, is het aanbevolen om de setup uit te voeren op een plek met een goede internetverbinding.

5. Irodori-TTS opstarten

Zodra het downloaden en installeren van de pakketten klaar is, is de setup voltooid.

Start Irodori-TTS op.

Voer het volgende commando in en wacht even op het opstarten.

uv run python gradio_app.py --server-name 0.0.0.0 --server-port 7860

Wanneer het volgende in de Terminal verschijnt, is het opstarten voltooid.

Scherm na voltooiing van opstarten

Running on local URL: http://0.0.0.0:7860

Open je webbrowser en ga naar http://localhost:7860.

Het scherm van Irodori-TTS (WebUI) wordt nu geopend.

Irodori-TTS WebUI

6. Het AI-model inladen

Klik op "Load Model" om het AI-model in te laden dat wordt gebruikt voor het voorlezen van de tekst.

Load Model

Bij het eerste gebruik begint het downloaden van het AI-model zodra je op deze knop drukt.

Zodra er een voltooiingsbericht verschijnt bij Model Status (de rood omkaderde plek in de volgende afbeelding), is het inladen van het AI-model voltooid.

Model Status

7. Tekst laten voorlezen met Irodori-TTS

Met Irodori-TTS kun je instructies geven over de manier van voorlezen, inclusief emoties, maar laten we eerst als voorbeeld voorlezen zonder instructies.

Als je naar beneden scrollt, zie je een tekstinvoerveld waar je de tekst kunt invoeren die je wilt laten voorlezen.

Tekst invoeren

In dit geval proberen we "こんにちは、これはイロドリTTSで作成された音声です。" (Hallo, dit is een stem gemaakt met Irodori-TTS) te laten voorlezen.

(Omdat het met het alfabet "Irodori-TTS" niet goed werd uitgesproken, hebben we het in Katakana geschreven als "イロドリTTS")

Druk op de "Generate" knop om het genereren van de spraak te starten.

Start genereren

Irodori-TTS genereert spraak met behulp van de CPU of GPU van je eigen PC.

Daarom varieert de tijd die nodig is voor het genereren aanzienlijk afhankelijk van de prestaties van je PC.

In dit geval werd er gegenereerd op een laptop zonder GPU, waardoor het genereren van een korte tekst ongeveer een minuut duurde.

Referentie: Testgeneratie uitgevoerd in een omgeving met CPU: Ryzen 5 4650U, Geheugen: DDR4 32GB, Windows 11 Pro 24H2.

Zodra het genereren klaar is, wordt de golfvorm van de spraak weergegeven en kun je de audio afspelen.

Genereren voltooid

Voorbeeld van het voorlezen van "こんにちは、これはイロドリTTSで作成された音声です。"

Als de luistertest in orde is, klik je op de downloadknop (icoon met pijl naar beneden) om het audiobestand op te slaan.

Audiobestanden worden opgeslagen in WAV-formaat.

Hiermee is het gelukt om spraak te synthetiseren met Irodori-TTS.

De stem van Irodori-TTS aanpassen

Met Irodori-TTS kun je op verschillende manieren expressies zoals geslacht en emotie aanpassen.

Emotionele expressie aangeven met emoji

Klik op "Emoji Palette" onder het tekstinvoerveld om een emoji te kiezen.

Emoji Palette

Aan elke emoji is een emotionele expressie toegewezen.

  • 😊 Vrolijk, blij
  • 😭 Snikkend, huilend
  • 😰 Gehaast, overstuur
  • ⏩ Snel pratend
  • 📖 Voice-over, monoloog

Door simpelweg een emoji in het tekstinvoerveld te plaatsen, kun je de tekst laten voorlezen met de opgegeven emotie.

Voorbeeld van het voorlezen van "😊 こんにちは、これはイロドリTTSで作成された音声です。"

Voorbeeld van het voorlezen van "📖 こんにちは、これはイロドリTTSで作成された音声です。"

Let wel op dat je met alleen een emoji geen specifiek geslacht of leeftijd kunt aangeven.

Referentie-audio inladen om met dezelfde stem voor te lezen

Met Irodori-TTS kun je een referentie-audiobestand inladen en de tekst laten voorlezen met die stem als referentie.

Referentie-audio kan worden ingeladen via het gedeelte waar staat "Sleep audio hierheen - of - Klik om te uploaden".

Referentie-audio inladen

Niet alleen kun je met dezelfde stem voorlezen, de geluidskwaliteit is vaak ook helderder vergeleken met wanneer je niets opgeeft.

De voorleesstijl direct aanpassen met de caption-functie

Met Irodori-TTS kun je ook direct via tekst aangeven met wat voor soort stem er moet worden voorgelezen.

Om de caption-functie te gebruiken, moet je de "VoiceDesign-versie" opstarten, waardoor het commando om Irodori-TTS in de Terminal op te starten verandert.

uv run python gradio_app_voicedesign.py --server-name 0.0.0.0 --server-port 7861

VoiceDesign-versie opstarten

Wanneer je dit commando uitvoert, start het bedieningsscherm van de VoiceDesign-versie op.

Omdat de VoiceDesign-versie een ander AI-model gebruikt dan de standaardversie, moet je bij het eerste gebruik op "Load Model" klikken om het model apart van de standaardversie te downloaden.

Aangezien de grootte van het AI-model ongeveer 2 GB is, is het aanbevolen om dit te downloaden op een plek met een goede internetverbinding.

In het bedieningsscherm van de VoiceDesign-versie staat een tekstvak "Caption / Style Prompt (optional)".

Caption / Style Prompt (optional)

Hier voer je in wat voor soort stem je wilt horen.

  • Lees rustig voor met een vrouwelijke stem, op een natuurlijke en zachte manier, alsof je dichtbij staat.
  • Spreek opgewekt en duidelijk met een energieke mannenstem.
  • Lees zakelijk voor met een lage mannenstem, zoals een nieuwslezer.

Zo kun je aangeven met welke stem er moet worden voorgelezen.

Als je bijvoorbeeld "Lees rustig voor met een vrouwelijke stem, op een natuurlijke en zachte manier, alsof je dichtbij staat." opgeeft, krijg je een resultaat zoals dit.

Voorbeeld met de opgegeven caption: "Lees rustig voor met een vrouwelijke stem, op een natuurlijke en zachte manier, alsof je dichtbij staat."

Ook hier is het gelukt om een stem met heldere geluidskwaliteit te genereren die makkelijk te verstaan is.

Er is echter een aandachtspunt bij de caption-functie.

De caption-functie kost meer tijd voor het genereren van spraak vergeleken met andere methoden.

Toen we dit op de laptop genereerden, duurde het genereren van deze korte tekst ongeveer 5 minuten.

Voor het gebruik van de caption-functie wordt een krachtige PC met een GPU aanbevolen.

Wat gebeurt er als je Engelse tekst laat voorlezen?

Irodori-TTS is voorleessoftware die uitsluitend Japans ondersteunt.

Wat gebeurt er dan als je Engelse tekst probeert te laten voorlezen?

Laten we een eenvoudige voorbeeldzin proberen.

Voorbeeld van het voorlezen van "Hello, this is a voice recording created using Irodori-TTS."

Zoals je hoort, wordt "Hello" uitgesproken met een Katakana-accent ("Harō") en het gedeelte "recording" wordt onverstaanbaar. Het lukt dus niet om dit correct te laten voorlezen.

Als je Engelse tekst wilt laten voorlezen, is het aanbevolen om een AI-voorleesdienst te gebruiken die vreemde talen ondersteunt.

Aanbevolen methode wanneer de "setup lastig is"

Nu je dit hebt gelezen, voelen sommigen misschien dat de setup van Irodori-TTS nogal wat voeten in de aarde heeft.

Als je niet gewend bent aan Terminal-bediening, kost alleen al het voorbereiden van tools zoals Python en Git, het installeren van pakketten en het downloaden van AI-modellen veel tijd.

Bovendien, als je geen PC met GPU hebt, duurt elke spraaksynthese te lang, wat het moeilijk maakt voor doeleinden zoals video-voice-overs.

Lange teksten moeten steeds in stukken van ongeveer 30 seconden worden verdeeld om herhaaldelijk te genereren.

Voor degenen die tekst in spraak willen omzetten zonder installatie of setup, introduceren we hieronder een AI-spraaksynthesedienst die in de browser werkt.

"Ondoku": AI-stemmen die zonder installatie kunnen worden gebruikt

Ondoku

Als je eenvoudig spraaksynthese wilt uitvoeren met de nieuwste AI, is de AI-spraaksynthesedienst "Ondoku" een aanrader.

"Ondoku" is een AI-spraaksynthesedienst waarbij je simpelweg je browser opent en tekst plakt om spraak te maken.

Je kunt direct en gratis spraak maken op je PC, smartphone of tablet.

Omdat het genereren van de stem in de cloud (aan de serverzijde) gebeurt, is het geen probleem als je PC geen GPU heeft.

Er zijn vanaf het begin meerdere stemmen beschikbaar, zoals mannenstemmen, vrouwenstemmen en kinderstemmen. Je hoeft dus geen referentie-audio of captions voor te bereiden; je kunt direct voorlezen door simpelweg een stem te kiezen.

Lange teksten kunnen ook in één keer worden voorgelezen.

Bovendien ondersteunt Ondoku ook Engels!

Het ondersteunt vele talen, zoals Frans, Spaans, Koreaans en Chinees, dus het kan ook worden gebruikt voor voorlezen in andere talen dan Japans.

Bovendien kun je met de volgende generatie AI-stemmen (OndokuBeta) een nog natuurlijkere voorleeservaring beleven.

Als je op zoek bent naar een manier om tekst in spraak om te zetten, waarom probeer je dan niet de gratis en eenvoudige "Ondoku"?

Vergelijking van de verschillen tussen Ondoku en Irodori-TTS

Tot slot vergelijken we de belangrijkste verschillen tussen Ondoku en Irodori-TTS.

👆 Je kunt zijwaarts scrollen
Item Ondoku Irodori-TTS
Werking Cloud (bediening via browser) Lokaal (verwerking op eigen PC)
Setup Niet nodig Omgevingsopbouw (Python, Git etc.) nodig
Ondersteunde talen Meer dan 35 talen Alleen Japans
Stemkeuze Kiezen uit meerdere stemmen Opgeven via cloning, caption of emoji
Limiet per generatie Ondersteunt lange teksten Tot ongeveer 30 seconden
Commercieel gebruik Mogelijk (bronvermelding vereist bij gratis gebruik) Mogelijk (MIT licentie)
Ondersteunde apparaten PC, smartphone, tablet PC (GPU aanbevolen)
Kosten Gratis plan beschikbaar (betaald plan voor meer tekens) Gratis (vanwege lokale werking)

Ter vergelijking: Ondoku is ideaal voor gemak en direct gebruik, terwijl Irodori-TTS geschikt is als je een krachtige PC hebt en de stem tot in detail wilt ontwerpen.

Voor wie direct een stem nodig heeft, meertalige ondersteuning wenst, of op een smartphone of tablet wil werken, is Ondoku de aanrader.

Het is ook geschikt voor wie lange teksten in één keer wil laten voorlezen, geen tijd aan setup wil besteden, of voor wie geen GPU in de PC heeft.

Omdat je door simpelweg je browser te openen direct hoogwaardige spraak kunt genereren, waarom probeer je Ondoku niet eens gratis?

Samenvatting van kenmerken, setup en gebruik van Irodori-TTS

In dit artikel hebben we Irodori-TTS besproken, de lokaal draaiende AI-voorleessoftware die gespecialiseerd is in Japans.

Irodori-TTS is een aantrekkelijke tool voor wie veel aandacht wil besteden aan stemexpressie, dankzij functies zoals voice cloning, stemontwerp via captions en emotiecontrole via emoji.

Echter, de setup en het gebruik zijn gericht op gevorderden, aangezien er een omgeving voor Python en Git moet worden opgebouwd.

Bovendien kost het genereren van spraak op een PC zonder GPU veel tijd.

Voor wie "direct en eenvoudig spraaksynthese wil gebruiken", is "Ondoku", dat puur in de browser werkt, aanbevolen.

Waarom creëer je niet zelf hoogwaardige stemmen met deze eenvoudig te gebruiken, gratis AI-spraaksynthese?

■ AI-spraaksynthesesoftware “Ondoku”

"Ondoku" is een online tekst-naar-spraak-tool die zonder initiële kosten kan worden gebruikt.

  • Ondersteunt ongeveer 50 talen, waaronder Japans, Engels, Chinees, Koreaans, Spaans, Frans en Duits.
  • Beschikbaar vanaf zowel pc als smartphone
  • Geschikt voor zaken, onderwijs, entertainment, enz.
  • Geen installatie vereist, kan direct vanuit uw browser worden gebruikt
  • Ondersteunt ook het voorlezen van afbeeldingen

Om het te gebruiken, voert u eenvoudig tekst in of uploadt u een bestand van de site. Genereer binnen enkele seconden natuurlijke geluidsbestanden. U kunt gratis spraaksynthese gebruiken voor maximaal 5.000 tekens, dus probeer het eerst uit.

Tekst-naar-spraaksoftware "Ondoku" kan elke maand 5000 tekens gratis voorlezen met AI-stem. MP3's kun je eenvoudig downloaden en commercieel gebruik is ook mogelijk. Als u zich gratis aanmeldt, kunt u maandelijks maximaal 5.000 tekens gratis omzetten van tekst naar spraak. Probeer Ondoku nu.
HP: ondoku3.com
Email: ondoku3.com@gmail.com
Gerelateerd artikel