Co je Irodori-TTS? Funkce, omezení a návod k použití přehledně

28. července 2026

Co je Irodori-TTS? Funkce, omezení a návod k použití přehledně


dog

O jaký druh AI softwaru pro předčítání textu se u Irodori-TTS jedná?

Možná i vás zajímá nový AI software pro předčítání textu s názvem „Irodori-TTS“.

V tomto článku srozumitelně vysvětlíme vlastnosti, možnosti, upozornění a způsob použití Irodori-TTS.

Kromě toho pro ty, kteří mají pocit, že „nastavení vypadá složitě“, představíme také metodu syntézy řeči, kterou lze použít ihned bez nutnosti instalace.

Co se v tomto článku dozvíte

  1. O jaký druh softwaru se u Irodori-TTS jedná?
  2. Co Irodori-TTS dokáže a na co si dát pozor
  3. Jak používat Irodori-TTS (od nastavení až po úpravu hlasu)
  4. Doporučená metoda v případě obtížného nastavení prostředí

Co je Irodori-TTS? Vysvětlení japonského AI softwaru pro syntézu řeči

Co je Irodori-TTS? Vysvětlení japonského AI softwaru pro syntézu řeči

Nejprve stručně vysvětlíme vlastnosti Irodori-TTS a o jaký druh AI softwaru pro syntézu řeči se jedná.

Irodori-TTS je AI model pro syntézu řeči běžící lokálně

Irodori-TTS je AI software pro syntézu řeči specializovaný na japonštinu.

Vývojářem je Aratako a software je volně dostupný jako open-source (licence MIT).

Největší vlastností je možnost „lokálního provozu“, kdy syntéza řeči probíhá výhradně na vašem vlastním PC.

Vzhledem k tomu, že veškeré zpracování generování řeči probíhá na lokálním PC, text ani generovaná zvuková data nejsou odesílána na externí servery.

Po prvotním nastavení lze generovat hlas bez připojení k internetu a počet generování není nijak omezen.

K nastavení jsou však zapotřebí programovací nástroje jako Python nebo Git.

Pro rychlý provoz se doporučuje vysoce výkonné PC vybavené GPU (grafickou kartou).

Co Irodori-TTS dokáže a co nedokáže

Co Irodori-TTS dokáže a co nedokáže

Dále vysvětlíme, co Irodori-TTS dokáže a co nikoli.

Co Irodori-TTS dokáže

Protože Irodori-TTS běží v lokálním prostředí, můžete generovat hlas neomezeně a kolikrát chcete.

I v prostředí bez internetového připojení můžete po dokončení prvotního nastavení volně vytvářet hlasy.

K dispozici je několik způsobů, jak instruovat systém k vytvoření hlasu, a pomocí funkce Caption můžete vytvořit kvalitu hlasu podle svých preferencí pouze pomocí textových pokynů.

Kromě toho je možné pomocí Voice Cloning reprodukovat vlastní hlas nebo přidávat emoce pomocí emodži.

Díky licenci MIT je možné generovaný hlas využívat i pro komerční účely.

Upozornění k Irodori-TTS

Na druhou stranu existují i body, na které je dobré si před použitím Irodori-TTS dát pozor.

Délka hlasu vytvořeného najednou je cca 30 sekund

V rámci jednoho generování lze načíst hlas v délce přibližně 30 sekund.

Pokud chcete předčítat dlouhý text, je nutné text rozdělit a generovat jej opakovaně.

Je obtížné dosáhnout přesně takového hlasu nebo způsobu mluvy, jaký si představujete

Irodori-TTS nabízí vysokou míru svobody, ale na druhou stranu neobsahuje žádné výchozí hlasy (základní hlasy).

Proto pokud nezadáte Caption nebo referenční hlas, pohlaví a věk se při každém generování náhodně mění.

Pokud chcete předčítat stále stejným hlasem, musíte nechat systém načíst referenční hlas.

Kromě toho software neobsahuje funkci pro ruční úpravu intonace nebo přízvuku.

Podporovaným jazykem je pouze japonština

Podporovaným jazykem je pouze japonština, cizí jazyky jako angličtina nejsou podporovány.

Je také třeba si dát pozor na to, že občas může dojít k chybném přečtení znaků kandži.

Doporučeno PC s vysokými specifikacemi a GPU

V závislosti na specifikacích PC může generování hlasu trvat delší dobu.

Na PC bez GPU trvá generování i krátkého textu přibližně 1 minutu.

U procesorů základní třídy jako Celeron nebo N100 se domníváme, že praktické využití je obtížné.

Jak používat Irodori-TTS (průběh nastavení)

Nyní stručně vysvětlíme, jak Irodori-TTS používat.

Celkový průběh nastavení je následující:

  1. Instalace potřebného softwaru
  2. Vytvoření pracovní složky
  3. Klonování Irodori-TTS z GitHubu
  4. Instalace potřebných balíčků
  5. Spuštění Irodori-TTS
  6. Načtení AI modelu
  7. Předčítání textu

1. Instalace softwaru potřebného pro Irodori-TTS

Pro nastavení Irodori-TTS je nutná příprava.

Nejprve nainstalujte tyto tři typy:

  • Python 3.10 nebo vyšší: Programovací jazyk
  • Git: Systém pro správu verzí (potřebný pro stažení Irodori-TTS)
  • uv: Správce balíčků pro Python

Chcete-li nainstalovat Python, Git a uv, nejprve klikněte pravým tlačítkem na nabídku Start a klikněte na „Terminál“ (není nutné spouštět jako správce).

Klikněte na „Terminál“

Otevře se obrazovka terminálu (PowerShell).

Terminál (PowerShell)

Na této obrazovce zadejte a spusťte následující příkazy:

winget install --id Git.Git -e

winget install --id=astral-sh.uv -e

Probíhá provádění příkazu

Nyní jsou nainstalovány věci potřebné pro nastavení Irodori-TTS.

※ Python spravuje uv, takže se nainstaluje automaticky během nastavení.

Po instalaci terminál (PowerShell) jednou zavřete a znovu otevřete (aby se projevilo „nastavení cest“).

2. Vytvoření pracovní složky

Dále vytvořte pracovní složku.

Zde bude Irodori-TTS nainstalován.

V tomto případě jsme přímo na disku C vytvořili složku s názvem „irodori-tts“.

Vytvoření pracovní složky

Po vytvoření složky se do ní v terminálu přesuňte.

cd C:\irodori-tts

Přesun do pracovní složky

3. Klonování Irodori-TTS z GitHubu

V terminálu zadejte následující příkaz pro klonování repozitáře Irodori-TTS z GitHubu.

git clone https://github.com/Aratako/Irodori-TTS.git

Klonování repozitáře z GitHubu

Klonování repozitáře proběhne během několika sekund.

Zadejte následující příkaz pro přesun do složky klonovaného repozitáře.

cd Irodori-TTS

Přesun do složky

4. Instalace potřebných balíčků

Zadejte a spusťte následující příkaz pro instalaci balíčků potřebných k provozu Irodori-TTS.

uv sync

Instalace balíčků

Stažení a instalace velkého množství balíčků zabere nějaký čas.

Obrazovka během instalace balíčků

Zde se nainstaluje i samotný Python.

Během stahování a instalace nezavírejte okno terminálu a počkejte.

Vzhledem k tomu, že se stahují soubory o kapacitě téměř 3 GB, doporučujeme provádět nastavení na místě s dobrým připojením k internetu.

5. Spuštění Irodori-TTS

Jakmile skončí stahování a instalace balíčků, nastavení je hotovo.

Spusťte Irodori-TTS.

Zadejte a spusťte následující příkaz a chvíli počkejte na spuštění.

uv run python gradio_app.py --server-name 0.0.0.0 --server-port 7860

Jakmile se v terminálu zobrazí následující, spuštění je dokončeno.

Obrazovka po dokončení spuštění

Running on local URL: http://0.0.0.0:7860

Otevřete webový prohlížeč a přejděte na adresu http://localhost:7860.

Tímto se otevře obrazovka Irodori-TTS (WebUI).

WebUI Irodori-TTS

6. Načtení AI modelu

Klikněte na „Load Model“ pro načtení AI modelu používaného pro předčítání textu.

Load Model

Při prvním použití se po stisknutí tohoto tlačítka spustí stahování AI modelu.

Jakmile se v sekci Model Status (místo ohraničené červeně na dalším obrázku) zobrazí zpráva o dokončení, načítání AI modelu je hotové.

Model Status

7. Předčítání textu v Irodori-TTS

V Irodori-TTS můžete zadávat pokyny ke způsobu předčítání, včetně vyjádření emocí, ale jako příklad si nejprve vyzkoušejme předčítání bez pokynů.

Při posunu dolů uvidíte pole pro zadávání textu, kam vložíte text, který chcete přečíst.

Zadání textu

Tentokrát zkusíme nechat přečíst: „こんにちは、これはイロドリTTSで作成された音声です。“ (Dobrý den, toto je hlas vytvořený v Irodori-TTS.)

(Při zápisu „Irodori-TTS“ latinkou neproběhlo předčítání správně, proto jsme použili zápis v katakaně „イロドリTTS“.)

Stisknutím tlačítka „Generate“ se spustí generování hlasu.

Spuštění generování

Irodori-TTS generuje hlas pomocí CPU nebo GPU (grafické karty) vašeho lokálního PC.

Proto se čas potřebný ke generování výrazně liší v závislosti na výkonu PC.

V tomto případě jsme generování prováděli na notebooku bez GPU, takže generování i tohoto krátkého textu trvalo přibližně 1 minutu.

Reference: Testovací generování proběhlo v prostředí CPU: Ryzen 5 4650U, Paměť: DDR4 32GB, Windows 11 Pro 24H2.

Po dokončení generování se zobrazí křivka hlasu a hlas lze přehrát.

Dokončení generování

Příklad předčítání věty „こんにちは、これはイロドリTTSで作成された音声です。“

Pokud po poslechu není žádný problém, stiskněte tlačítko pro stažení (ikona šipky dolů) a uložte zvukový soubor.

Zvukový soubor se uloží ve formátu WAV.

Tímto jsme úspěšně syntetizovali hlas pomocí Irodori-TTS.

Jak upravit hlas v Irodori-TTS

V Irodori-TTS můžete různými způsoby upravovat pohlaví, emoce a další projevy.

Určení emocí pomocí emodži

Kliknutím na „Emoji Palette“ pod polem pro zadávání textu můžete vybrat emodži.

Emoji Palette

Jednotlivým emodži jsou přiřazeny emoce:

  • 😊 Vesele, radostně
  • 😭 Vzlykání, pláč
  • 😰 Ve spěchu, rozrušeně
  • ⏩ Rychlá mluva
  • 📖 Narativně, monolog

Pouhým vložením emodži do pole pro zadávání textu můžete nechat text přečíst se zadanou emocí.

Příklad předčítání věty „😊 こんにちは、これはイロドリTTSで作成された音声です。“

Příklad předčítání věty „📖 こんにちは、これはイロドリTTSで作成された音声です。“

Upozorňujeme však, že pouhým zadáním emodži nelze konkrétně určit pohlaví nebo věk.

Načtení referenčního hlasu pro předčítání stejným hlasem

V Irodori-TTS můžete nechat načíst referenční zvukový soubor a poté nechat systém předčítat s odkazem na tento hlas.

Referenční hlas se načítá v části, kde je napsáno „Drop Audio Here - or - Click to Upload“ (Sem přetáhněte zvuk - nebo - Klikněte pro nahrání).

Načtení referenčního hlasu

Kromě toho, že můžete předčítat stejným hlasem, můžete ve srovnání se situací bez zadání dosáhnout i čistší kvality zvuku.

Přímá úprava stylu předčítání pomocí funkce Caption

V Irodori-TTS je také možné přímo v textu zadat, jakým hlasem se má předčítat.

Chcete-li použít funkci Caption, musíte spustit verzi „VoiceDesign“ a příkaz pro spuštění Irodori-TTS v terminálu se změní.

uv run python gradio_app_voicedesign.py --server-name 0.0.0.0 --server-port 7861

Spuštění verze VoiceDesign

Spuštěním tohoto příkazu se otevře ovládací obrazovka verze VoiceDesign.

Protože verze VoiceDesign používá jiný AI model než standardní verze, při prvním použití musíte kliknout na „Load Model“ a stáhnout model odděleně od standardní verze.

Kapacita AI modelu je přibližně 2 GB, proto doporučujeme stahování na místě s dobrým internetovým připojením.

Na ovládací obrazovce verze VoiceDesign se nachází textové pole „Caption / Style Prompt (optional)“.

Caption / Style Prompt (optional)

Zde zadáte textem, jakým hlasem si přejete předčítat.

  • Předčítejte prosím klidným ženským hlasem, s pocitem blízkosti, jemně a přirozeně.
  • Mluvte prosím energickým mužským hlasem, jasně a zřetelně.
  • Čtěte prosím věcně jako televizní hlasatel, hlubším mužským hlasem.

Tímto způsobem můžete specifikovat, jakým hlasem se má předčítat.

Například při zadání „Předčítejte prosím klidným ženským hlasem, s pocitem blízkosti, jemně a přirozeně.“ (v japonštině) byl výsledek takovýto:

Příklad se zadáním „Předčítejte prosím klidným ženským hlasem, s pocitem blízkosti, jemně a přirozeně.“

I zde se podařilo vytvořit srozumitelný hlas s čistou kvalitou zvuku.

U funkce Caption je však třeba si dát na jednu věc pozor.

Funkce Caption trvá generování hlasu déle ve srovnání s ostatními metodami.

Při tomto generování na notebooku trvalo generování této krátké věty přibližně 5 minut.

Pro použití funkce Caption doporučujeme vysoce výkonné PC vybavené GPU.

Co se stane, když necháte přečíst anglický text?

Irodori-TTS je software pro předčítání podporující pouze japonštinu.

Co se tedy stane, když zkusíte nechat přečíst anglický text?

Zkusme pro test zadat jednoduchou větu.

Příklad předčítání věty „Hello, this is a voice recording created using Irodori-TTS.“

Jak slyšíte, slovo Hello bylo vysloveno s japonským přízvukem jako „Haró“ a část recording byla nesrozumitelná, takže se předčítání nepodařilo provést správně.

Pokud chcete nechat předčítat anglický text, doporučujeme použít službu AI předčítání podporující cizí jazyky.

Doporučená metoda syntézy řeči, když je „nastavení příliš složité“

Po dočtení až sem možná někteří z vás pocítili, že nastavení Irodori-TTS vypadá poněkud náročně.

Pokud nejste zvyklí na práci v terminálu, jen samotná příprava nástrojů jako Python a Git, instalace balíčků a stahování AI modelu zabere spoustu času.

Navíc pokud nemáte PC vybavené GPU, trvá jedno generování hlasu příliš dlouho, což ztěžuje jeho použití pro účely jako je dabing videí.

Dlouhé texty je nutné rozdělit na části po přibližně 30 sekundách a hlas generovat opakovaně.

Pro ty, kteří chtějí vytvářet hlas z textu bez nutnosti instalace a nastavování, představíme nyní službu AI syntézy řeči použitelnou v prohlížeči.

『Ondoku』: AI hlas použitelný bez nutnosti instalace

Ondoku

Pokud chcete snadno syntetizovat řeč pomocí nejnovější AI, doporučujeme službu AI syntézy řeči 『Ondoku』.

『Ondoku』 je služba AI syntézy řeči, kde stačí otevřít prohlížeč a vložit text.

Hlas můžete zdarma vytvořit ihned na PC, chytrém telefonu nebo tabletu.

Generování hlasu probíhá v cloudu (na straně serveru), takže nevadí, i když vaše PC nemá GPU.

K dispozici jsou předem připravené různé hlasy jako mužský, ženský nebo dětský hlas, takže můžete ihned předčítat pouhým výběrem, aniž byste museli připravovat referenční hlasy nebo Caption.

Dlouhé texty lze také předčítat vcelku.

A navíc Ondoku podporuje i angličtinu!

Podporuje mnoho jazyků včetně francouzštiny, španělštiny, korejštiny a čínštiny, takže jej lze použít i pro předčítání v jiných jazycích než v japonštině.

Navíc s AI hlasem nové generace (OndokuBeta) můžete zažít ještě přirozenější předčítání.

Pokud hledáte způsob, jak nechat přečíst text jako hlas, proč nevyzkoušet 『Ondoku』, který lze snadno používat zdarma?

Porovnání rozdílů mezi Ondoku a Irodori-TTS

Na závěr porovnáme hlavní rozdíly mezi Ondoku a Irodori-TTS.

👆 Lze posouvat do stran
Položka Ondoku Irodori-TTS
Způsob provozu Cloud (ovládání v prohlížeči) Lokální (zpracování na vlastním PC)
Nastavení Není nutné Nutné vytvoření prostředí (Python, Git atd.)
Podporované jazyky Více než 35 jazyků Pouze japonština
Výběr hlasu Pouhý výběr z více hlasů Určení pomocí Voice Cloning, Caption, emodži
Limit jednoho generování Podporuje dlouhé texty Cca do 30 sekund
Komerční využití Možné (u bezplatného využití nutné uvedení kreditu) Možné (licence MIT)
Podporovaná zařízení PC, chytrý telefon, tablet PC (doporučeno GPU)
Cena K dispozici bezplatný plán (placené plány pro zvýšení počtu znaků) Zdarma (díky lokálnímu provozu)

Při porovnání lze říci, že Ondoku se hodí pro jednoduchost a okamžité použití, zatímco Irodori-TTS je vhodné, pokud máte výkonné PC a chcete si s hlasem detailně vyhrát.

Pro ty, kteří chtějí hlas ihned, potřebují předčítání ve více jazycích nebo chtějí službu používat na chytrém telefonu či tabletu, doporučujeme Ondoku.

Je vhodné i pro ty, kteří chtějí nechat přečíst dlouhé texty vcelku, nechtějí trávit čas nastavováním nebo jejich PC není vybaveno GPU.

Stačí otevřít prohlížeč a můžete okamžitě generovat vysoce kvalitní hlas, tak proč nezačít používat Ondoku zdarma právě teď?

Shrnutí vlastností, nastavení a použití Irodori-TTS

V tomto článku jsme vysvětlili Irodori-TTS, lokálně běžící AI software pro syntézu řeči specializovaný na japonštinu.

Irodori-TTS je atraktivní nástroj pro ty, kteří si chtějí zakládat na hlasovém projevu, a to díky funkcím jako Voice Cloning, design kvality hlasu pomocí Caption nebo ovládání emocí pomocí emodži.

Způsob nastavení a použití je však určen spíše pro pokročilé uživatele a vyžaduje vytvoření prostředí pro Python a Git.

Navíc na PC bez GPU trvá generování hlasu dlouho.

Pro ty, kteří chtějí „používat syntézu řeči snadno a hned“, doporučujeme 『Ondoku』, který lze používat pouze v prohlížeči.

Proč nezkusit vytvořit vysoce kvalitní hlas i vy pomocí této snadno použitelné bezplatné AI syntézy řeči?

■ Software pro syntézu řeči AI „Ondoku“

„Ondoku“ je online nástroj pro převod textu na řeč, který lze používat bez počátečních nákladů.

  • Podporuje přibližně 50 jazyků včetně japonštiny, angličtiny, čínštiny, korejštiny, španělštiny, francouzštiny a němčiny.
  • Dostupné z PC i smartphonu
  • Vhodné pro podnikání, vzdělávání, zábavu atd.
  • Není nutná žádná instalace, lze jej použít okamžitě z vašeho prohlížeče
  • Podporuje také čtení z obrázků

Chcete-li jej použít, jednoduše zadejte text nebo nahrajte soubor z webu. Vytvářejte přirozené zvukové soubory během několika sekund. Syntézu řeči můžete použít zdarma až pro 5 000 znaků, proto ji nejprve vyzkoušejte.

Software pro převod textu na řeč „Ondoku“ dokáže každý měsíc přečíst 5 000 znaků pomocí hlasu AI zdarma. Můžete si snadno stáhnout MP3 a možné je i komerční využití. Pokud se zaregistrujete zdarma, můžete zdarma převést až 5 000 znaků za měsíc z textu na řeč. Vyzkoušejte Ondoku nyní.
HP: ondoku3.com
Email: ondoku3.com@gmail.com
Související článek

Software pro čtení textu Ondoku. Jedná se o službu převodu textu na řeč, která nevyžaduje instalaci a může ji používat kdokoli zdarma. Pokud se zaregistrujete zdarma, můžete každý měsíc získat zdarma až 5000 znaků. Zaregistrujte se nyní zdarma