Irodori-TTS: Co to jest? Funkcje, instalacja i instrukcja obsługi
28 lipca 2026
Jakim oprogramowaniem AI do syntezy mowy jest Irodori-TTS?
Wiele osób prawdopodobnie zastanawia się nad nowym oprogramowaniem AI do syntezy mowy „Irodori-TTS”.
W tym artykule wyjaśnimy w przystępny sposób charakterystykę, możliwości, uwagi oraz sposób użycia Irodori-TTS.
Dodatkowo, dla osób, dla których „konfiguracja wydaje się trudna”, przedstawiamy metodę syntezy głosu, z której można korzystać od razu bez konieczności instalacji.
Czego dowiesz się z tego artykułu
- Co to za oprogramowanie Irodori-TTS?
- Możliwości i uwagi dotyczące Irodori-TTS
- Jak używać Irodori-TTS (od konfiguracji po regulację dźwięku)
- Polecana metoda w przypadku trudności z budową środowiska
Co to jest Irodori-TTS? Wyjaśnienie japońskiego oprogramowania AI do syntezy mowy
Na początek krótko wyjaśnimy, jakim oprogramowaniem AI do syntezy mowy jest Irodori-TTS i jakie są jego cechy.
Irodori-TTS to model syntezy mowy AI działający lokalnie
Irodori-TTS to oprogramowanie AI do syntezy mowy wyspecjalizowane w języku japońskim.
Deweloperem jest Aratako, a oprogramowanie zostało udostępnione za darmo jako open source (licencja MIT).
Największą cechą jest możliwość „działania lokalnego”, co oznacza, że synteza mowy odbywa się wyłącznie na Twoim komputerze.
Cały proces generowania dźwięku odbywa się na komputerze użytkownika, więc tekst ani wygenerowane dane głosowe nie są przesyłane na zewnętrzne serwery.
Po wstępnej konfiguracji można generować dźwięk bez połączenia z Internetem, a liczba generowań nie jest ograniczona.
Jednak do konfiguracji wymagane są narzędzia programistyczne, takie jak Python czy Git.
Ponadto do szybkiego działania zalecany jest wysokowydajny komputer wyposażony w GPU (kartę graficzną).
Co można, a czego nie można zrobić w Irodori-TTS
Następnie wyjaśnimy, co można, a czego nie można zrobić za pomocą Irodori-TTS.
Co można zrobić w Irodori-TTS
Ponieważ Irodori-TTS działa w środowisku lokalnym, można generować dźwięk dowolną liczbę razy bez ograniczeń.
Nawet w środowisku bez dostępu do Internetu, po zakończeniu wstępnej konfiguracji, można swobodnie tworzyć głosy.
Istnieje wiele sposobów instruowania, jaki dźwięk ma zostać utworzony, a dzięki funkcji captioning można stworzyć pożądaną jakość głosu za pomocą samych instrukcji tekstowych.
Możliwe jest również odwzorowanie posiadanego głosu poprzez klonowanie głosu lub dodawanie ekspresji emocjonalnej za pomocą emoji.
Dzięki licencji MIT wygenerowany dźwięk może być używany komercyjnie.
Uwagi dotyczące Irodori-TTS
Z drugiej strony istnieją pewne kwestie dotyczące Irodori-TTS, o których warto wiedzieć przed użyciem.
Jednorazowo można utworzyć dźwięk o długości do ok. 30 sekund
W jednym procesie generowania można odczytać tekst o długości do około 30 sekund.
Jeśli chcesz odczytać długi tekst, musisz go podzielić i generować dźwięk wielokrotnie.
Trudno uzyskać dokładnie taki głos i sposób mówienia, jak się zamierzało
Irodori-TTS oferuje dużą swobodę, ale w zamian nie posiada przygotowanych domyślnych głosów (głosów bazowych).
Z tego powodu, jeśli nie określisz caption lub dźwięku referencyjnego, płeć i wiek będą zmieniać się losowo przy każdym generowaniu.
Jeśli chcesz czytać tym samym głosem, musisz wczytać dźwięk referencyjny.
Ponadto nie ma funkcji ręcznej regulacji akcentu ani intonacji.
Obsługiwany język to wyłącznie japoński
Obsługiwany jest tylko język japoński; oprogramowanie nie obsługuje języków obcych, takich jak angielski.
Należy również pamiętać, że mogą wystąpić błędy w odczytywaniu znaków kanji.
Zalecany komputer o wysokiej specyfikacji z GPU
W zależności od specyfikacji komputera generowanie dźwięku może zająć dużo czasu.
Na komputerach bez GPU generowanie nawet krótkiego tekstu zajmuje około 1 minuty.
W przypadku procesorów klasy podstawowej, takich jak Celeron czy N100, uważamy, że praktyczne zastosowanie jest trudne.
Jak używać Irodori-TTS (Przebieg konfiguracji)
W tej części krótko wyjaśnimy, jak używać Irodori-TTS.
Ogólny przebieg konfiguracji jest następujący:
- Zainstaluj niezbędne oprogramowanie
- Utwórz folder roboczy
- Sklonuj Irodori-TTS z GitHub
- Zainstaluj niezbędne pakiety
- Uruchom Irodori-TTS
- Wczytaj model AI
- Odczytaj tekst
1. Zainstaluj oprogramowanie niezbędne dla Irodori-TTS
Konfiguracja Irodori-TTS wymaga przygotowań.
Najpierw zainstaluj te trzy rodzaje oprogramowania:
- Python 3.10 lub nowszy: język programowania
- Git: system kontroli wersji (niezbędny do pobrania Irodori-TTS)
- uv: menedżer pakietów Python
Aby zainstalować Python, Git i uv, najpierw kliknij prawym przyciskiem myszy menu Start i wybierz „Terminal” (nie ma potrzeby uruchamiania jako administrator).
Otworzy się okno terminala (PowerShell).
W tym oknie wpisz i wykonaj następujące polecenia:
winget install --id Git.Git -e
winget install --id=astral-sh.uv -e
W ten sposób zainstalowałeś elementy niezbędne do konfiguracji Irodori-TTS.
*Python jest zarządzany przez uv, więc zostanie zainstalowany automatycznie podczas konfiguracji.
Po instalacji zamknij terminal (PowerShell) i otwórz go ponownie (aby „odświeżyć ścieżki”).
2. Utwórz folder roboczy
Następnie utwórz folder roboczy.
To tutaj zostanie zainstalowany Irodori-TTS.
W tym przykładzie utworzyliśmy folder o nazwie „irodori-tts” bezpośrednio na dysku C.
Po utworzeniu folderu przejdź do niego w terminalu.
cd C:\irodori-tts
3. Sklonuj Irodori-TTS z GitHub
Wpisz poniższe polecenie w terminalu, aby sklonować repozytorium Irodori-TTS z GitHub.
git clone https://github.com/Aratako/Irodori-TTS.git
Klonowanie repozytorium potrwa zaledwie kilka sekund.
Wpisz następujące polecenie, aby przejść do folderu sklonowanego repozytorium:
cd Irodori-TTS
4. Zainstaluj niezbędne pakiety
Wpisz i wykonaj poniższe polecenie, aby zainstalować pakiety niezbędne do działania Irodori-TTS.
uv sync
Pobieranie i instalowanie dużej liczby pakietów zajmie trochę czasu.
W tym miejscu zostanie zainstalowany również sam Python.
Podczas pobierania i instalowania poczekaj, nie zamykając okna terminala.
Pobierane są pliki o rozmiarze blisko 3 GB, dlatego zaleca się konfigurację w miejscu z dobrym połączeniem internetowym.
5. Uruchom Irodori-TTS
Gdy pobieranie i instalacja pakietów dobiegną końca, konfiguracja jest gotowa.
Uruchom Irodori-TTS.
Wpisz i wykonaj poniższe polecenie, a następnie poczekaj chwilę na uruchomienie.
uv run python gradio_app.py --server-name 0.0.0.0 --server-port 7860
Gdy w terminalu pojawi się poniższy komunikat, uruchamianie zostało zakończone.
Running on local URL: http://0.0.0.0:7860
Otwórz przeglądarkę internetową i wejdź na stronę http://localhost:7860.
Otworzy się ekran Irodori-TTS (WebUI), jak pokazano poniżej.
6. Wczytaj model AI
Aby wczytać model AI używany do odczytywania tekstu, kliknij „Load Model”.
Przy pierwszym użyciu kliknięcie tego przycisku rozpocznie pobieranie modelu AI.
Gdy w sekcji Model Status (miejsce zaznaczone na czerwono na poniższym obrazku) pojawi się komunikat o zakończeniu, model AI został wczytany.
7. Odczytaj tekst w Irodori-TTS
W Irodori-TTS można wydawać instrukcje dotyczące sposobu odczytywania, w tym ekspresji emocjonalnej, ale najpierw spróbujmy odczytać tekst bez instrukcji jako przykład.
Przewiń w dół do pola wprowadzania tekstu i wpisz zdanie, które chcesz odczytać.
Tym razem spróbujemy odczytać: „こんにちは、これはイロドリTTSで作成された音声です。” (Witaj, to jest głos utworzony w Irodori-TTS).
(Ponieważ zapis alfabetem „Irodori-TTS” nie był poprawnie odczytywany, użyliśmy zapisu katakaną „イロドリTTS”).
Kliknięcie przycisku „Generate” rozpocznie generowanie dźwięku.
Irodori-TTS wykorzystuje procesor CPU lub kartę graficzną GPU Twojego komputera do generowania dźwięku.
Z tego powodu czas generowania różni się znacznie w zależności od wydajności komputera.
W tym przypadku generowaliśmy dźwięk na laptopie bez GPU, więc mimo krótkiego zdania zajęło to około 1 minuty.
Odniesienie: Testowe generowanie przeprowadzono w środowisku CPU: Ryzen 5 4650U Pamięć: DDR4 32GB Windows 11 Pro 24H2.
Po zakończeniu generowania pojawi się przebieg fali dźwiękowej i będzie można odtworzyć dźwięk.
Przykład odczytania: „Witaj, to jest głos utworzony w Irodori-TTS.”
Jeśli odsłuchany dźwięk jest poprawny, kliknij przycisk pobierania (ikona strzałki w dół), aby zapisać plik audio.
Plik audio zostanie zapisany w formacie WAV.
W ten sposób udało się zsyntetyzować głos za pomocą Irodori-TTS.
Jak regulować dźwięk w Irodori-TTS
W Irodori-TTS można regulować ekspresję, taką jak płeć czy emocje, na różne sposoby.
Określanie ekspresji emocjonalnej za pomocą emoji
Kliknięcie „Emoji Palette” pod polem tekstowym pozwala wybrać emoji.
Do poszczególnych emoji przypisane są konkretne ekspresje emocjonalne.
- 😊 Radośnie, wesoło
- 😭 Łkanie, płacz
- 😰 W pośpiechu, zdenerwowanie
- ⏩ Szybkie mówienie
- 📖 Narracja, monolog
Wystarczy wstawić emoji do pola tekstowego, aby odczytać tekst z określoną ekspresją emocjonalną.
Przykład odczytania: „😊 Witaj, to jest głos utworzony w Irodori-TTS.”
Przykład odczytania: „📖 Witaj, to jest głos utworzony w Irodori-TTS.”
Należy jednak pamiętać, że samo określenie emoji nie pozwala na konkretne wskazanie płci czy wieku.
Wczytywanie dźwięku referencyjnego, aby czytać tym samym głosem
W Irodori-TTS można wczytać plik dźwięku referencyjnego i sprawić, by oprogramowanie czytało tekst, wzorując się na tym głosie.
Dźwięk referencyjny wczytuje się w sekcji opisanej jako „Upuść dźwięk tutaj - lub - Kliknij, aby przesłać”.
Pozwala to nie tylko na czytanie tym samym głosem, ale także na uzyskanie wyraźniejszej jakości dźwięku w porównaniu do sytuacji, gdy nic nie zostanie określone.
Możliwa jest również bezpośrednia regulacja stylu odczytywania za pomocą funkcji captioning
W Irodori-TTS można również bezpośrednio określić tekstowo, jakim głosem ma zostać odczytany tekst.
Aby korzystać z funkcji captioning, należy uruchomić „wersję VoiceDesign”, co zmienia polecenie uruchamiania Irodori-TTS w terminalu.
uv run python gradio_app_voicedesign.py --server-name 0.0.0.0 --server-port 7861
Wykonanie tego polecenia uruchomi interfejs wersji VoiceDesign.
Wersja VoiceDesign używa innego modelu AI niż wersja standardowa, więc przy pierwszym użyciu należy kliknąć „Load Model” i pobrać model oddzielnie od wersji standardowej.
Rozmiar modelu AI wynosi około 2 GB, więc zaleca się pobieranie w miejscu z dobrym połączeniem internetowym.
W interfejsie wersji VoiceDesign znajduje się pole tekstowe „Caption / Style Prompt (optional)”.
Tutaj wpisz zdanie opisujące, jakim głosem ma zostać odczytany tekst.
- Proszę przeczytać spokojnym kobiecym głosem, w sposób bliski, miękki i naturalny.
- Proszę mówić energicznym męskim głosem, jasno i wyraźnie.
- Proszę czytać niskim męskim głosem, beznamiętnie jak prezenter wiadomości.
W ten sposób można określić, jakim głosem ma zostać wykonane odczytywanie.
Na przykład przy instrukcji „Proszę przeczytać spokojnym kobiecym głosem, w sposób bliski, miękki i naturalny.” otrzymaliśmy następujący dźwięk.
Przykład określenia: „Proszę przeczytać spokojnym kobiecym głosem, w sposób bliski, miękki i naturalny.”
Udało się uzyskać wyraźny i łatwo zrozumiały głos.
Należy jednak pamiętać o pewnej uwadze dotyczącej funkcji captioning.
Funkcja captioning zajmuje więcej czasu na generowanie dźwięku w porównaniu do innych metod odczytywania.
Podczas generowania na tym laptopie, stworzenie tego krótkiego zdania zajęło około 5 minut.
Do korzystania z funkcji captioning zaleca się komputer o wysokiej specyfikacji wyposażony w GPU.
Co się dzieje przy odczytywaniu tekstu w języku angielskim?
Irodori-TTS to oprogramowanie do odczytywania obsługujące wyłącznie język japoński.
Zatem co się stanie, jeśli spróbujemy odczytać tekst w języku angielskim?
Spróbujmy wpisać prosty przykładowy tekst.
Przykład odczytania: „Hello, this is a voice recording created using Irodori-TTS.”
W tym przypadku „Hello” zostało wymówione z japońskim akcentem jako „Harō”, a część „recording” stała się niezrozumiała, więc poprawne odczytanie nie było możliwe.
Jeśli chcesz odczytywać tekst w języku angielskim, zaleca się korzystanie z usług AI do syntezy mowy obsługujących języki obce.
Polecana metoda syntezy głosu, gdy „konfiguracja jest trudna”
Po przeczytaniu powyższych informacji, część osób mogła odnieść wrażenie, że konfiguracja Irodori-TTS wydaje się dość trudna.
Dla osób nieprzyzwyczajonych do obsługi terminala, same kroki przygotowania narzędzi takich jak Python i Git, instalacja pakietów i pobieranie modeli AI mogą zająć dużo czasu.
Ponadto, jeśli nie posiadasz komputera z GPU, pojedyncza synteza głosu zajmuje zbyt wiele czasu, co utrudnia wykorzystanie jej do celów takich jak narracja wideo.
Długie teksty muszą być dzielone na około 30-sekundowe fragmenty i generowane wielokrotnie.
Dla osób, które chcą tworzyć głos z tekstu bez instalacji i konfiguracji, przedstawiamy usługę AI do syntezy mowy dostępną w przeglądarce.
„Ondoku” – głos AI dostępny bez konieczności instalacji
Jeśli chcesz łatwo zsyntetyzować głos za pomocą najnowszej sztucznej inteligencji, polecamy usługę AI do syntezy mowy Ondoku.
Ondoku to usługa AI do syntezy mowy, która pozwala na tworzenie głosu poprzez samo otwarcie przeglądarki i wklejenie tekstu.
Możesz natychmiastowo tworzyć głos za darmo na komputerze, smartfonie lub tablecie.
Generowanie dźwięku odbywa się w chmurze (po stronie serwera), więc nie ma znaczenia, czy Twój komputer posiada GPU.
Ponieważ od samego początku dostępnych jest wiele głosów, takich jak męskie, żeńskie czy dziecięce, możesz natychmiastowo odczytywać tekst poprzez ich wybór, bez konieczności przygotowywania dźwięku referencyjnego czy caption.
Długie teksty mogą być odczytywane bez podziału.
Co więcej, Ondoku obsługuje również język angielski!
Obsługuje wiele języków, w tym francuski, hiszpański, koreański i chiński, więc może być używany do odczytywania tekstów innych niż japoński.
Ponadto dzięki głosom AI nowej generacji (OndokuBeta) możesz doświadczyć jeszcze bardziej naturalnego odczytywania.
Jeśli szukasz sposobu na odczytywanie tekstu jako głosu, dlaczego nie wypróbować Ondoku, z którego można korzystać łatwo i za darmo?
Porównanie różnic między Ondoku a Irodori-TTS
Na koniec porównujemy główne różnice między Ondoku a Irodori-TTS.
| Projekt | Ondoku | Irodori-TTS |
|---|---|---|
| Metoda działania | Chmura (przez przeglądarkę) | Lokalnie (przetwarzanie na własnym komputerze) |
| Konfiguracja | Niepotrzebna | Wymaga budowy środowiska Python, Git itp. |
| Obsługiwane języki | Ponad 35 języków | Tylko japoński |
| Wybór głosu | Wybór spośród wielu głosów | Klonowanie głosu, caption, emoji |
| Limit pojedynczego generowania | Obsługuje długie teksty | Do ok. 30 sekund |
| Użycie komercyjne | Możliwe (przy darmowym planie wymagany kredyt) | Możliwe (licencja MIT) |
| Obsługiwane urządzenia | Komputer, smartfon, tablet | Komputer (zalecany GPU) |
| Cena | Dostępny plan darmowy (plany płatne zwiększają liczbę znaków) | Darmowe (działa lokalnie) |
Porównując, Ondoku wygrywa pod względem łatwości i natychmiastowej gotowości do użycia, natomiast Irodori-TTS jest odpowiedni, jeśli posiadasz wysokowydajny komputer i chcesz szczegółowo dopracować głos.
Dla osób, które potrzebują głosu „na już”, potrzebują odczytywania w wielu językach lub chcą korzystać z narzędzia na smartfonie lub tablecie, polecamy Ondoku.
Jest on również odpowiedni dla tych, którzy chcą czytać długie teksty bez podziału, nie chcą poświęcać czasu na konfigurację lub nie posiadają GPU w komputerze.
Ponieważ wysokiej jakości dźwięk można wygenerować po prostu otwierając przeglądarkę, dlaczego nie zacząć od bezpłatnego wypróbowania Ondoku?
Podsumowanie charakterystyki, konfiguracji i sposobu użycia Irodori-TTS
W tym artykule wyjaśniliśmy działające lokalnie oprogramowanie AI do syntezy mowy wyspecjalizowane w języku japońskim – Irodori-TTS.
Irodori-TTS to atrakcyjne narzędzie dla osób, które chcą dbać o ekspresję głosową, oferujące klonowanie głosu, projektowanie jakości głosu za pomocą caption oraz kontrolę emocji za pomocą emoji.
Jednak metoda konfiguracji i sposób użycia są przeznaczone dla zaawansowanych użytkowników, wymagając budowy środowiska Python czy Git.
Ponadto na komputerach bez GPU generowanie dźwięku zajmuje dużo czasu.
Osobom, które chcą „łatwo korzystać z syntezy mowy już teraz”, polecamy Ondoku, z którego można korzystać wyłącznie w przeglądarce.
Dlaczego nie spróbujesz stworzyć wysokiej jakości dźwięku za pomocą tej łatwej w użyciu i darmowej syntezy głosu AI?
■ Oprogramowanie do syntezy mowy AI „Ondoku”
„Ondoku” to internetowe narzędzie do zamiany tekstu na mowę, z którego można korzystać bez żadnych kosztów początkowych.
- Obsługuje około 50 języków, w tym japoński, angielski, chiński, koreański, hiszpański, francuski i niemiecki.
- Dostępne zarówno z komputera, jak i smartfona
- Nadaje się do biznesu, edukacji, rozrywki itp.
- Nie wymaga instalacji, można z niej korzystać bezpośrednio w przeglądarce
- Obsługuje również odczyt z obrazów
Aby z niego skorzystać, wystarczy wpisać tekst lub przesłać plik ze strony. Generuj naturalne pliki dźwiękowe w ciągu kilku sekund. Możesz bezpłatnie używać syntezy mowy do 5000 znaków, więc wypróbuj ją najpierw.
Email: ondoku3.com@gmail.com
Oprogramowanie do czytania tekstu Ondoku. Jest to usługa zamiany tekstu na mowę, która nie wymaga instalacji i może być używana przez każdego za darmo. Jeśli zarejestrujesz się za darmo, co miesiąc możesz otrzymać do 5000 znaków za darmo. Zarejestruj się teraz za darmo
- Co to jest Ondoku?
- Przeczytaj tekst na Ondoku
- Darmowa rejestracja
- Plan cenowy
- Lista artykułów
- Wypróbuj inne bezpłatne usługi