Cos'è Irodori-TTS? Funzioni, limitazioni e guida all'uso
28 Luglio 2026
Che tipo di software di sintesi vocale AI è Irodori-TTS?
Probabilmente molti di voi sono curiosi di conoscere il nuovo software di sintesi vocale AI "Irodori-TTS".
In questo articolo spiegheremo in modo semplice le caratteristiche, cosa può fare, i punti di attenzione e come utilizzare Irodori-TTS.
Inoltre, per chi pensa che "il setup sembri difficile", presenteremo anche un metodo di sintesi vocale utilizzabile immediatamente senza installazione.
Cosa imparerai in questo articolo
- Che tipo di software è Irodori-TTS?
- Cosa si può fare con Irodori-TTS e punti di attenzione
- Come usare Irodori-TTS (dal setup alla regolazione della voce)
- Metodo consigliato quando la configurazione dell'ambiente è difficile
Cos'è Irodori-TTS? Spiegazione del software di sintesi vocale AI giapponese
Innanzitutto, spiegheremo brevemente che tipo di software di sintesi vocale AI è Irodori-TTS e le sue caratteristiche.
Irodori-TTS è un modello di sintesi vocale AI che funziona in locale
Irodori-TTS è un software di sintesi vocale AI specializzato per la lingua giapponese.
Lo sviluppatore è Aratako ed è rilasciato gratuitamente come open source (licenza MIT).
La caratteristica principale è la possibilità di "funzionamento locale", in cui la sintesi vocale viene completata interamente sul proprio PC.
Poiché tutto il processo di generazione della voce avviene sul proprio PC, i testi o i dati vocali generati non vengono mai inviati a server esterni.
Dopo il setup iniziale, è possibile generare voci senza connessione internet e non ci sono limiti al numero di generazioni.
Tuttavia, per il setup sono necessari strumenti di programmazione come Python e Git.
Inoltre, per un funzionamento rapido, è consigliato un PC ad alte prestazioni dotato di GPU (scheda grafica).
Cosa si può e non si può fare con Irodori-TTS
Successivamente, spiegheremo cosa è possibile fare e cosa no con Irodori-TTS.
Cosa si può fare con Irodori-TTS
Poiché Irodori-TTS funziona in un ambiente locale, è possibile generare voci illimitatamente e quante volte si desidera.
Anche in ambienti senza connessione internet, una volta terminato il setup iniziale, è possibile creare voci liberamente.
Sono disponibili diversi modi per istruire il software su quale tipo di voce creare; utilizzando la funzione caption, è possibile creare il timbro vocale preferito solo tramite istruzioni testuali.
Inoltre, è possibile riprodurre voci esistenti tramite il cloning vocale o aggiungere espressioni emotive utilizzando le emoji.
Essendo sotto licenza MIT, è possibile anche l'uso commerciale delle voci generate.
Punti di attenzione di Irodori-TTS
D'altra parte, ci sono alcuni punti di attenzione da conoscere prima di utilizzare Irodori-TTS.
La voce generabile per singola sessione è di circa 30 secondi
Ogni singola generazione può leggere fino a circa 30 secondi.
Se si desidera leggere testi lunghi, è necessario dividere il testo e generarlo più volte.
È difficile ottenere esattamente la voce o il modo di parlare desiderato
Data l'elevata flessibilità di Irodori-TTS, non sono fornite voci predefinite (voci di base).
Per questo motivo, se non si specificano caption o audio di riferimento, il genere o l'età potrebbero cambiare casualmente a ogni generazione.
Quando si desidera leggere con la stessa voce, è necessario caricare un audio di riferimento.
Inoltre, non è presente una funzione per regolare manualmente l'inflessione o l'intonazione.
La lingua supportata è solo il giapponese
La lingua supportata è esclusivamente il giapponese; lingue straniere come l'inglese non sono supportate.
Inoltre, possono verificarsi errori di lettura dei kanji, quindi è necessaria attenzione.
Consigliato PC ad alte prestazioni con GPU
A seconda delle specifiche del PC, la generazione della voce potrebbe richiedere tempo.
Sui PC non dotati di GPU, la generazione di anche un breve testo può richiedere circa un minuto.
Con CPU di fascia entry-level come Celeron o N100, l'uso pratico risulta difficile.
Come usare Irodori-TTS (Flusso del setup)
Di seguito, spiegheremo brevemente come utilizzare Irodori-TTS.
Il flusso generale del setup è il seguente:
- Installare i software necessari
- Creare una cartella di lavoro
- Clonare Irodori-TTS da GitHub
- Installare i pacchetti necessari
- Avviare Irodori-TTS
- Caricare il modello AI
- Leggere il testo
1. Installare i software necessari per Irodori-TTS
Per configurare Irodori-TTS è necessaria una preparazione preliminare.
Per prima cosa, installare questi tre tipi di software:
- Python 3.10 o superiore: linguaggio di programmazione
- Git: sistema di controllo versione (necessario per scaricare Irodori-TTS)
- uv: gestore di pacchetti per Python
Per installare Python, Git e uv, fare clic con il pulsante destro del mouse sul menu Start e selezionare "Terminale" (non è necessario avviarlo come amministratore).
Si aprirà la schermata del terminale (PowerShell).
In questa schermata, inserire ed eseguire i seguenti comandi:
winget install --id Git.Git -e
winget install --id=astral-sh.uv -e
In questo modo sono stati installati i componenti necessari per configurare Irodori-TTS.
*Python sarà gestito da uv, quindi verrà installato automaticamente durante il setup.
Dopo l'installazione, chiudere il terminale (PowerShell) e riaprirlo (per aggiornare il PATH).
2. Creare una cartella di lavoro
Successivamente, creare una cartella di lavoro.
Qui verrà installato Irodori-TTS.
In questo esempio, abbiamo creato una cartella chiamata "irodori-tts" direttamente nel disco C.
Una volta creata la cartella, spostarsi in essa tramite il terminale.
cd C:\irodori-tts
3. Clonare Irodori-TTS da GitHub
Inserire il seguente comando nel terminale per clonare il repository di Irodori-TTS da GitHub.
git clone https://github.com/Aratako/Irodori-TTS.git
La clonazione del repository terminerà in pochi secondi.
Inserire il seguente comando per spostarsi nella cartella del repository clonato.
cd Irodori-TTS
4. Installare i pacchetti necessari
Inserire ed eseguire il seguente comando per installare i pacchetti necessari al funzionamento di Irodori-TTS.
uv sync
L'operazione richiederà tempo poiché verranno scaricati e installati molti pacchetti.
In questa fase verrà installato anche Python stesso.
Attendere senza chiudere la schermata del terminale durante il download e l'installazione.
Verranno scaricati file per una dimensione totale di quasi 3GB, quindi si consiglia di eseguire il setup in un luogo con una buona connessione internet.
5. Avviare Irodori-TTS
Una volta terminato il download e l'installazione dei pacchetti, il setup è completo.
Avviare Irodori-TTS.
Inserire ed eseguire il seguente comando e attendere qualche istante per l'avvio.
uv run python gradio_app.py --server-name 0.0.0.0 --server-port 7860
L'avvio è completato quando sul terminale appare quanto segue:
Running on local URL: http://0.0.0.0:7860
Aprire un browser web e accedere a http://localhost:7860.
Si aprirà la schermata (WebUI) di Irodori-TTS.
6. Caricare il modello AI
Fare clic su "Load Model" per caricare il modello AI da utilizzare per la lettura del testo.
Al primo utilizzo, premendo questo pulsante inizierà il download del modello AI.
Quando apparirà un messaggio di completamento nel Model Status (l'area evidenziata in rosso nell'immagine successiva), il caricamento del modello AI sarà terminato.
7. Leggere il testo con Irodori-TTS
Con Irodori-TTS è possibile fornire istruzioni sulla modalità di lettura, incluse le espressioni emotive, ma come primo esempio proviamo a leggere senza istruzioni.
Scorrendo verso il basso si trova il campo di inserimento testo; inserire la frase che si desidera far leggere.
In questo caso proveremo a far leggere: "こんにちは、これはイロドリTTSで作成された音声です。" (Buongiorno, questa è una voce creata con Irodori-TTS).
(Poiché scrivendo "Irodori-TTS" in alfabeto la lettura non era corretta, abbiamo usato il katakana "イロドリTTS").
Premendo il pulsante "Generate", inizierà la generazione della voce.
Irodori-TTS utilizza la CPU o la GPU (scheda grafica) del PC locale per generare la voce.
Pertanto, il tempo necessario per la generazione varia notevolmente in base alle prestazioni del PC.
In questo caso, avendo generato su un notebook senza GPU, per una frase breve è stato necessario circa un minuto.
Riferimento: Test di generazione effettuato in ambiente CPU: Ryzen 5 4650U, Memoria: DDR4 32GB, Windows 11 Pro 24H2.
Al termine della generazione, verrà visualizzata la forma d'onda dell'audio e sarà possibile riprodurlo.
Esempio di lettura di: "こんにちは、これはイロドリTTSで作成された音声です。"
Se l'ascolto è soddisfacente, premere il pulsante di download (l'icona con la freccia verso il basso) per salvare il file audio.
Il file audio verrà salvato in formato WAV.
In questo modo, è stato possibile sintetizzare una voce utilizzando Irodori-TTS.
Come regolare la voce in Irodori-TTS
In Irodori-TTS è possibile regolare espressioni come genere ed emozioni in vari modi.
Specificare l'espressione emotiva con le emoji
Facendo clic su "Emoji Palette" sotto il campo di inserimento testo, è possibile selezionare le emoji.
A ogni emoji è assegnata un'espressione emotiva specifica.
- 😊 Felice, gioioso
- 😭 Singhiozzi, pianto
- 😰 Agitato, turbato
- ⏩ Parlata veloce
- 📖 Narrazione, monologo
Basta inserire l'emoji nel campo di inserimento testo per leggere con l'espressione emotiva specificata.
Esempio di lettura di: "😊 こんにちは、これはイロドリTTSで作成された音声です。"
Esempio di lettura di: "📖 こんにちは、これはイロドリTTSで作成された音声です。"
Tuttavia, specificando solo l'emoji non è possibile definire concretamente genere o età.
Caricare un audio di riferimento per leggere con la stessa voce
In Irodori-TTS è possibile caricare un file audio di riferimento per far leggere il testo imitando quella voce.
L'audio di riferimento va caricato nell'area con la scritta "Trascina l'audio qui - o - fai clic per caricare".
Oltre a poter leggere con la stessa voce, la qualità audio risulterà più nitida rispetto a quando non viene specificato nulla.
È possibile regolare direttamente lo stile di lettura con la funzione caption
In Irodori-TTS è possibile anche specificare direttamente tramite testo che tipo di voce utilizzare.
Per utilizzare la funzione caption è necessario avviare la "versione VoiceDesign"; il comando per avviare Irodori-TTS dal terminale cambia.
uv run python gradio_app_voicedesign.py --server-name 0.0.0.0 --server-port 7861
Eseguendo questo comando, si avvierà la schermata operativa della versione VoiceDesign.
Poiché la versione VoiceDesign utilizza un modello AI diverso dalla versione standard, al primo utilizzo è necessario fare clic su "Load Model" per scaricare il modello specifico.
La dimensione del modello AI è di circa 2GB, quindi si consiglia il download in un luogo con una buona connessione.
Nella schermata della versione VoiceDesign è presente la casella di testo "Caption / Style Prompt (optional)".
Qui è possibile inserire una descrizione testuale della voce desiderata.
- Leggi con una voce femminile calma, con un tono vicino, dolce e naturale.
- Parla con una voce maschile energica, in modo allegro e chiaro.
- Leggi in modo distaccato come un annunciatore di notizie, con una voce maschile profonda.
In questo modo è possibile specificare il tipo di voce.
Ad esempio, specificando "Leggi con una voce femminile calma, con un tono vicino, dolce e naturale.", si è ottenuta questa voce:
Esempio con specifica: "Leggi con una voce femminile calma, con un tono vicino, dolce e naturale."
Anche in questo caso è stata ottenuta una voce chiara e facile da ascoltare.
Tuttavia, la funzione caption presenta un punto di attenzione.
La funzione caption richiede molto più tempo per la generazione della voce rispetto agli altri metodi.
In questo test su notebook, la generazione di questa breve frase ha richiesto circa 5 minuti.
Per l'utilizzo della funzione caption, si raccomanda l'uso di un PC ad alte prestazioni dotato di GPU.
Cosa succede se si legge un testo in inglese?
Irodori-TTS è un software di sintesi vocale compatibile solo con il giapponese.
Quindi, cosa succede se proviamo a leggere un testo in inglese?
Proviamo a inserire una semplice frase d'esempio.
Esempio di lettura di: "Hello, this is a voice recording created using Irodori-TTS."
In questo modo, "Hello" viene pronunciato con accento giapponese ("Haro") e la parte "recording" risulta incomprensibile; la lettura non è corretta.
Se si desidera leggere testi in inglese, è consigliabile utilizzare servizi di sintesi vocale AI che supportano le lingue straniere.
Metodo di sintesi vocale consigliato quando il "setup è difficile"
Dopo aver letto fin qui, alcuni potrebbero pensare che il setup di Irodori-TTS sembri un po' complicato.
Se non si ha familiarità con l'uso del terminale, solo preparare strumenti come Python o Git, installare pacchetti e scaricare modelli AI può richiedere molto tempo.
Inoltre, senza un PC dotato di GPU, ogni singola sintesi vocale richiede troppo tempo, rendendo difficile l'uso per scopi come la narrazione di video.
I testi lunghi devono essere divisi in segmenti di circa 30 secondi e generati ripetutamente.
Per chi desidera creare voci dal testo senza installazioni o setup, presentiamo di seguito un servizio di sintesi vocale AI utilizzabile via browser.
"Ondoku": Voce AI utilizzabile senza installazione
Per chi vuole sintetizzare voci facilmente con le ultime tecnologie AI, il servizio consigliato è "Ondoku".
"Ondoku" è un servizio di sintesi vocale AI in cui è sufficiente aprire il browser e incollare il testo per creare l'audio.
È possibile creare gratuitamente voci su PC, smartphone o tablet in qualsiasi momento.
Poiché la generazione della voce avviene in cloud (lato server), non importa se il PC non dispone di una GPU.
Sono disponibili molteplici voci predefinite, come voci maschili, femminili e di bambini, quindi è possibile leggere immediatamente semplicemente scegliendo una voce, senza dover preparare audio di riferimento o caption.
Anche i testi lunghi possono essere letti integralmente.
Inoltre, Ondoku supporta anche l'inglese!
Supporta multilingue tra cui francese, spagnolo, coreano, cinese e altri, quindi può essere utilizzato per letture in lingue diverse dal giapponese.
Inoltre, con la voce AI di nuova generazione (OndokuBeta), potrete sperimentare una lettura ancora più naturale.
Se state cercando un modo per trasformare il testo in voce, perché non provare "Ondoku", facile e gratuito?
Confronto tra Ondoku e Irodori-TTS
Infine, confrontiamo le principali differenze tra Ondoku e Irodori-TTS.
| Voce | Ondoku | Irodori-TTS |
|---|---|---|
| Modalità operativa | Cloud (tramite browser) | Locale (elaborazione sul proprio PC) |
| Setup | Non necessario | Richiesta configurazione ambiente (Python, Git, ecc.) |
| Lingue supportate | Oltre 35 lingue | Solo giapponese |
| Scelta della voce | Semplice selezione tra più voci | Specifica tramite cloning, caption o emoji |
| Limite singola generazione | Supporta testi lunghi | Fino a circa 30 secondi |
| Uso commerciale | Possibile (richiede attribuzione per il piano gratuito) | Possibile (licenza MIT) |
| Dispositivi supportati | PC, smartphone, tablet | PC (GPU consigliata) |
| Costo | Disponibile piano gratuito (piani a pagamento per più caratteri) | Gratuito (funzionamento locale) |
In sintesi, Ondoku eccelle per semplicità e immediatezza d'uso, mentre Irodori-TTS è adatto a chi possiede un PC potente e desidera personalizzare la voce nei minimi dettagli.
Ondoku è consigliato a chi ha bisogno di audio immediatamente, a chi necessita di letture multilingue o a chi desidera utilizzare il servizio su smartphone o tablet.
È perfetto anche per chi vuole leggere testi lunghi così come sono, per chi non vuole perdere tempo con il setup o per chi non ha una GPU sul PC.
Potete generare voci di alta qualità semplicemente aprendo il browser, quindi perché non provare Ondoku gratuitamente?
Riassunto delle caratteristiche, setup e utilizzo di Irodori-TTS
In questo articolo abbiamo spiegato Irodori-TTS, un software di sintesi vocale AI per il funzionamento locale specializzato in giapponese.
Irodori-TTS è uno strumento affascinante per chi vuole curare l'espressione vocale, offrendo funzioni come il design del timbro tramite caption, il cloning vocale e il controllo delle emozioni tramite emoji.
Tuttavia, il metodo di setup e l'utilizzo sono rivolti a utenti esperti, richiedendo la configurazione di ambienti come Python e Git.
Inoltre, sui PC senza GPU, la generazione della voce richiede tempo.
Per chi desidera "utilizzare la sintesi vocale in modo semplice e immediato", consigliamo "Ondoku", utilizzabile solo via browser.
Perché non provate anche voi a creare audio di alta qualità con una sintesi vocale AI gratuita e facile da usare?
■ Software di sintesi vocale AI “Ondoku”
"Ondoku" è uno strumento di sintesi vocale online che può essere utilizzato senza alcun costo iniziale.
- Supporta circa 50 lingue tra cui giapponese, inglese, cinese, coreano, spagnolo, francese e tedesco.
- Disponibile sia da PC che da smartphone
- Adatto per affari, istruzione, intrattenimento, ecc.
- Nessuna installazione richiesta, utilizzabile immediatamente dal tuo browser
- Supporta anche la lettura dalle immagini
Per usarlo è sufficiente inserire del testo o caricare un file dal sito. Genera file audio naturali in pochi secondi. Puoi utilizzare la sintesi vocale per un massimo di 5.000 caratteri gratuitamente, quindi provala prima.
Email: ondoku3.com@gmail.com
Software di sintesi vocale del testo Ondoku. È un servizio di sintesi vocale che non richiede installazione e può essere utilizzato da chiunque gratuitamente. Se ti registri gratuitamente, puoi ottenere fino a 5000 caratteri gratuitamente ogni mese. Registrati adesso gratuitamente
- Cos'è Ondoku?
- Leggi il testo su Ondoku
- Registrazione gratuita
- Piano tariffario
- Elenco di articoli
- Prova anche altri servizi gratuiti