Cos'è Irodori-TTS? Funzioni, limitazioni e guida all'uso

28 Luglio 2026

Cos'è Irodori-TTS? Funzioni, limitazioni e guida all'uso


cane

Che tipo di software di sintesi vocale AI è Irodori-TTS?

Probabilmente molti di voi sono curiosi di conoscere il nuovo software di sintesi vocale AI "Irodori-TTS".

In questo articolo spiegheremo in modo semplice le caratteristiche, cosa può fare, i punti di attenzione e come utilizzare Irodori-TTS.

Inoltre, per chi pensa che "il setup sembri difficile", presenteremo anche un metodo di sintesi vocale utilizzabile immediatamente senza installazione.

Cosa imparerai in questo articolo

  1. Che tipo di software è Irodori-TTS?
  2. Cosa si può fare con Irodori-TTS e punti di attenzione
  3. Come usare Irodori-TTS (dal setup alla regolazione della voce)
  4. Metodo consigliato quando la configurazione dell'ambiente è difficile

Cos'è Irodori-TTS? Spiegazione del software di sintesi vocale AI giapponese

Cos'è Irodori-TTS? Spiegazione del software di sintesi vocale AI giapponese

Innanzitutto, spiegheremo brevemente che tipo di software di sintesi vocale AI è Irodori-TTS e le sue caratteristiche.

Irodori-TTS è un modello di sintesi vocale AI che funziona in locale

Irodori-TTS è un software di sintesi vocale AI specializzato per la lingua giapponese.

Lo sviluppatore è Aratako ed è rilasciato gratuitamente come open source (licenza MIT).

La caratteristica principale è la possibilità di "funzionamento locale", in cui la sintesi vocale viene completata interamente sul proprio PC.

Poiché tutto il processo di generazione della voce avviene sul proprio PC, i testi o i dati vocali generati non vengono mai inviati a server esterni.

Dopo il setup iniziale, è possibile generare voci senza connessione internet e non ci sono limiti al numero di generazioni.

Tuttavia, per il setup sono necessari strumenti di programmazione come Python e Git.

Inoltre, per un funzionamento rapido, è consigliato un PC ad alte prestazioni dotato di GPU (scheda grafica).

Cosa si può e non si può fare con Irodori-TTS

Cosa si può e non si può fare con Irodori-TTS

Successivamente, spiegheremo cosa è possibile fare e cosa no con Irodori-TTS.

Cosa si può fare con Irodori-TTS

Poiché Irodori-TTS funziona in un ambiente locale, è possibile generare voci illimitatamente e quante volte si desidera.

Anche in ambienti senza connessione internet, una volta terminato il setup iniziale, è possibile creare voci liberamente.

Sono disponibili diversi modi per istruire il software su quale tipo di voce creare; utilizzando la funzione caption, è possibile creare il timbro vocale preferito solo tramite istruzioni testuali.

Inoltre, è possibile riprodurre voci esistenti tramite il cloning vocale o aggiungere espressioni emotive utilizzando le emoji.

Essendo sotto licenza MIT, è possibile anche l'uso commerciale delle voci generate.

Punti di attenzione di Irodori-TTS

D'altra parte, ci sono alcuni punti di attenzione da conoscere prima di utilizzare Irodori-TTS.

La voce generabile per singola sessione è di circa 30 secondi

Ogni singola generazione può leggere fino a circa 30 secondi.

Se si desidera leggere testi lunghi, è necessario dividere il testo e generarlo più volte.

È difficile ottenere esattamente la voce o il modo di parlare desiderato

Data l'elevata flessibilità di Irodori-TTS, non sono fornite voci predefinite (voci di base).

Per questo motivo, se non si specificano caption o audio di riferimento, il genere o l'età potrebbero cambiare casualmente a ogni generazione.

Quando si desidera leggere con la stessa voce, è necessario caricare un audio di riferimento.

Inoltre, non è presente una funzione per regolare manualmente l'inflessione o l'intonazione.

La lingua supportata è solo il giapponese

La lingua supportata è esclusivamente il giapponese; lingue straniere come l'inglese non sono supportate.

Inoltre, possono verificarsi errori di lettura dei kanji, quindi è necessaria attenzione.

Consigliato PC ad alte prestazioni con GPU

A seconda delle specifiche del PC, la generazione della voce potrebbe richiedere tempo.

Sui PC non dotati di GPU, la generazione di anche un breve testo può richiedere circa un minuto.

Con CPU di fascia entry-level come Celeron o N100, l'uso pratico risulta difficile.

Come usare Irodori-TTS (Flusso del setup)

Di seguito, spiegheremo brevemente come utilizzare Irodori-TTS.

Il flusso generale del setup è il seguente:

  1. Installare i software necessari
  2. Creare una cartella di lavoro
  3. Clonare Irodori-TTS da GitHub
  4. Installare i pacchetti necessari
  5. Avviare Irodori-TTS
  6. Caricare il modello AI
  7. Leggere il testo

1. Installare i software necessari per Irodori-TTS

Per configurare Irodori-TTS è necessaria una preparazione preliminare.

Per prima cosa, installare questi tre tipi di software:

  • Python 3.10 o superiore: linguaggio di programmazione
  • Git: sistema di controllo versione (necessario per scaricare Irodori-TTS)
  • uv: gestore di pacchetti per Python

Per installare Python, Git e uv, fare clic con il pulsante destro del mouse sul menu Start e selezionare "Terminale" (non è necessario avviarlo come amministratore).

Fare clic su 'Terminale'

Si aprirà la schermata del terminale (PowerShell).

Terminale (PowerShell)

In questa schermata, inserire ed eseguire i seguenti comandi:

winget install --id Git.Git -e

winget install --id=astral-sh.uv -e

Comando in esecuzione

In questo modo sono stati installati i componenti necessari per configurare Irodori-TTS.

*Python sarà gestito da uv, quindi verrà installato automaticamente durante il setup.

Dopo l'installazione, chiudere il terminale (PowerShell) e riaprirlo (per aggiornare il PATH).

2. Creare una cartella di lavoro

Successivamente, creare una cartella di lavoro.

Qui verrà installato Irodori-TTS.

In questo esempio, abbiamo creato una cartella chiamata "irodori-tts" direttamente nel disco C.

Creazione cartella di lavoro

Una volta creata la cartella, spostarsi in essa tramite il terminale.

cd C:\irodori-tts

Spostamento nella cartella di lavoro

3. Clonare Irodori-TTS da GitHub

Inserire il seguente comando nel terminale per clonare il repository di Irodori-TTS da GitHub.

git clone https://github.com/Aratako/Irodori-TTS.git

Clonazione del repository da GitHub

La clonazione del repository terminerà in pochi secondi.

Inserire il seguente comando per spostarsi nella cartella del repository clonato.

cd Irodori-TTS

Spostamento nella cartella

4. Installare i pacchetti necessari

Inserire ed eseguire il seguente comando per installare i pacchetti necessari al funzionamento di Irodori-TTS.

uv sync

Installazione pacchetti

L'operazione richiederà tempo poiché verranno scaricati e installati molti pacchetti.

Schermata durante l'installazione dei pacchetti

In questa fase verrà installato anche Python stesso.

Attendere senza chiudere la schermata del terminale durante il download e l'installazione.

Verranno scaricati file per una dimensione totale di quasi 3GB, quindi si consiglia di eseguire il setup in un luogo con una buona connessione internet.

5. Avviare Irodori-TTS

Una volta terminato il download e l'installazione dei pacchetti, il setup è completo.

Avviare Irodori-TTS.

Inserire ed eseguire il seguente comando e attendere qualche istante per l'avvio.

uv run python gradio_app.py --server-name 0.0.0.0 --server-port 7860

L'avvio è completato quando sul terminale appare quanto segue:

Schermata di avvio completato

Running on local URL: http://0.0.0.0:7860

Aprire un browser web e accedere a http://localhost:7860.

Si aprirà la schermata (WebUI) di Irodori-TTS.

WebUI di Irodori-TTS

6. Caricare il modello AI

Fare clic su "Load Model" per caricare il modello AI da utilizzare per la lettura del testo.

Load Model

Al primo utilizzo, premendo questo pulsante inizierà il download del modello AI.

Quando apparirà un messaggio di completamento nel Model Status (l'area evidenziata in rosso nell'immagine successiva), il caricamento del modello AI sarà terminato.

Model Status

7. Leggere il testo con Irodori-TTS

Con Irodori-TTS è possibile fornire istruzioni sulla modalità di lettura, incluse le espressioni emotive, ma come primo esempio proviamo a leggere senza istruzioni.

Scorrendo verso il basso si trova il campo di inserimento testo; inserire la frase che si desidera far leggere.

Inserimento testo

In questo caso proveremo a far leggere: "こんにちは、これはイロドリTTSで作成された音声です。" (Buongiorno, questa è una voce creata con Irodori-TTS).

(Poiché scrivendo "Irodori-TTS" in alfabeto la lettura non era corretta, abbiamo usato il katakana "イロドリTTS").

Premendo il pulsante "Generate", inizierà la generazione della voce.

Inizio generazione

Irodori-TTS utilizza la CPU o la GPU (scheda grafica) del PC locale per generare la voce.

Pertanto, il tempo necessario per la generazione varia notevolmente in base alle prestazioni del PC.

In questo caso, avendo generato su un notebook senza GPU, per una frase breve è stato necessario circa un minuto.

Riferimento: Test di generazione effettuato in ambiente CPU: Ryzen 5 4650U, Memoria: DDR4 32GB, Windows 11 Pro 24H2.

Al termine della generazione, verrà visualizzata la forma d'onda dell'audio e sarà possibile riprodurlo.

Generazione completata

Esempio di lettura di: "こんにちは、これはイロドリTTSで作成された音声です。"

Se l'ascolto è soddisfacente, premere il pulsante di download (l'icona con la freccia verso il basso) per salvare il file audio.

Il file audio verrà salvato in formato WAV.

In questo modo, è stato possibile sintetizzare una voce utilizzando Irodori-TTS.

Come regolare la voce in Irodori-TTS

In Irodori-TTS è possibile regolare espressioni come genere ed emozioni in vari modi.

Specificare l'espressione emotiva con le emoji

Facendo clic su "Emoji Palette" sotto il campo di inserimento testo, è possibile selezionare le emoji.

Emoji Palette

A ogni emoji è assegnata un'espressione emotiva specifica.

  • 😊 Felice, gioioso
  • 😭 Singhiozzi, pianto
  • 😰 Agitato, turbato
  • ⏩ Parlata veloce
  • 📖 Narrazione, monologo

Basta inserire l'emoji nel campo di inserimento testo per leggere con l'espressione emotiva specificata.

Esempio di lettura di: "😊 こんにちは、これはイロドリTTSで作成された音声です。"

Esempio di lettura di: "📖 こんにちは、これはイロドリTTSで作成された音声です。"

Tuttavia, specificando solo l'emoji non è possibile definire concretamente genere o età.

Caricare un audio di riferimento per leggere con la stessa voce

In Irodori-TTS è possibile caricare un file audio di riferimento per far leggere il testo imitando quella voce.

L'audio di riferimento va caricato nell'area con la scritta "Trascina l'audio qui - o - fai clic per caricare".

Caricamento audio di riferimento

Oltre a poter leggere con la stessa voce, la qualità audio risulterà più nitida rispetto a quando non viene specificato nulla.

È possibile regolare direttamente lo stile di lettura con la funzione caption

In Irodori-TTS è possibile anche specificare direttamente tramite testo che tipo di voce utilizzare.

Per utilizzare la funzione caption è necessario avviare la "versione VoiceDesign"; il comando per avviare Irodori-TTS dal terminale cambia.

uv run python gradio_app_voicedesign.py --server-name 0.0.0.0 --server-port 7861

Avvio versione VoiceDesign

Eseguendo questo comando, si avvierà la schermata operativa della versione VoiceDesign.

Poiché la versione VoiceDesign utilizza un modello AI diverso dalla versione standard, al primo utilizzo è necessario fare clic su "Load Model" per scaricare il modello specifico.

La dimensione del modello AI è di circa 2GB, quindi si consiglia il download in un luogo con una buona connessione.

Nella schermata della versione VoiceDesign è presente la casella di testo "Caption / Style Prompt (optional)".

Caption / Style Prompt (optional)

Qui è possibile inserire una descrizione testuale della voce desiderata.

  • Leggi con una voce femminile calma, con un tono vicino, dolce e naturale.
  • Parla con una voce maschile energica, in modo allegro e chiaro.
  • Leggi in modo distaccato come un annunciatore di notizie, con una voce maschile profonda.

In questo modo è possibile specificare il tipo di voce.

Ad esempio, specificando "Leggi con una voce femminile calma, con un tono vicino, dolce e naturale.", si è ottenuta questa voce:

Esempio con specifica: "Leggi con una voce femminile calma, con un tono vicino, dolce e naturale."

Anche in questo caso è stata ottenuta una voce chiara e facile da ascoltare.

Tuttavia, la funzione caption presenta un punto di attenzione.

La funzione caption richiede molto più tempo per la generazione della voce rispetto agli altri metodi.

In questo test su notebook, la generazione di questa breve frase ha richiesto circa 5 minuti.

Per l'utilizzo della funzione caption, si raccomanda l'uso di un PC ad alte prestazioni dotato di GPU.

Cosa succede se si legge un testo in inglese?

Irodori-TTS è un software di sintesi vocale compatibile solo con il giapponese.

Quindi, cosa succede se proviamo a leggere un testo in inglese?

Proviamo a inserire una semplice frase d'esempio.

Esempio di lettura di: "Hello, this is a voice recording created using Irodori-TTS."

In questo modo, "Hello" viene pronunciato con accento giapponese ("Haro") e la parte "recording" risulta incomprensibile; la lettura non è corretta.

Se si desidera leggere testi in inglese, è consigliabile utilizzare servizi di sintesi vocale AI che supportano le lingue straniere.

Metodo di sintesi vocale consigliato quando il "setup è difficile"

Dopo aver letto fin qui, alcuni potrebbero pensare che il setup di Irodori-TTS sembri un po' complicato.

Se non si ha familiarità con l'uso del terminale, solo preparare strumenti come Python o Git, installare pacchetti e scaricare modelli AI può richiedere molto tempo.

Inoltre, senza un PC dotato di GPU, ogni singola sintesi vocale richiede troppo tempo, rendendo difficile l'uso per scopi come la narrazione di video.

I testi lunghi devono essere divisi in segmenti di circa 30 secondi e generati ripetutamente.

Per chi desidera creare voci dal testo senza installazioni o setup, presentiamo di seguito un servizio di sintesi vocale AI utilizzabile via browser.

"Ondoku": Voce AI utilizzabile senza installazione

Ondoku

Per chi vuole sintetizzare voci facilmente con le ultime tecnologie AI, il servizio consigliato è "Ondoku".

"Ondoku" è un servizio di sintesi vocale AI in cui è sufficiente aprire il browser e incollare il testo per creare l'audio.

È possibile creare gratuitamente voci su PC, smartphone o tablet in qualsiasi momento.

Poiché la generazione della voce avviene in cloud (lato server), non importa se il PC non dispone di una GPU.

Sono disponibili molteplici voci predefinite, come voci maschili, femminili e di bambini, quindi è possibile leggere immediatamente semplicemente scegliendo una voce, senza dover preparare audio di riferimento o caption.

Anche i testi lunghi possono essere letti integralmente.

Inoltre, Ondoku supporta anche l'inglese!

Supporta multilingue tra cui francese, spagnolo, coreano, cinese e altri, quindi può essere utilizzato per letture in lingue diverse dal giapponese.

Inoltre, con la voce AI di nuova generazione (OndokuBeta), potrete sperimentare una lettura ancora più naturale.

Se state cercando un modo per trasformare il testo in voce, perché non provare "Ondoku", facile e gratuito?

Confronto tra Ondoku e Irodori-TTS

Infine, confrontiamo le principali differenze tra Ondoku e Irodori-TTS.

👆 Puoi scorrere lateralmente
Voce Ondoku Irodori-TTS
Modalità operativa Cloud (tramite browser) Locale (elaborazione sul proprio PC)
Setup Non necessario Richiesta configurazione ambiente (Python, Git, ecc.)
Lingue supportate Oltre 35 lingue Solo giapponese
Scelta della voce Semplice selezione tra più voci Specifica tramite cloning, caption o emoji
Limite singola generazione Supporta testi lunghi Fino a circa 30 secondi
Uso commerciale Possibile (richiede attribuzione per il piano gratuito) Possibile (licenza MIT)
Dispositivi supportati PC, smartphone, tablet PC (GPU consigliata)
Costo Disponibile piano gratuito (piani a pagamento per più caratteri) Gratuito (funzionamento locale)

In sintesi, Ondoku eccelle per semplicità e immediatezza d'uso, mentre Irodori-TTS è adatto a chi possiede un PC potente e desidera personalizzare la voce nei minimi dettagli.

Ondoku è consigliato a chi ha bisogno di audio immediatamente, a chi necessita di letture multilingue o a chi desidera utilizzare il servizio su smartphone o tablet.

È perfetto anche per chi vuole leggere testi lunghi così come sono, per chi non vuole perdere tempo con il setup o per chi non ha una GPU sul PC.

Potete generare voci di alta qualità semplicemente aprendo il browser, quindi perché non provare Ondoku gratuitamente?

Riassunto delle caratteristiche, setup e utilizzo di Irodori-TTS

In questo articolo abbiamo spiegato Irodori-TTS, un software di sintesi vocale AI per il funzionamento locale specializzato in giapponese.

Irodori-TTS è uno strumento affascinante per chi vuole curare l'espressione vocale, offrendo funzioni come il design del timbro tramite caption, il cloning vocale e il controllo delle emozioni tramite emoji.

Tuttavia, il metodo di setup e l'utilizzo sono rivolti a utenti esperti, richiedendo la configurazione di ambienti come Python e Git.

Inoltre, sui PC senza GPU, la generazione della voce richiede tempo.

Per chi desidera "utilizzare la sintesi vocale in modo semplice e immediato", consigliamo "Ondoku", utilizzabile solo via browser.

Perché non provate anche voi a creare audio di alta qualità con una sintesi vocale AI gratuita e facile da usare?

■ Software di sintesi vocale AI “Ondoku”

"Ondoku" è uno strumento di sintesi vocale online che può essere utilizzato senza alcun costo iniziale.

  • Supporta circa 50 lingue tra cui giapponese, inglese, cinese, coreano, spagnolo, francese e tedesco.
  • Disponibile sia da PC che da smartphone
  • Adatto per affari, istruzione, intrattenimento, ecc.
  • Nessuna installazione richiesta, utilizzabile immediatamente dal tuo browser
  • Supporta anche la lettura dalle immagini

Per usarlo è sufficiente inserire del testo o caricare un file dal sito. Genera file audio naturali in pochi secondi. Puoi utilizzare la sintesi vocale per un massimo di 5.000 caratteri gratuitamente, quindi provala prima.

Il software di sintesi vocale "Ondoku" può leggere gratuitamente 5000 caratteri al mese con la voce AI. Puoi facilmente scaricare MP3 ed è anche possibile l'uso commerciale. Se ti iscrivi gratuitamente, puoi convertire gratuitamente fino a 5.000 caratteri al mese dalla sintesi vocale. Prova Ondoku adesso.
HP: ondoku3.com
Email: ondoku3.com@gmail.com
Articolo inerente

Software di sintesi vocale del testo Ondoku. È un servizio di sintesi vocale che non richiede installazione e può essere utilizzato da chiunque gratuitamente. Se ti registri gratuitamente, puoi ottenere fino a 5000 caratteri gratuitamente ogni mese. Registrati adesso gratuitamente