Irodori-TTS是什麼?功能、注意點及使用方法教學
2026年7月28日
Irodori-TTS 是什麼樣的 AI 朗讀軟體呢?
應該有很多人對新的 AI 朗讀軟體「Irodori-TTS」感到好奇吧。
這篇文章將以簡單易懂的方式說明 Irodori-TTS 的特徵、功能、注意事項與使用方法。
此外,針對覺得「安裝設定似乎很難」的人,我們也會介紹無需安裝、立即就能使用的語音合成方法。
透過這篇文章可以了解
- Irodori-TTS 是什麼樣的軟體?
- Irodori-TTS 的功能與注意事項
- Irodori-TTS 的使用方法(從安裝設定到語音調整)
- 環境架設困難時的推薦方法
Irodori-TTS 是什麼?日文 AI 語音合成軟體解說
首先,我們簡單解說 Irodori-TTS 是一款什麼樣的 AI 語音合成軟體及其特徵。
Irodori-TTS 是在本機端執行的 AI 語音合成模型
Irodori-TTS 是一款專門針對日文的 AI 語音合成軟體。
開發者為 Aratako 先生,並以開源(MIT License)方式免費公開。
最大的特徵是可以在自己的 PC 上完成語音合成的「本機端執行」。
由於語音生成處理全部在手邊的 PC 上進行,因此文字或生成的語音數據不會被傳送到外部伺服器。
完成首次安裝設定後,無需網際網路連接即可生成語音,且生成次數沒有限制。
不過,安裝設定需要 Python 或 Git 等程式開發工具。
此外,為了讓執行速度更快,建議使用配備 GPU(顯示卡)的高性能 PC。
Irodori-TTS 的功能與限制
接下來,說明 Irodori-TTS 能做到的事與不能做到的事。
Irodori-TTS 能做到的事
由於 Irodori-TTS 在本機端環境執行,因此可以無限制地多次生成語音。
即使在沒有網路的環境下,只要完成首次安裝設定,就能自由製作語音。
軟體提供了多種指示語音生成的方式,若使用 Caption 功能,只需透過文字指示就能創造出符合自己喜好的音質。
此外,還可以透過語音複製(Cloning)來重現手邊的聲音,或使用表情符號來加入情感表現。
由於採用 MIT License,生成的語音也可以用於商業用途。
Irodori-TTS 的注意事項
另一方面,在使用 Irodori-TTS 之前,也有一些需要了解的注意事項。
每次可製作的語音長度約為 30 秒
單次生成可朗讀的長度約在 30 秒以內。
若想朗讀長篇文章,則需要將文章分割並多次生成。
難以精確控制理想的聲音或說話方式
Irodori-TTS 雖然自由度很高,但並未提供預設語音(基準語音)。
因此,若未指定 Caption 或 Reference 語音,每次生成的性別和年齡可能會隨機變化。
若想以相同的聲音朗讀,則必須讀取 Reference 語音。
此外,並沒有手動調整抑揚頓挫或語調的功能。
僅支援日文
支援的語言僅限日文,不支援英文等外國語。
此外,有時會出現漢字讀音錯誤的情況,需要多加注意。
建議使用配備 GPU 的高規格 PC
根據 PC 規格的不同,生成語音可能需要較多時間。
在未配備 GPU 的 PC 上,即使是短句子也可能需要花費 1 分鐘左右來生成。
對於 Celeron 或 N100 等入門級 CPU,實用上會感到困難。
如何使用 Irodori-TTS(安裝設定流程)
從這裡開始簡單說明 Irodori-TTS 的使用方法。
安裝設定的整體流程如下:
- 安裝必要的軟體
- 建立工作資料夾
- 從 GitHub Clone Irodori-TTS
- 安裝必要的套件(Package)
- 啟動 Irodori-TTS
- 載入 AI 模型
- 朗讀文字
1. 安裝 Irodori-TTS 必要的軟體
在安裝設定 Irodori-TTS 之前需要做準備。
首先,安裝這三種工具:
- Python 3.10 以上:程式語言
- Git:版本控制系統(下載 Irodori-TTS 所需)
- uv:Python 的套件管理工具
若要安裝 Python、Git、uv,首先右鍵點擊開始功能表,然後點擊「終端機(Terminal)」(無需以管理員身分啟動)。
接著會開啟終端機(PowerShell)視窗。
在此視窗中輸入以下指令並執行:
winget install --id Git.Git -e
winget install --id=astral-sh.uv -e
至此,已完成安裝設定 Irodori-TTS 所需的工具。
※由於 Python 由 uv 管理,因此會在安裝設定時自動安裝。
安裝後,請先關閉終端機(PowerShell)並重新開啟(以利「設定路徑」)。
2. 建立工作資料夾
接著建立工作資料夾。
Irodori-TTS 將會安裝在此處。
這次我們在 C 槽根目錄下建立了一個名為「irodori-tts」的資料夾。
建立資料夾後,在終端機中移動到該資料夾。
cd C:\irodori-tts
3. 從 GitHub Clone Irodori-TTS
在終端機輸入以下指令,從 GitHub Clone Irodori-TTS 的儲存庫(Repository)。
git clone https://github.com/Aratako/Irodori-TTS.git
儲存庫的 Clone 過程只需幾秒鐘即可完成。
輸入下一個指令,移動到 Clone 下來的儲存庫資料夾。
cd Irodori-TTS
4. 安裝必要的套件
輸入並執行以下指令,安裝執行 Irodori-TTS 所需的套件。
uv sync
由於需要下載與安裝大量套件,這會花費一些時間。
Python 本體也會在此時被安裝。
在下載與安裝期間,請不要關閉終端機視窗並耐心等待。
由於會下載將近 3GB 的檔案,建議在網路狀況良好的地方進行安裝設定。
5. 啟動 Irodori-TTS
套件下載與安裝完成後,安裝設定即告完成。
啟動 Irodori-TTS。
輸入並執行以下指令,並稍候啟動。
uv run python gradio_app.py --server-name 0.0.0.0 --server-port 7860
當終端機顯示如下訊息時,表示啟動完成。
Running on local URL: http://0.0.0.0:7860
開啟網頁瀏覽器,造訪 http://localhost:7860。
如此便能開啟 Irodori-TTS 的操作介面(WebUI)。
6. 載入 AI 模型
為了載入用於朗讀文章的 AI 模型,請點擊「Load Model」。
第一次使用時,點擊此按鈕將會開始下載 AI 模型。
當 Model Status(下圖紅框處)顯示完成訊息後,AI 模型即載入完成。
7. 使用 Irodori-TTS 朗讀文字
雖然 Irodori-TTS 可以給予包含情感表現在內的朗讀方式指示,但作為範例,我們先嘗試在無指示的情況下進行朗讀。
向下滾動會看到文字輸入欄位,在此輸入想要朗讀的文章。
這次我們嘗試朗讀「こんにちは、これはイロドリTTSで作成された音声です。」(你好,這是使用 Irodori-TTS 製作的語音。)
(若使用英文字母「Irodori-TTS」,有時無法正確朗讀,因此改用片假名「イロドリTTS」)
點擊「Generate」按鈕後開始生成語音。
Irodori-TTS 會使用手邊 PC 的 CPU 或 GPU(顯示卡)來生成語音。
因此,根據 PC 性能的不同,生成所需的時間會有很大差異。
由於這次是在未配備 GPU 的筆記型電腦上生成,雖然句子很短,但也花了約 1 分鐘。
參考:在 CPU: Ryzen 5 4650U, RAM: DDR4 32GB, Windows 11 Pro 24H2 的環境下進行測試生成。
生成完成後,會顯示語音波形,並可以播放語音。
朗讀「こんにちは、これはイロドリTTSで作成された音声です。」的範例
試聽後若無問題,點擊下載按鈕(向下箭頭圖示)即可儲存語音檔案。
語音檔案將以 WAV 格式儲存。
至此,已成功使用 Irodori-TTS 進行語音合成。
調整 Irodori-TTS 語音的方法
在 Irodori-TTS 中,可以透過多種方式調整性別與情感等表現。
透過表情符號指定情感表現
點擊文字輸入欄下方的「Emoji Palette」,即可選擇表情符號。
每個表情符號都分配了不同的情感表現。
- 😊 開心地、高興地
- 😭 嗚咽、哭聲
- 😰 慌張、動搖
- ⏩ 語速快
- 📖 旁白、獨白
只需在文字輸入欄中加入表情符號,就能以指定的情感表現進行朗讀。
朗讀「😊 こんにちは、これはイロドリTTSで作成された音声です。」的範例
朗讀「📖 こんにちは、これはイロドリTTSで作成された音声です。」的範例
不過,僅指定表情符號並無法具體指定性別或年齡。
載入 Reference 語音以相同聲音朗讀
在 Irodori-TTS 中,可以載入 Reference 語音檔案,並參考該聲音進行朗讀。
請從寫著「將語音拖曳至此 - 或 - 點擊上傳」的部分讀取 Reference 語音。
這不僅能以相同的聲音朗讀,與什麼都不指定的情況相比,還能以更清晰的音質進行朗讀。
也可透過 Caption 功能直接調整朗讀風格
在 Irodori-TTS 中,還能直接透過文字指定要以什麼樣的語音朗讀。
若要使用 Caption 功能,必須啟動「VoiceDesign 版」,在終端機啟動 Irodori-TTS 的指令會有所不同。
uv run python gradio_app_voicedesign.py --server-name 0.0.0.0 --server-port 7861
執行此指令後,會啟動 VoiceDesign 版的操作介面。
由於 VoiceDesign 版使用與標準版不同的 AI 模型,第一次使用時必須點擊「Load Model」,下載與標準版不同的模型。
AI 模型大小約為 2GB,建議在網路狀況良好的地方下載。
VoiceDesign 版的操作介面中有一個「Caption / Style Prompt (optional)」文字框。
在此處以文字輸入希望以什麼樣的聲音朗讀。
- 請用沉穩的女性聲音,以親近的距離感、溫柔自然地朗讀。
- 請用有活力的男性聲音,開朗且口齒清晰地說話。
- 請用較低沉的男性聲音,像新聞主播一樣平淡地讀。
以此方式可以指定要生成什麼樣的語音。
例如,指定「請用沉穩的女性聲音,以親近的距離感、溫柔自然地朗讀。」進行朗讀,會得到如下的語音。
指定「請用沉穩的女性聲音,以親近的距離感、溫柔自然地朗讀。」的範例
這也能生成音質清晰且易於聽取的朗讀語音。
不過,Caption 功能有其注意事項。
與其他朗讀方式相比,Caption 功能生成語音所需的時間更長。
這次在筆記型電腦上生成時,這段短文的生成花費了約 5 分鐘。
使用 Caption 功能時,建議配備 GPU 的高規格 PC。
朗讀英文文字會變成怎樣?
Irodori-TTS 是一款僅支援日文的朗讀軟體。
那麼,嘗試朗讀英文文字會發生什麼事呢?
試著輸入一段簡單的例句。
朗讀「Hello, this is a voice recording created using Irodori-TTS.」的範例
如上所述,Hello 變成了「ハロー」(日式片假名發音),recording 的部分發音也變得難以辨識,無法正確朗讀。
若想朗讀英文文字,建議使用支援外國語的 AI 朗讀服務。
「安裝設定很難」時推薦的語音合成方法
讀到這裡,可能有人會覺得 Irodori-TTS 的安裝設定似乎有點辛苦。
若不習慣終端機操作,光是準備 Python、Git 等工具,並安裝套件、下載 AI 模型就得花不少時間。
此外,若沒有配備 GPU 的 PC,每次語音合成所需時間太長,很難用於影片旁白等用途。
長篇文章還必須分割成每段約 30 秒,重複多次生成。
對於想在不進行安裝或設定的情況下從文字製作語音的人,接下來介紹一款可在瀏覽器使用的 AI 語音合成服務。
『Ondoku』無需安裝即可使用的 AI 語音
若想用最新的 AI 輕鬆進行語音合成,推薦使用 AI 語音合成服務『Ondoku』。
『Ondoku』是一款只要開啟瀏覽器並貼上文字就能製作語音的 AI 語音合成服務。
不論是 PC、手機、平板電腦,現在就能免費製作語音。
語音生成在雲端(伺服器端)進行,因此 PC 是否配備 GPU 都沒有問題。
提供男聲、女聲、童聲等多種預設聲音,無需準備 Reference 語音或 Caption,只需選擇即可立即朗讀。
長篇文章也能直接朗讀。
而且 Ondoku 還支援英文!
支援法文、德文、西班牙文、韓文、中文等多種語言,也能用於日文以外的朗讀。
此外,透過次世代 AI 語音(OndokuBeta),還能體驗更自然的朗讀效果喔。
若正在尋找將文字朗讀為語音的方法,不妨來體驗看看免費且簡單好用的 『Ondoku』 吧?
Ondoku 與 Irodori-TTS 的差異比較
最後比較 Ondoku 與 Irodori-TTS 的主要差異。
| 項目 | Ondoku | Irodori-TTS |
|---|---|---|
| 執行方式 | 雲端(透過瀏覽器操作) | 本機端(在自己的 PC 處理) |
| 安裝設定 | 不需要 | 需要 Python、Git 等環境架設 |
| 支援語言 | 35 種語言以上 | 僅限日文 |
| 語音選擇方式 | 從多種聲音中直接選擇 | 透過語音複製、Caption、表情符號指定 |
| 單次生成上限 | 支援長文 | 約 30 秒為止 |
| 商業用途 | 可以(免費使用時需標註來源) | 可以(MIT License) |
| 支援裝置 | PC、手機、平板電腦 | PC(建議配備 GPU) |
| 費用 | 有免費方案(付費方案可增加字數) | 免費(因在本機端執行) |
比較後可以發現,追求簡便與立即使用的話選 Ondoku,擁有高性能 PC 且想細部調整語音風格的話選 Irodori-TTS,可根據需求區分使用。
對於現在就想要語音、需要多語言朗讀、或想在手機平板上使用的人,Ondoku 是最佳選擇。
這也適合想直接朗讀長篇文章、不想花時間安裝設定、或 PC 未配備 GPU 的使用者。
只需開啟瀏覽器就能立即生成高品質語音,何不先免費試用看看 Ondoku 呢?
Irodori-TTS 的特徵、安裝設定、使用方法 總結
這篇文章解說了專門針對日文且可在本機端執行的 AI 語音合成軟體 Irodori-TTS。
對於想追求語音表現的人來說,Irodori-TTS 透過語音複製、Caption 聲質設計及表情符號情感控制,是一款極具魅力的工具。
不過,安裝設定與使用方法較適合進階使用者,且需要架設 Python 與 Git 的環境。
此外,在沒有 GPU 的 PC 上生成語音會相當耗時。
對於「想立即輕鬆使用語音合成」的人,推薦使用只需瀏覽器就能操作的『Ondoku』。
透過這款簡單好用的免費 AI 語音合成,您也來嘗試製作高品質的語音吧?
■ AI語音合成軟體“Ondoku”
「Ondoku」是一種線上文字轉語音工具,無需初始費用即可使用。
- 支援日語、英語、中文、韓語、西班牙語、法語、德語等約50種語言。
- PC 和智慧型手機皆可使用
- 適用於商務、教育、娛樂等。
- 無需安裝,可從瀏覽器立即使用
- 也支援從圖像中讀出
要使用它,只需輸入文字或從網站上傳文件即可。 在幾秒鐘內產生自然的聲音檔案。 您可以免費使用最多 5,000 個字元的語音合成,因此請先嘗試一下。
Email: ondoku3.com@gmail.com