什么是 Irodori-TTS?功能、注意事项及用法详解
2026年7月28日
Irodori-TTS 是什么样的 AI 语音朗读软件?
可能有很多朋友对新的 AI 语音朗读软件 “Irodori-TTS” 感兴趣吧。
在这篇文章中,我们将以简单易懂的方式讲解 Irodori-TTS 的特点、功能、注意事项及使用方法。
此外,针对觉得 “安装设置似乎很难” 的朋友,我们还将介绍无需安装、现在就能使用的语音合成方法。
通过这篇文章你可以了解:
- Irodori-TTS 是什么样的软件?
- Irodori-TTS 的功能与注意事项
- Irodori-TTS 的使用方法(从安装设置到语音调整)
- 环境搭建困难时的推荐方法
Irodori-TTS 是什么?解说日语 AI 语音合成软件
首先,我们简单介绍一下 Irodori-TTS 是什么样的 AI 语音合成软件及其特点。
Irodori-TTS 是在本地运行的 AI 语音合成模型
Irodori-TTS 是一款专门针对日语优化的 AI 语音合成软件。
开发者是 Aratako 先生,该软件以开源(MIT 许可证)形式免费公开。
它最大的特点是可以实现“本地运行”,即语音合成完全在自己的 PC 上完成。
由于语音生成处理全部在本地 PC 上进行,文本和生成的语音数据不会被发送到外部服务器。
完成首次安装设置后,无需互联网连接即可生成语音,且生成次数没有限制。
不过,安装设置需要使用 Python 或 Git 等编程工具。
此外,为了实现高速运行,建议使用配备 GPU(显卡)的高性能 PC。
Irodori-TTS 的功能与局限
接下来,我们将解说 Irodori-TTS 的功能和局限性。
Irodori-TTS 的功能
由于 Irodori-TTS 在本地环境运行,因此可以无限次生成语音。
即使在没有网络连接的环境下,只要完成首次安装设置,就可以自由制作语音。
它还提供了多种指示如何生成语音的方法。通过 Caption 功能,只需使用文本指令即可创造出符合个人喜好的音质。
此外,还可以通过语音克隆(Voice Cloning)重现手头的语音,或通过绘文字添加情感表现。
由于采用 MIT 许可证,生成的语音也可以用于商业用途。
Irodori-TTS 的注意事项
另一方面,在使用 Irodori-TTS 之前,也有一些需要了解的注意事项。
单次制作的语音长度约为 30 秒
单次生成能够朗读的长度约为 30 秒左右。
如果想要朗读长篇文章,需要将文章分割并分多次生成。
难以精准控制声音或说话方式
虽然 Irodori-TTS 的自由度很高,但它没有提供默认语音(基准语音)。
因此,如果不指定 Caption 或参考音频,每次生成的性别和年龄都会随机变化。
如果想用同一种声音朗读,则需要加载参考音频 (Reference Audio)。
此外,它没有手动调整抑扬顿挫或语调的功能。
仅支持日语
支持的语言仅限日语,不支持英语等外国语。
此外,汉字有时会出现读错的情况,需要注意。
建议配备 GPU 的高配置 PC
根据 PC 配置的不同,语音生成可能需要较长时间。
在没有配备 GPU 的 PC 上,即使是短句子也需要大约 1 分钟来生成。
在 Celeron 或 N100 等入门级 CPU 上,实际使用会感到非常吃力。
如何使用 Irodori-TTS(安装设置流程)
下面简单讲解 Irodori-TTS 的使用方法。
安装设置的整体流程如下:
- 安装必要的软件
- 创建工作文件夹
- 从 GitHub 克隆 Irodori-TTS
- 安装必要的包 (Packages)
- 启动 Irodori-TTS
- 加载 AI 模型
- 朗读文本
1. 安装 Irodori-TTS 所需的软件
在设置 Irodori-TTS 之前需要做一些准备工作。
首先,安装以下三种工具:
- Python 3.10 以上:编程语言
- Git:版本控制系统(下载 Irodori-TTS 所需)
- uv:Python 的包管理器
要安装 Python、Git 和 uv,首先右键点击“开始”菜单并点击“终端”(不需要以管理员身份运行)。
接着会打开终端 (PowerShell) 窗口。
在此窗口中输入并执行以下命令:
winget install --id Git.Git -e
winget install --id=astral-sh.uv -e
这样,安装设置 Irodori-TTS 所需的工具就准备好了。
※ Python 由 uv 管理,因此在设置时会自动安装。
安装完成后,请先关闭终端 (PowerShell) 并重新打开(以便“配置路径”)。
2. 创建工作文件夹
接下来,创建一个工作文件夹。
Irodori-TTS 将被安装到这里。
在本例中,我们在 C 盘根目录下创建了一个名为 “irodori-tts” 的文件夹。
文件夹创建后,在终端中移动到该文件夹。
cd C:\irodori-tts
3. 从 GitHub 克隆 Irodori-TTS
在终端中输入以下命令,从 GitHub 克隆 Irodori-TTS 的代码仓库。
git clone https://github.com/Aratako/Irodori-TTS.git
克隆仓库只需几秒钟即可完成。
输入以下命令,进入克隆下来的仓库文件夹。
cd Irodori-TTS
4. 安装必要的包
输入并执行以下命令,安装运行 Irodori-TTS 所需的包。
uv sync
由于需要下载和安装大量的包,这会花费一些时间。
Python 本体也会在此步骤中安装。
在下载和安装期间,请不要关闭终端窗口,耐心等待。
由于需要下载近 3GB 的文件,建议在网络状况良好的环境下进行。
5. 启动 Irodori-TTS
包的下载和安装完成后,设置工作即告完成。
现在启动 Irodori-TTS。
输入并执行以下命令,稍等片刻待其启动。
uv run python gradio_app.py --server-name 0.0.0.0 --server-port 7860
当终端显示如下内容时,表示启动成功。
Running on local URL: http://0.0.0.0:7860
打开 Web 浏览器,访问 http://localhost:7860。
这样,Irodori-TTS 的操作界面 (WebUI) 就会打开。
6. 加载 AI 模型
点击 “Load Model” 以加载用于文本朗读的 AI 模型。
首次使用时,点击此按钮会开始下载 AI 模型。
当 Model Status(下图中红框标记处)显示完成消息时,表示 AI 模型加载完毕。
7. 使用 Irodori-TTS 朗读文本
虽然 Irodori-TTS 可以发出包括情感表现在内的朗读指令,但首先我们作为示例,尝试在不带指令的情况下进行朗读。
向下滚动会看到文本输入框,输入想要朗读的文章。
这次我们尝试朗读 “こんにちは、これはイロドリTTSで作成された音声です。”(你好,这是使用 Irodori-TTS 制作的语音。)
(由于直接写英文 “Irodori-TTS” 可能无法正确朗读,因此使用了片假名 “イロドリTTS”)
点击 “Generate” 按钮开始生成语音。
Irodori-TTS 使用本地 PC 的 CPU 或 GPU(显卡)来生成语音。
因此,根据 PC 性能的不同,生成所需的时间会有很大差异。
这次我们在没有配备 GPU 的笔记本电脑上生成,虽然句子很短,但生成大约花了 1 分钟。
参考:测试环境为 CPU: Ryzen 5 4650U, 内存: DDR4 32GB, Windows 11 Pro 24H2。
生成结束后,会显示语音波形,此时即可播放语音。
“こんにちは、これはイロドリTTSで作成された音声です。” 的朗读示例
试听后如果没有问题,点击下载按钮(向下箭头图标)保存语音文件。
语音文件将以 WAV 格式保存。
至此,我们已经成功使用 Irodori-TTS 合成了语音。
如何调整 Irodori-TTS 的语音
在 Irodori-TTS 中,可以通过多种方法调整性别、情感等表现。
通过绘文字指定情感表现
点击文本输入框下方的 “Emoji Palette”,可以选择绘文字。
每个绘文字都分配了不同的情感表现。
- 😊 愉悦地、高兴地
- 😭 呜咽、哭泣声
- 😰 慌张、动摇
- ⏩ 快口
- 📖 旁白、独白
只需在文本输入框中加入绘文字,即可按照指定的情感表现进行朗读。
“😊 こんにちは、これはイロドリTTSで作成された音声です。” 的朗读示例
“📖 こんにちは、これはイロドリTTSで作成された音声です。” 的朗读示例
不过,仅指定绘文字无法具体指定性别或年龄。
通过加载参考音频以同一种声音朗读
在 Irodori-TTS 中,可以加载参考语音文件,并参考该声音进行朗读。
请在写着“将音频拖入此处 - 或 - 点击上传”的部分加载参考语音。
这样不仅可以使用相同声音朗读,而且与什么都不指定的情况相比,音质会更清晰。
也可以通过 Caption 功能直接调整朗读风格
在 Irodori-TTS 中,还可以直接通过文本指定要以什么样的声音朗读。
要使用 Caption 功能,需要启动 “VoiceDesign 版”,此时在终端中启动 Irodori-TTS 的命令会发生变化。
uv run python gradio_app_voicedesign.py --server-name 0.0.0.0 --server-port 7861
执行此命令后,VoiceDesign 版的操作界面将会启动。
由于 VoiceDesign 版使用与标准版不同的 AI 模型,首次使用时需要点击 “Load Model” 另外下载该模型。
AI 模型的容量约为 2GB,建议在网络状况良好的环境下下载。
在 VoiceDesign 版的操作界面中,有一个 “Caption / Style Prompt (optional)” 文本框。
在这里输入一段描述你希望声音如何朗读的文字。
- 请用沉稳的女声,以较近的距离感、柔和且自然地朗读。
- 请用充满活力的男声,明亮而清晰地交谈。
- 请用低沉的男声,像新闻播音员一样平稳地朗读。
你可以像这样指定以什么样的语音朗读。
例如,指定 “请用沉稳的女声,以较近的距离感、柔和且自然地朗读。” 后,生成的语音如下所示。
指定了 “请用沉稳的女声,以较近的距离感、柔和且自然地朗读。” 的示例
同样,这里也生成了音质清晰且易于听辨的语音。
不过,Caption 功能有一个注意事项。
与其他朗读方法相比,Caption 功能生成语音所需的时间更长。
这次在笔记本电脑上生成时,这一小段话的生成大约花费了 5 分钟。
使用 Caption 功能时,建议使用配备 GPU 的高配置 PC。
朗读英文文本会怎样?
Irodori-TTS 是仅支持日语的朗读软件。
那么,如果尝试朗读英文文本会发生什么呢?
我们试着输入一段简单的例句。
“Hello, this is a voice recording created using Irodori-TTS.” 的朗读示例
结果如上所示,Hello 变成了片假名发音的 “ハロー”,recording 的部分则发音不清,无法正确朗读。
如果想要朗读英文文本,建议使用支持外国语的 AI 语音朗读服务。
“安装设置太难”时推荐的语音合成方法
读到这里,是否有些朋友觉得 Irodori-TTS 的安装设置似乎有点麻烦呢?
如果不习惯终端操作,仅仅是准备 Python、Git 等工具,安装包并下载 AI 模型这些步骤就会花费很多时间。
此外,如果没有配备 GPU 的 PC,单次语音合成花费时间太长,很难用于视频旁白等用途。
长篇文章还需要每隔约 30 秒分割一次并反复生成语音。
对于想要无需安装或设置就能从文本制作语音的朋友,下面介绍一款可以在浏览器中使用的 AI 语音合成服务。
『Ondoku』无需安装即可使用的 AI 语音
想要通过最新的 AI 轻松进行语音合成时,推荐使用 AI 语音合成服务 『Ondoku』。
『Ondoku』 是一款只需打开浏览器并粘贴文本即可制作语音的 AI 语音合成服务。
无论是 PC、手机还是平板电脑,现在就可以免费制作语音。
由于语音生成是在云端(服务器端)进行的,即使 PC 没有配备 GPU 也没有问题。
服务内置了男声、女声、童声等多种声音,无需准备参考语音或 Caption,只需选择即可立即朗读。
长篇文章也可以直接朗读。
而且 Ondoku 还支持英语!
它支持法语、西班牙语、韩语、中文等多种语言,因此也可用于日语以外的朗读。
此外,通过 下一代 AI 语音 (OndokuBeta),你还可以体验到更加自然的朗读。
如果你正在寻找将文本朗读为语音的方法,不妨体验一下免费且简单易用的 『Ondoku』 吧。
Ondoku 与 Irodori-TTS 的区别对比
最后,对比一下 Ondoku 和 Irodori-TTS 的主要区别。
| 项目 | Ondoku | Irodori-TTS |
|---|---|---|
| 运行方式 | 云端(在浏览器中操作) | 本地(在自己的 PC 上处理) |
| 安装设置 | 不需要 | 需要搭建 Python、Git 等环境 |
| 支持语言 | 35 种以上 | 仅限日语 |
| 声音选择方式 | 从多种声音中直接选择 | 通过语音克隆、Caption、绘文字指定 |
| 单次生成上限 | 支持长篇文章 | 约为 30 秒 |
| 商业利用 | 可以(免费使用时需注明版权) | 可以(MIT 许可证) |
| 支持设备 | PC、手机、平板电脑 | PC(建议使用 GPU) |
| 费用 | 有免费计划(付费计划可增加字符数) | 免费(因为是在本地运行) |
对比来看,追求便捷和即刻使用的朋友可以选择 Ondoku;如果你拥有高性能 PC 并希望精细打磨语音表现,则可以使用 Irodori-TTS。
对于现在就需要语音、需要多语言朗读、或者想在手机或平板电脑上使用的用户,推荐 Ondoku。
它也适合那些想要直接朗读长篇文章、不想在安装设置上花费时间、或者 PC 没有配备 GPU 的用户。
只需打开浏览器即可立即生成高质量语音,快来免费试用 Ondoku 吧!
Irodori-TTS 特点、安装设置及用法总结
在这篇文章中,我们介绍了专门针对日语、本地运行的 AI 语音合成软件 Irodori-TTS。
Irodori-TTS 通过语音克隆、基于 Caption 的音质设计、以及基于绘文字的情感控制,对于那些在语音表现上有极致追求的用户来说,是一个非常有吸引力的工具。
不过,它的安装设置方法和用法面向高级用户,需要搭建 Python 和 Git 的环境。
此外,在没有 GPU 的 PC 上,生成语音会比较耗时。
对于“现在就想轻松使用语音合成”的朋友,推荐使用只需浏览器即可操作的 『Ondoku』。
通过这款简单好用的免费 AI 语音合成服务,你也来尝试制作高质量的语音吧?
■ AI语音合成软件“Ondoku”
“Ondoku”是一种在线文本转语音工具,无需初始费用即可使用。
- 支持日语、英语、中文、韩语、西班牙语、法语、德语等约50种语言。
- PC 和智能手机均可使用
- 适用于商务、教育、娱乐等。
- 无需安装,可从浏览器立即使用
- 还支持从图像中读出
要使用它,只需输入文本或从网站上传文件即可。 在几秒钟内生成自然的声音文件。 您可以免费使用最多 5,000 个字符的语音合成,因此请先尝试一下。
Email: ondoku3.com@gmail.com