Irodori-TTS là gì? Hướng dẫn tính năng và cách sử dụng dễ hiểu
Ngày 28 tháng 7 năm 2026
Irodori-TTS là phần mềm đọc văn bản AI như thế nào vậy?
Có lẽ nhiều người đang quan tâm đến phần mềm đọc văn bản AI mới mang tên "Irodori-TTS".
Trong bài viết này, chúng tôi sẽ giải thích một cách dễ hiểu về đặc điểm, khả năng, lưu ý và cách sử dụng của Irodori-TTS.
Ngoài ra, dành cho những ai cảm thấy "việc thiết lập có vẻ khó khăn", chúng tôi cũng giới thiệu phương pháp tổng hợp giọng nói có thể sử dụng ngay mà không cần cài đặt.
Những điều bạn sẽ biết trong bài viết này
- Irodori-TTS là phần mềm như thế nào?
- Những gì Irodori-TTS có thể làm và các lưu ý
- Cách sử dụng Irodori-TTS (từ thiết lập đến điều chỉnh âm thanh)
- Phương pháp đề xuất khi việc xây dựng môi trường gặp khó khăn
Irodori-TTS là gì? Giải thích về phần mềm tổng hợp giọng nói AI tiếng Nhật
Đầu tiên, chúng tôi sẽ giải thích ngắn gọn về đặc điểm của Irodori-TTS, một phần mềm tổng hợp giọng nói AI.
Irodori-TTS là mô hình tổng hợp giọng nói AI chạy cục bộ
Irodori-TTS là phần mềm tổng hợp giọng nói AI chuyên dụng cho tiếng Nhật.
Người phát triển là Aratako, và phần mềm này được công khai miễn phí dưới dạng mã nguồn mở (giấy phép MIT).
Đặc điểm lớn nhất là khả năng "hoạt động cục bộ", nơi việc tổng hợp giọng nói được hoàn tất chỉ trên PC của chính bạn.
Vì toàn bộ quá trình xử lý tạo giọng nói đều diễn ra trên PC cá nhân, văn bản và dữ liệu giọng nói được tạo ra sẽ không bị gửi đến các máy chủ bên ngoài.
Sau khi thiết lập lần đầu, bạn có thể tạo giọng nói mà không cần kết nối internet và không giới hạn số lần tạo.
Tuy nhiên, việc thiết lập yêu cầu các công cụ lập trình như Python và Git.
Ngoài ra, để phần mềm hoạt động nhanh chóng, nhà phát triển khuyến nghị sử dụng PC cấu hình cao có trang bị GPU (card đồ họa).
Những gì Irodori-TTS có thể và không thể làm
Tiếp theo, chúng tôi sẽ giải thích về những gì Irodori-TTS có thể và không thể làm.
Những gì Irodori-TTS có thể làm
Vì Irodori-TTS hoạt động trong môi trường cục bộ, bạn có thể tạo giọng nói không giới hạn số lần.
Ngay cả trong môi trường không có kết nối internet, sau khi hoàn tất thiết lập lần đầu, bạn có thể tự do tạo ra giọng nói.
Có nhiều phương pháp được cung cấp để chỉ định loại giọng nói cần tạo, và nếu sử dụng tính năng caption, bạn có thể tạo ra chất giọng theo sở thích của mình chỉ bằng các chỉ dẫn văn bản.
Ngoài ra, bạn cũng có thể tái tạo giọng nói hiện có thông qua voice cloning hoặc thêm biểu cảm cảm xúc bằng các biểu tượng cảm xúc (emoji).
Vì sử dụng giấy phép MIT, giọng nói được tạo ra có thể sử dụng cho mục đích thương mại.
Các lưu ý về Irodori-TTS
Mặt khác, cũng có một số lưu ý bạn cần biết trước khi sử dụng Irodori-TTS.
Mỗi lần chỉ tạo được tối đa khoảng 30 giây giọng nói
Trong một lần tạo, thời lượng đọc tối đa chỉ khoảng 30 giây.
Nếu bạn muốn đọc một đoạn văn dài, bạn cần chia nhỏ văn bản và thực hiện tạo nhiều lần.
Khó để tạo ra giọng nói hoặc cách nói đúng như ý muốn
Irodori-TTS có độ linh hoạt cao nhưng bù lại, phần mềm không có sẵn các giọng nói mặc định (giọng nói cơ bản).
Do đó, nếu không chỉ định caption hoặc giọng nói tham chiếu, giới tính và độ tuổi sẽ thay đổi ngẫu nhiên sau mỗi lần tạo.
Khi muốn đọc bằng cùng một giọng, bạn cần nạp giọng nói tham chiếu.
Ngoài ra, phần mềm không có tính năng điều chỉnh thủ công độ nhấn nhá hoặc ngữ điệu.
Ngôn ngữ hỗ trợ chỉ có tiếng Nhật
Ngôn ngữ hỗ trợ chỉ có tiếng Nhật và không hỗ trợ các ngôn ngữ nước ngoài như tiếng Anh.
Ngoài ra, đôi khi có thể xảy ra lỗi đọc sai chữ Hán, vì vậy cần lưu ý.
Khuyến nghị PC cấu hình cao có trang bị GPU
Tùy thuộc vào thông số kỹ thuật của PC, thời gian tạo giọng nói có thể kéo dài.
Trên các PC không có GPU, ngay cả một đoạn văn ngắn cũng có thể mất khoảng 1 phút để tạo xong.
Với các CPU dòng phổ thông như Celeron hay N100, việc sử dụng thực tế sẽ cảm thấy khá khó khăn.
Cách sử dụng Irodori-TTS (Quy trình thiết lập)
Dưới đây là phần giải thích ngắn gọn về cách sử dụng Irodori-TTS.
Quy trình thiết lập tổng thể như sau:
- Cài đặt các phần mềm cần thiết
- Tạo thư mục làm việc
- Clone Irodori-TTS từ GitHub
- Cài đặt các gói (package) cần thiết
- Khởi động Irodori-TTS
- Nạp mô hình AI
- Đọc văn bản
1. Cài đặt các phần mềm cần thiết cho Irodori-TTS
Để thiết lập Irodori-TTS, bạn cần thực hiện các bước chuẩn bị.
Đầu tiên, hãy cài đặt 3 loại phần mềm này:
- Python 3.10 trở lên: Ngôn ngữ lập trình
- Git: Hệ thống quản lý phiên bản (cần thiết để tải Irodori-TTS)
- uv: Trình quản lý gói cho Python
Để cài đặt Python, Git và uv, trước tiên, hãy nhấp chuột phải vào menu Start và chọn "Terminal" (không cần khởi động với quyền quản trị).
Khi đó, màn hình Terminal (PowerShell) sẽ mở ra.
Tại màn hình này, hãy nhập các lệnh sau và thực thi.
winget install --id Git.Git -e
winget install --id=astral-sh.uv -e
Như vậy, bạn đã cài đặt xong những thứ cần thiết để thiết lập Irodori-TTS.
※ Vì Python được quản lý bởi uv, nên nó sẽ tự động được cài đặt trong quá trình thiết lập.
Sau khi cài đặt, hãy đóng Terminal (PowerShell) và mở lại một lần nữa (để "cập nhật đường dẫn").
2. Tạo thư mục làm việc
Tiếp theo, hãy tạo một thư mục làm việc.
Irodori-TTS sẽ được cài đặt tại đây.
Trong ví dụ này, chúng tôi tạo một thư mục tên là "irodori-tts" trực tiếp trong ổ C.
Sau khi tạo thư mục, hãy di chuyển đến thư mục đó trong Terminal.
cd C:\irodori-tts
3. Clone Irodori-TTS từ GitHub
Nhập lệnh sau vào Terminal để clone repository của Irodori-TTS từ GitHub.
git clone https://github.com/Aratako/Irodori-TTS.git
Việc clone repository chỉ mất vài giây để hoàn thành.
Nhập lệnh sau để di chuyển vào thư mục của repository vừa clone.
cd Irodori-TTS
4. Cài đặt các gói cần thiết
Nhập và thực thi lệnh sau để cài đặt các gói cần thiết để chạy Irodori-TTS.
uv sync
Quá trình này sẽ mất thời gian vì phải tải xuống và cài đặt một lượng lớn các gói.
Bản thân Python cũng sẽ được cài đặt tại đây.
Trong khi tải xuống và cài đặt, hãy chờ đợi và đừng đóng màn hình Terminal.
Vì sẽ tải xuống các tệp có dung lượng gần 3GB, nên khuyến nghị thực hiện thiết lập ở nơi có kết nối mạng tốt.
5. Khởi động Irodori-TTS
Sau khi việc tải xuống và cài đặt các gói hoàn tất, quá trình thiết lập đã xong.
Hãy khởi động Irodori-TTS.
Nhập lệnh sau, thực thi và chờ một chút để ứng dụng khởi động.
uv run python gradio_app.py --server-name 0.0.0.0 --server-port 7860
Khi màn hình Terminal hiển thị như sau nghĩa là việc khởi động đã hoàn tất.
Running on local URL: http://0.0.0.0:7860
Mở trình duyệt web và truy cập vào địa chỉ http://localhost:7860.
Giao diện của Irodori-TTS (WebUI) sẽ hiện ra như thế này.
6. Nạp mô hình AI
Để nạp mô hình AI dùng cho việc đọc văn bản, hãy nhấp vào "Load Model".
Lần đầu tiên sử dụng, khi nhấn nút này, quá trình tải xuống mô hình AI sẽ bắt đầu.
Khi thông báo hoàn tất hiển thị tại Model Status (khu vực được khoanh đỏ trong hình dưới), việc nạp mô hình AI đã xong.
7. Đọc văn bản bằng Irodori-TTS
Trong Irodori-TTS, bạn có thể đưa ra các chỉ dẫn về cách đọc, bao gồm cả biểu cảm cảm xúc, nhưng trước tiên hãy thử đọc mà không có chỉ dẫn nào.
Cuộn xuống dưới bạn sẽ thấy ô nhập văn bản, hãy nhập đoạn văn bạn muốn đọc vào đó.
Lần này chúng ta sẽ thử đọc câu "こんにちは、これはイロドリTTSで作成された音声です。" (Xin chào, đây là giọng nói được tạo bằng Irodori-TTS).
(Vì nếu viết "Irodori-TTS" bằng chữ cái Latinh thì phần mềm không đọc chính xác, nên tôi đã viết bằng Katakana là "イロドリTTS")
Nhấn nút "Generate" để bắt đầu quá trình tạo giọng nói.
Irodori-TTS sử dụng CPU hoặc GPU (card đồ họa) của PC để tạo giọng nói.
Do đó, tùy vào hiệu năng của PC mà thời gian tạo có thể thay đổi rất nhiều.
Lần này do tạo trên một laptop không có GPU, nên dù là đoạn văn ngắn nhưng cũng mất khoảng 1 phút để tạo xong.
Tham khảo: Thử nghiệm tạo trên môi trường CPU: Ryzen 5 4650U, RAM: DDR4 32GB, Windows 11 Pro 24H2.
Sau khi tạo xong, dạng sóng âm thanh sẽ hiển thị như thế này và bạn có thể phát giọng nói.
Ví dụ về việc đọc câu "こんにちは、これはイロドリTTSで作成された音声です。"
Nếu nghe thử thấy ổn, hãy nhấn nút tải xuống (biểu tượng mũi tên trỏ xuống) để lưu tệp âm thanh.
Tệp âm thanh sẽ được lưu dưới định dạng WAV.
Như vậy, bạn đã có thể tổng hợp giọng nói bằng Irodori-TTS.
Cách điều chỉnh giọng nói trong Irodori-TTS
Trong Irodori-TTS, bạn có thể điều chỉnh các biểu cảm như giới tính hay cảm xúc bằng nhiều phương pháp khác nhau.
Chỉ định biểu cảm cảm xúc bằng biểu tượng cảm xúc
Nhấp vào "Emoji Palette" bên dưới ô nhập văn bản để chọn biểu tượng cảm xúc.
Mỗi biểu tượng cảm xúc sẽ được gán cho một biểu cảm cảm xúc khác nhau.
- 😊 Vui vẻ, hạnh phúc
- 😭 Nức nở, tiếng khóc
- 😰 Vội vã, bối rối
- ⏩ Nói nhanh
- 📖 Lời dẫn chuyện, độc thoại
Chỉ cần thêm biểu tượng cảm xúc vào ô nhập văn bản, bạn có thể yêu cầu phần mềm đọc với biểu cảm cảm xúc đã chỉ định.
Ví dụ về việc đọc "😊 こんにちは、これはイロドリTTSで作成された音声です。"
Ví dụ về việc đọc "📖 こんにちは、これはイロドリTTSで作成された音声です。"
Tuy nhiên, nếu chỉ chỉ định biểu tượng cảm xúc, bạn sẽ không thể chỉ định cụ thể giới tính hay độ tuổi.
Nạp giọng nói tham chiếu để đọc bằng cùng một giọng
Trong Irodori-TTS, bạn có thể nạp tệp giọng nói tham chiếu và yêu cầu phần mềm đọc dựa trên giọng nói đó.
Bạn nạp giọng nói tham chiếu từ phần có ghi "音声をここにドロップ - または - クリックしてアップロード" (Thả âm thanh vào đây - Hoặc - Nhấp để tải lên).
Không chỉ có thể đọc bằng cùng một giọng, mà chất lượng âm thanh cũng sẽ trong trẻo hơn so với khi không chỉ định gì cả.
Có thể điều chỉnh trực tiếp phong cách đọc bằng tính năng caption
Trong Irodori-TTS, bạn cũng có thể chỉ định trực tiếp bằng văn bản loại giọng nói bạn muốn đọc.
Để sử dụng tính năng caption, bạn cần khởi động "Phiên bản VoiceDesign", và lệnh khởi động Irodori-TTS trong Terminal sẽ thay đổi.
uv run python gradio_app_voicedesign.py --server-name 0.0.0.0 --server-port 7861
Khi thực thi lệnh này, màn hình thao tác của phiên bản VoiceDesign sẽ khởi động.
Vì phiên bản VoiceDesign sử dụng mô hình AI khác với phiên bản tiêu chuẩn, lần đầu sử dụng bạn cần nhấp vào "Load Model" để tải xuống mô hình riêng biệt với phiên bản tiêu chuẩn.
Dung lượng mô hình AI khoảng 2GB, nên khuyến nghị tải xuống ở nơi có kết nối mạng tốt.
Trên màn hình thao tác của phiên bản VoiceDesign có một hộp văn bản "Caption / Style Prompt (optional)".
Tại đây, hãy nhập đoạn văn mô tả giọng nói mà bạn muốn phần mềm đọc.
- Hãy đọc bằng giọng nữ điềm tĩnh, cảm giác gần gũi, mềm mại và tự nhiên.
- Hãy nói bằng giọng nam tràn đầy năng lượng, tươi sáng và rõ ràng.
- Hãy đọc bằng giọng nam trầm, đều đều giống như một biên tập viên tin tức.
Bằng cách này, bạn có thể chỉ định loại giọng nói sẽ được tạo ra.
Ví dụ, khi chỉ định "Hãy đọc bằng giọng nữ điềm tĩnh, cảm giác gần gũi, mềm mại và tự nhiên.", giọng nói thu được sẽ như sau.
Ví dụ khi chỉ định "Hãy đọc bằng giọng nữ điềm tĩnh, cảm giác gần gũi, mềm mại và tự nhiên."
Tại đây cũng thu được giọng đọc rõ ràng và dễ nghe.
Tuy nhiên, tính năng caption có một số lưu ý.
Tính năng caption tốn nhiều thời gian tạo giọng nói hơn so với các phương pháp đọc khác.
Lần này khi tạo trên laptop, việc tạo đoạn văn ngắn này đã mất khoảng 5 phút.
Khi sử dụng tính năng caption, khuyến nghị sử dụng PC cấu hình cao có trang bị GPU.
Nếu đọc văn bản tiếng Anh thì sẽ như thế nào?
Irodori-TTS là phần mềm đọc văn bản chỉ hỗ trợ tiếng Nhật.
Vậy, nếu thử đọc văn bản tiếng Anh thì sẽ thế nào?
Hãy thử nhập một câu ví dụ đơn giản.
Ví dụ về việc đọc "Hello, this is a voice recording created using Irodori-TTS."
Như vậy, từ Hello bị phát âm thành "Haro" theo kiểu Katakana, và phần recording phát âm không rõ ràng, dẫn đến việc không thể đọc chính xác.
Khi muốn đọc văn bản tiếng Anh, bạn nên sử dụng các dịch vụ đọc văn bản AI hỗ trợ ngôn ngữ nước ngoài.
Phương pháp tổng hợp giọng nói đề xuất khi "việc thiết lập có vẻ khó khăn"
Sau khi đọc đến đây, chắc hẳn có một số bạn cảm thấy việc thiết lập Irodori-TTS có vẻ hơi vất vả.
Nếu không quen với các thao tác Terminal, chỉ riêng các bước chuẩn bị công cụ như Python, Git, cài đặt gói và tải mô hình AI cũng đã tốn rất nhiều thời gian.
Hơn nữa, nếu không sở hữu một PC có trang bị GPU, thời gian tổng hợp cho một lần giọng nói sẽ quá lâu, khiến việc sử dụng cho các mục đích như thuyết minh video trở nên khó khăn.
Các đoạn văn dài cũng cần được chia nhỏ thành từng phần khoảng 30 giây và tạo giọng nói nhiều lần.
Dành cho những ai muốn tạo giọng nói từ văn bản mà không cần cài đặt hay thiết lập phức tạp, dưới đây chúng tôi xin giới thiệu dịch vụ tổng hợp giọng nói AI có thể sử dụng trên trình duyệt.
『Ondoku』 Giọng nói AI có thể sử dụng mà không cần cài đặt
Khi muốn tổng hợp giọng nói dễ dàng với AI mới nhất, lựa chọn đề xuất là dịch vụ tổng hợp giọng nói AI 『Ondoku』.
『Ondoku』 là dịch vụ tổng hợp giọng nói AI giúp bạn tạo giọng nói chỉ bằng cách mở trình duyệt và dán văn bản.
Bạn có thể tạo giọng nói miễn phí ngay lập tức trên PC, điện thoại hoặc máy tính bảng.
Vì việc tạo giọng nói được thực hiện trên đám mây (phía máy chủ), nên PC của bạn không cần trang bị GPU vẫn hoạt động bình thường.
Vì nhiều loại giọng nói như giọng nam, giọng nữ, giọng trẻ em đã được chuẩn bị sẵn, bạn không cần chuẩn bị giọng nói tham chiếu hay caption mà chỉ cần chọn và đọc ngay lập tức.
Các đoạn văn dài cũng có thể được đọc trực tiếp.
Hơn nữa, Ondoku còn hỗ trợ cả tiếng Anh!
Vì hỗ trợ đa ngôn ngữ như tiếng Pháp, tiếng Tây Ban Nha, tiếng Hàn, tiếng Trung... nên nó có thể được sử dụng để đọc các ngôn ngữ khác ngoài tiếng Nhật.
Ngoài ra, bạn cũng có thể trải nghiệm giọng đọc tự nhiên hơn nữa với giọng nói AI thế hệ tiếp theo (OndokuBeta).
Khi bạn đang tìm kiếm phương pháp đọc văn bản thành giọng nói, tại sao không dùng thử 『Ondoku』 miễn phí và dễ dàng?
So sánh sự khác biệt giữa Ondoku và Irodori-TTS
Cuối cùng, chúng ta hãy so sánh những điểm khác biệt chính giữa Ondoku và Irodori-TTS.
| Mục | Ondoku | Irodori-TTS |
|---|---|---|
| Phương thức hoạt động | Đám mây (Thao tác trên trình duyệt) | Cục bộ (Xử lý trên PC của chính mình) |
| Thiết lập | Không cần | Cần xây dựng môi trường như Python, Git |
| Ngôn ngữ hỗ trợ | Hơn 35 ngôn ngữ | Chỉ tiếng Nhật |
| Cách chọn giọng nói | Chỉ cần chọn từ nhiều giọng nói có sẵn | Chỉ định qua voice cloning, caption, emoji |
| Giới hạn 1 lần tạo | Hỗ trợ văn bản dài | Tối đa khoảng 30 giây |
| Sử dụng thương mại | Có thể (Cần ghi nguồn khi sử dụng miễn phí) | Có thể (Giấy phép MIT) |
| Thiết bị hỗ trợ | PC, Điện thoại, Máy tính bảng | PC (Khuyến nghị GPU) |
| Chi phí | Có gói miễn phí (Tăng số ký tự với gói trả phí) | Miễn phí (Do hoạt động cục bộ) |
Khi so sánh, bạn có thể cân nhắc sử dụng: Ondoku về sự tiện lợi và có thể dùng ngay, còn Irodori-TTS nếu bạn có PC cấu hình cao và muốn thiết kế giọng nói một cách tỉ mỉ.
Với những ai muốn có giọng nói ngay lập tức, cần đọc đa ngôn ngữ, hoặc muốn sử dụng trên điện thoại/máy tính bảng thì Ondoku là lựa chọn đề xuất.
Nó cũng phù hợp cho những ai muốn đọc trực tiếp các đoạn văn dài, không muốn tốn thời gian thiết lập, hoặc PC không có GPU.
Bạn có thể tạo ra giọng nói chất lượng cao ngay lập tức chỉ bằng cách mở trình duyệt, vậy tại sao không thử sử dụng Ondoku miễn phí ngay bây giờ?
Tổng kết về đặc điểm, thiết lập và cách sử dụng Irodori-TTS
Trong bài viết này, chúng tôi đã giải thích về Irodori-TTS, một phần mềm tổng hợp giọng nói AI hoạt động cục bộ chuyên dụng cho tiếng Nhật.
Irodori-TTS là một công cụ hấp dẫn cho những ai muốn chú trọng vào biểu cảm giọng nói, chẳng hạn như thiết kế chất giọng qua voice cloning hay caption, và điều khiển cảm xúc bằng emoji.
Tuy nhiên, cách thiết lập và sử dụng dành cho người dùng nâng cao, yêu cầu phải xây dựng môi trường Python và Git để thiết lập.
Ngoài ra, trên những PC không có GPU, việc tạo giọng nói sẽ tốn nhiều thời gian.
Với những ai "muốn sử dụng tổng hợp giọng nói một cách dễ dàng và nhanh chóng", chúng tôi khuyên dùng 『Ondoku』, công cụ có thể sử dụng chỉ với trình duyệt.
Tại sao bạn không thử tạo ra những giọng nói chất lượng cao với trình tổng hợp giọng nói AI miễn phí và dễ sử dụng này?
■ Phần mềm tổng hợp giọng nói AI “Ondoku”
"Ondoku" là một công cụ chuyển văn bản thành giọng nói trực tuyến có thể được sử dụng mà không mất phí ban đầu.
- Hỗ trợ khoảng 50 ngôn ngữ bao gồm tiếng Nhật, tiếng Anh, tiếng Trung, tiếng Hàn, tiếng Tây Ban Nha, tiếng Pháp và tiếng Đức.
- Có sẵn từ cả PC và điện thoại thông minh
- Thích hợp kinh doanh, giáo dục, giải trí, v.v.
- Không cần cài đặt, có thể sử dụng ngay từ trình duyệt
- Cũng hỗ trợ đọc từ hình ảnh
Để sử dụng nó, chỉ cần nhập văn bản hoặc tải tệp lên từ trang web. Tạo tập tin âm thanh tự nhiên trong vài giây. Bạn có thể sử dụng miễn phí tính năng tổng hợp giọng nói với tối đa 5.000 ký tự, vì vậy vui lòng dùng thử trước.
Email: ondoku3.com@gmail.com
Phần mềm đọc văn bản Ondoku. Đây là dịch vụ chuyển văn bản thành giọng nói không cần cài đặt và mọi người có thể sử dụng miễn phí. Nếu bạn đăng ký miễn phí, bạn có thể nhận được tối đa 5000 ký tự miễn phí mỗi tháng. Đăng ký ngay bây giờ miễn phí
- Ondoku là gì?
- Đọc văn bản trên Ondoku
- Đăng ký miễn phí
- Gói cước
- Danh sách các bài báo
- Thử các dịch vụ miễn phí khác