Tới thẳng công cụ tạo giọng

enhsa là gì và ai đứng sau

CẬP NHẬT 28/8/2026

Một trang miễn phí mà không nói rõ mình sống bằng gì thì người dùng có quyền nghi. Đây là câu trả lời đầy đủ.

enhsa làm gì

enhsa nhận đoạn văn bạn dán vào và trả lại một tệp MP3 đọc đoạn văn đó. Hiện có 13 giọng studio tiếng Việt, giọng do người bản ngữ đọc cho 48 ngôn ngữ khác, và bạn tự tạo được giọng của chính mình từ một mẫu ghi âm 3–8 giây.

Mỗi lượt tối đa 500 từ, giữa hai lượt nghỉ 60 giây. Không có gói trả phí, không có bản nâng cấp, không có watermark trên tệp tải về.

Giọng được sinh ra như thế nào

Giọng không phải ghép sẵn từng âm tiết. Mỗi câu được một mô hình học sâu sinh trực tiếp trên GPU tại thời điểm bạn bấm nút. Đo thật trên máy đang chạy: một đoạn 500 từ tiếng Việt (khoảng 3.000 ký tự là trần) tốn khoảng 17 giây máy và cho ra khoảng 158 giây âm thanh.

Vì cả trang chạy trên một GPU duy nhất nên lúc đông người trang sẽ từ chối ngay và báo số giây nên chờ, thay vì bắt bạn chờ rồi lỗi. Đó là lý do có thời gian nghỉ giữa các lượt: để một người bấm liên tục không chiếm hết chỗ của những người còn lại.

Vì sao miễn phí

enhsa chạy trên máy chủ dùng chung với một dự án khác của cùng người vận hành, nên chi phí thêm cho trang này chủ yếu là điện và thời gian GPU rảnh. Không có nhà đầu tư nào cần thu hồi vốn từ bạn.

Đổi lại, đây là những thứ trang sẽ không làm: không quảng cáo, không bán hay chia sẻ dữ liệu người dùng cho bên môi giới, không gắn watermark rồi bán gói gỡ watermark, không bắt đăng ký để lấy email.

Điều trang chưa làm được

Phần này nằm ở đây có chủ ý — biết trước giới hạn thì bạn không mất công.

  • Mô hình nhận 646 mã ngôn ngữ, nhưng chỉ 48 ngôn ngữ có giọng người bản ngữ. Những mã còn lại đọc bằng giọng dựng từ mẫu tiếng Việt: nói đúng chữ nhưng vẫn nghe ra chất giọng người Việt. Đo bằng máy nhận dạng tiếng nói: tiếng Đức đọc đúng 95% số chữ mà máy vẫn xếp giọng đó vào tiếng Việt.
  • Tiếng Khmer đọc sai ngay cả khi dùng mẫu do người bản xứ đọc — đó là giới hạn của mô hình, không phải của mẫu.
  • Chữ số chỉ được đo là đọc đúng chắc chắn ở tiếng Việt. Với ngôn ngữ khác, công cụ báo trước ngay trên màn hình rằng số có thể bị đọc sai.
  • Không có API công khai, không có tài khoản, không có lịch sử các tệp bạn đã tạo.

Nguồn dữ liệu và ghi công

Giọng người bản ngữ được dựng từ bộ mẫu FLEURS của Google (Few-shot Learning Evaluation of Universal Representations of Speech), phát hành theo giấy phép Creative Commons Attribution 4.0 (CC BY 4.0). Mỗi giọng chỉ được đưa lên sau khi một máy nhận dạng tiếng nói xác nhận nó nghe ra đúng ngôn ngữ đó và đọc lại đúng trên 55% số chữ.

Kho giọng studio tiếng Việt do chính người vận hành thu và xử lý, không lấy từ bên thứ ba.

Ai vận hành

enhsa là dự án cá nhân, do một người vận hành tại Việt Nam, không phải sản phẩm của công ty nào. Trang không thu tiền, không có tài khoản người dùng và không thu thập thông tin định danh, nên mọi trao đổi đều qua hòm thư bên dưới.

Liên hệ: [email protected]