Instructions to use Anadilorg/Anadil_Kyrgyz_TTS with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- VoxCPM
How to use Anadilorg/Anadil_Kyrgyz_TTS with VoxCPM:
import soundfile as sf from voxcpm import VoxCPM model = VoxCPM.from_pretrained("Anadilorg/Anadil_Kyrgyz_TTS") wav = model.generate( text="VoxCPM is an innovative end-to-end TTS model from ModelBest, designed to generate highly expressive speech.", prompt_wav_path=None, # optional: path to a prompt speech for voice cloning prompt_text=None, # optional: reference text cfg_value=2.0, # LM guidance on LocDiT, higher for better adherence to the prompt, but maybe worse inference_timesteps=10, # LocDiT inference timesteps, higher for better result, lower for fast speed normalize=True, # enable external TN tool denoise=True, # enable external Denoise tool retry_badcase=True, # enable retrying mode for some bad cases (unstoppable) retry_badcase_max_times=3, # maximum retrying times retry_badcase_ratio_threshold=6.0, # maximum length restriction for bad case detection (simple but effective), it could be adjusted for slow pace speech ) sf.write("output.wav", wav, 16000) print("saved: output.wav") - Notebooks
- Google Colab
- Kaggle
AnadilKyrgyzTTS — Kırgız (Kyrgyz) Text-to-Speech Modeli
AnadilKyrgyzTTS, openbmb/VoxCPM2 temel modeli üzerine LoRA (Low-Rank Adaptation) ile ince ayar yapılmış, Kırgızca (Kyrgyz, ISO 639-3: kir) için açık kaynak bir konuşma sentezi (text-to-speech) modelidir. 29.987 segmentlik tek konuşmacılı bir veri setiyle (Mozilla Common Voice ky katkısı) eğitilmiştir — "Anadil" ailesinin (Lazca, Zazaca, Adığece, Kurmancî, Ermenice, Ladino) en yeni üyesidir.
AnadilKyrgyzTTS is an open-source text-to-speech LoRA adapter for Kyrgyz (kir), fine-tuned on top of VoxCPM2 on 29,987 single-speaker utterances contributed to Mozilla Common Voice. It is the newest member of the "Anadil" family of minority-language TTS adapters, continuing the effort to give low-resource languages a voice in digital tools.
📋 Model Bilgileri
| Özellik | Detay |
|---|---|
| Dil | Kırgızca (kir) |
| Konuşucu | spk_tmp_001 (tek konuşmacı) |
| Temel model | openbmb/VoxCPM2 |
| Yöntem | LoRA (r=32, α=32, LM + DiT katmanları) |
| Eğitim verisi | 29.987 segment — Common Voice ky (tek katkıcı, 3.065 klip) |
| Eğitim adımı | 5.000 |
| Adapter boyutu | ~72 MB (384 tensor, ~18,1M parametre, F32) |
| Sample rate | 48 kHz çıkış |
| Lisans | MIT |
🔊 Örnek Sesler — Orijinal ve Sentez Karşılaştırması
Aşağıda orijinal referans ses (gerçek konuşmacı) ile modelin ürettiği sentez (TTS) arasındaki farkları duyabilirsiniz:
Not: Şeffaflık için belirtelim — bu 5 örnek cümlenin tümü eğitim sırasında modele görülmüş (in-training) cümlelerdir. Otomatik kalite metrikleri (WER vb.) henüz hesaplanmamıştır.
1. Антпесе үй ээлери да, коноктор да штраф төлөшөт.
| Orijinal (Gerçek Konuşmacı) | Sentez (Model Çıktısı) |
|---|---|
2. Силерде башкасы жок, ошондуктан мага кармангыла.
| Orijinal (Gerçek Konuşmacı) | Sentez (Model Çıktısı) |
|---|---|
3. Дагы жабырлануучу жеңил жаракат алган.
| Orijinal (Gerçek Konuşmacı) | Sentez (Model Çıktısı) |
|---|---|
4. Мен силерге эч качан баарын айтып бербейм.
| Orijinal (Gerçek Konuşmacı) | Sentez (Model Çıktısı) |
|---|---|
5. Алар документтерге өзгөртүү киргизип, жаңы документ түзүшкөн.
| Orijinal (Gerçek Konuşmacı) | Sentez (Model Çıktısı) |
|---|---|
⚡ Hızlı Başlangıç
Model, hedef konuşmacının referans ses klibi (reference wav) üzerinden ses klonlaması yapar — eğitim konuşucusu için samples/1.wav kullanılabilir, farklı bir ses için kendi wav kaydınızı verin.
pip install torch torchaudio soundfile safetensors numpy voxcpm
git clone https://huggingface.co/Anadilorg/Anadil_Kyrgyz_TTS
cd Anadil_Kyrgyz_TTS
# Tek cümle sentezle
python inference.py "Саламатсызбы!" --reference samples/1.wav --out hello.wav
# Repo'daki 5 örnek cümlenin tümünü üret (samples/<n>a.wav)
python inference.py --list-samples
Python API
from inference import AnadilKyrgyzTTS
tts = AnadilKyrgyzTTS() # openbmb/VoxCPM2 + bu repo'daki LoRA ağırlıkları
tts.synthesize(
"Саламатсызбы!",
reference_wav="samples/1.wav",
out_path="hello.wav",
cfg_value=2.0,
inference_timesteps=10,
)
Gradio arayüzü (yerel)
pip install gradio
python demo.py # http://localhost:7860
🧪 Doğrulama
python test_smoke.py --weights-only # saniyeler içinde ağırlık bütünlük kontrolü
python test_smoke.py # tam test: temel modeli indirir, Kırgızca bir cümle sentezler
⚠️ Kısıtlamalar
- Tek konuşmacı: Model tek bir konuşmacı (Common Voice katkıcısı) üzerine eğitilmiştir; farklı sesler referans klip ile sıfır-örnekçi klonlama yoluyla yaklaşılmaya çalışılır.
- Kısa veri seti: 29.987 segment tek bir konuşmacıya aittir; model o konuşmacının üslubuna yakındır.
- Kalite metrikleri: Henüz otomatik metrikler (WER, UTMOS vb.) raporlanmamıştır; örnekler eğitim içi cümlelerle sınırlıdır.
- Sentez için ~9 GB bellek önerilir (fp32); CUDA tercih edilir, Apple Silicon daha yavaştır.
Citation
@software{anadil-kyrgyz-tts,
author = {Anadilorg},
title = {AnadilKyrgyzTTS: An Open-Source Text-to-Speech LoRA Adapter for Kyrgyz},
url = {https://huggingface.co/Anadilorg/Anadil_Kyrgyz_TTS},
version = {0.1.0},
year = {2026}
}
Lisans
MIT — ayrıntılar için LICENSE dosyasına bakınız. Eğitim verisi Mozilla Common Voice (ky) katkısından gelmektedir; ilgili lisans koşullarını (CC-0) lütfen gözden geçiriniz.
- Downloads last month
- 46
Model tree for Anadilorg/Anadil_Kyrgyz_TTS
Base model
openbmb/VoxCPM2