AnadilKyrgyzTTS — Kırgız (Kyrgyz) Text-to-Speech Modeli

AnadilKyrgyzTTS, openbmb/VoxCPM2 temel modeli üzerine LoRA (Low-Rank Adaptation) ile ince ayar yapılmış, Kırgızca (Kyrgyz, ISO 639-3: kir) için açık kaynak bir konuşma sentezi (text-to-speech) modelidir. 29.987 segmentlik tek konuşmacılı bir veri setiyle (Mozilla Common Voice ky katkısı) eğitilmiştir — "Anadil" ailesinin (Lazca, Zazaca, Adığece, Kurmancî, Ermenice, Ladino) en yeni üyesidir.

AnadilKyrgyzTTS is an open-source text-to-speech LoRA adapter for Kyrgyz (kir), fine-tuned on top of VoxCPM2 on 29,987 single-speaker utterances contributed to Mozilla Common Voice. It is the newest member of the "Anadil" family of minority-language TTS adapters, continuing the effort to give low-resource languages a voice in digital tools.

📋 Model Bilgileri

Özellik Detay
Dil Kırgızca (kir)
Konuşucu spk_tmp_001 (tek konuşmacı)
Temel model openbmb/VoxCPM2
Yöntem LoRA (r=32, α=32, LM + DiT katmanları)
Eğitim verisi 29.987 segment — Common Voice ky (tek katkıcı, 3.065 klip)
Eğitim adımı 5.000
Adapter boyutu ~72 MB (384 tensor, ~18,1M parametre, F32)
Sample rate 48 kHz çıkış
Lisans MIT

🔊 Örnek Sesler — Orijinal ve Sentez Karşılaştırması

Aşağıda orijinal referans ses (gerçek konuşmacı) ile modelin ürettiği sentez (TTS) arasındaki farkları duyabilirsiniz:

Not: Şeffaflık için belirtelim — bu 5 örnek cümlenin tümü eğitim sırasında modele görülmüş (in-training) cümlelerdir. Otomatik kalite metrikleri (WER vb.) henüz hesaplanmamıştır.

1. Антпесе үй ээлери да, коноктор да штраф төлөшөт.

Orijinal (Gerçek Konuşmacı) Sentez (Model Çıktısı)

2. Силерде башкасы жок, ошондуктан мага кармангыла.

Orijinal (Gerçek Konuşmacı) Sentez (Model Çıktısı)

3. Дагы жабырлануучу жеңил жаракат алган.

Orijinal (Gerçek Konuşmacı) Sentez (Model Çıktısı)

4. Мен силерге эч качан баарын айтып бербейм.

Orijinal (Gerçek Konuşmacı) Sentez (Model Çıktısı)

5. Алар документтерге өзгөртүү киргизип, жаңы документ түзүшкөн.

Orijinal (Gerçek Konuşmacı) Sentez (Model Çıktısı)

⚡ Hızlı Başlangıç

Model, hedef konuşmacının referans ses klibi (reference wav) üzerinden ses klonlaması yapar — eğitim konuşucusu için samples/1.wav kullanılabilir, farklı bir ses için kendi wav kaydınızı verin.

pip install torch torchaudio soundfile safetensors numpy voxcpm
git clone https://huggingface.co/Anadilorg/Anadil_Kyrgyz_TTS
cd Anadil_Kyrgyz_TTS

# Tek cümle sentezle
python inference.py "Саламатсызбы!" --reference samples/1.wav --out hello.wav

# Repo'daki 5 örnek cümlenin tümünü üret (samples/<n>a.wav)
python inference.py --list-samples

Python API

from inference import AnadilKyrgyzTTS

tts = AnadilKyrgyzTTS()  # openbmb/VoxCPM2 + bu repo'daki LoRA ağırlıkları
tts.synthesize(
    "Саламатсызбы!",
    reference_wav="samples/1.wav",
    out_path="hello.wav",
    cfg_value=2.0,
    inference_timesteps=10,
)

Gradio arayüzü (yerel)

pip install gradio
python demo.py            # http://localhost:7860

🧪 Doğrulama

python test_smoke.py --weights-only   # saniyeler içinde ağırlık bütünlük kontrolü
python test_smoke.py                  # tam test: temel modeli indirir, Kırgızca bir cümle sentezler

⚠️ Kısıtlamalar

  • Tek konuşmacı: Model tek bir konuşmacı (Common Voice katkıcısı) üzerine eğitilmiştir; farklı sesler referans klip ile sıfır-örnekçi klonlama yoluyla yaklaşılmaya çalışılır.
  • Kısa veri seti: 29.987 segment tek bir konuşmacıya aittir; model o konuşmacının üslubuna yakındır.
  • Kalite metrikleri: Henüz otomatik metrikler (WER, UTMOS vb.) raporlanmamıştır; örnekler eğitim içi cümlelerle sınırlıdır.
  • Sentez için ~9 GB bellek önerilir (fp32); CUDA tercih edilir, Apple Silicon daha yavaştır.

Citation

@software{anadil-kyrgyz-tts,
  author = {Anadilorg},
  title = {AnadilKyrgyzTTS: An Open-Source Text-to-Speech LoRA Adapter for Kyrgyz},
  url = {https://huggingface.co/Anadilorg/Anadil_Kyrgyz_TTS},
  version = {0.1.0},
  year = {2026}
}

Lisans

MIT — ayrıntılar için LICENSE dosyasına bakınız. Eğitim verisi Mozilla Common Voice (ky) katkısından gelmektedir; ilgili lisans koşullarını (CC-0) lütfen gözden geçiriniz.

Downloads last month
46
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for Anadilorg/Anadil_Kyrgyz_TTS

Base model

openbmb/VoxCPM2
Adapter
(30)
this model