SpeechT5: Unified-Modal Encoder-Decoder Pre-Training for Spoken Language Processing
Paper • 2110.07205 • Published • 6
How to use Amirhossein75/Speech-Conversion with Transformers:
# pip install -U transformers accelerate
# Load model directly
from transformers import AutoProcessor, SpeechT5ForSpeechToSpeech
processor = AutoProcessor.from_pretrained("Amirhossein75/Speech-Conversion")
model = SpeechT5ForSpeechToSpeech.from_pretrained("Amirhossein75/Speech-Conversion", device_map="auto")How to use Amirhossein75/Speech-Conversion with speechbrain:
# interface not specified in config.json
speech-conversion
Any‑to‑any voice conversion (speech‑to‑speech) powered by Microsoft’s SpeechT5 voice‑conversion model. Convert a source utterance into the timbre of a target speaker using a short reference clip.
This model card documents the repository amirhossein-yousefi/speech-conversion, which wraps the Hugging Face implementation of SpeechT5 (voice conversion) and the matching HiFiGAN vocoder, with a lightweight training loop and optional AWS SageMaker entry points.
microsoft/speecht5_vc (with microsoft/speecht5_hifigan as vocoder); speaker embeddings via speechbrain/spkrec-ecapa-voxceleb1,571,716,275,216,842,800 1,688.2899 seconds# Requirements (Python 3.10+)
pip install "transformers>=4.42" "datasets>=2.20" "torch>=2.1" \
"numpy>=1.24" "sentencepiece>=0.1.99" "protobuf>=4.23" \
"speechbrain>=1.0.0" soundfile
# One‑shot conversion (mono 16 kHz WAVs)
python scripts/convert_once.py \
--checkpoint microsoft/speecht5_vc \
--src path/to/src.wav \
--ref path/to/ref.wav \
--out converted.wav
Base model
microsoft/speecht5_hifigan