Inference Providers
Active filters: cuda
prism-ml/Ternary-Bonsai-27B-gguf
Text Generation
• 4B • Updated • 576k
• • 987
Text Generation
• 4B • Updated • 1.91M
• 621
prism-ml/Bonsai-27B-mlx-1bit
Text Generation
• 2B • Updated • 34.3k
• 173
prism-ml/Ternary-Bonsai-27B-mlx-2bit
Text Generation
• 3B • Updated • 27.6k
• 144
badtheorylabs/BTL-3-Compact
Text Generation
• 8B • Updated • 251
• 21
Text Generation
• 8B • Updated • 42.6k
• 759
petr567/Ornith-1.0-35B-MTP-Strix-Halo-Hybrid-GGUF
Text Generation
• 36B • Updated • 568
• 6
neroued/Qwen3.6-27B-NInfer
Image-Text-to-Text
• Updated • 3
ussoewwin/Flash-Attention-2_for_Windows
prism-ml/Bonsai-1.7B-gguf
Text Generation
• 2B • Updated • 23.3k
• 80
younghan-meta/Voxtral-4B-TTS-2603-ExecuTorch-CUDA
Text-to-Speech
• Updated • 24
• 1
ussoewwin/torchaudio-built-on-cu132-for-windows
ESpeech/milfer_denoiser_v1.0
Audio-to-Audio
• Updated • 5
ManniX-ITA/opencoti-llamafile
Updated • 58
• 1
neroued/Qwen3.6-35B-A3B-NInfer
Image-Text-to-Text
• Updated • 1
petr567/Ornith-1.0-35B-Strix-Halo-Hybrid-LMStudio-GGUF
Text Generation
• 35B • Updated • 341
• 1
Brooooooklyn/Qwen3.6-27B-NVFP4-mlx
Image-Text-to-Text
• 27B • Updated • 1.04k
• 1
Text Generation
• Updated • 9
• 23
CalderaAI/13B-Ouroboros-GPTQ4bit-128g-CUDA
Text Generation
• Updated • 3
marcorez8/llama-cpp-python-windows-blackwell-cuda
ValiantLabs/Qwen3-8B-ShiningValiant3
Text Generation
• 8B • Updated • 7
• 3
mradermacher/Qwen3-8B-ShiningValiant3-GGUF
8B • Updated • 596
• 2
mradermacher/Qwen3-8B-ShiningValiant3-i1-GGUF
8B • Updated • 420
• 2
ValiantLabs/Qwen3-1.7B-ShiningValiant3
Text Generation
• 2B • Updated • 13
• • 5
mradermacher/Qwen3-1.7B-ShiningValiant3-GGUF
2B • Updated • 142
mradermacher/Qwen3-1.7B-ShiningValiant3-i1-GGUF
2B • Updated • 294
ValiantLabs/Qwen3-4B-ShiningValiant3
Text Generation
• 4B • Updated • 45
• • 7
sequelbox/Qwen3-8B-PlumEsper
Text Generation
• 8B • Updated • 8
sequelbox/Qwen3-4B-PlumEsper
Text Generation
• 4B • Updated • 6