Vibe Coding Discover

AI Frameworks

stable-audio-tools

View on GitHub

Generative models for conditional audio generation

★ 3.9K485 forksPythonMITStability-AI

Stability AI's toolkit for training and running generative audio models: latent diffusion, autoencoders, and LMs with text/audio conditioning. Includes training scripts, fine-tuning/LoRA support, and a Gradio UI for Stable Audio Open.

Use Cases

Text-to-audio and sound effect generationTraining conditional diffusion audio models from scratchFine-tuning pretrained audio models on custom datasetsLoRA fine-tuning for audio diffusion modelsAudio inpainting and continuationTraining audio autoencoders for latent diffusionRunning a local Gradio demo for Stable Audio OpenBuilding WebDataset/S3 audio training pipelinesMulti-GPU and multi-node audio model trainingUnwrapping Lightning checkpoints for inference

Built With

Language
Python
Frameworks
PyTorch · PyTorch Lightning · Hugging Face Hub · Gradio · Transformers · DeepSpeed · Flash Attention · WandB · WebDataset · uv

Tags

audio-generation · text-to-audio · diffusion-models · latent-diffusion · generative-audio · training · inference · autoencoder · fine-tuning · lora · audio-codec · music-generation · conditioning · gradio · deep-learning · checkpoints