whisper
View on GitHubRobust Speech Recognition via Large-Scale Weak Supervision
OpenAI's reference implementation and weights for Whisper, a Transformer speech model that transcribes and translates audio, plus language ID. Ships a CLI and Python API across six model sizes (tiny to large-v3, turbo).
Use Cases
transcribe audio files to texttranslate non-English speech into Englishgenerate subtitles and captionsmultilingual speech recognitionspoken language identificationvoice activity detectionbatch transcription via CLIPython-embedded transcription pipelinesmeeting and podcast transcriptionlower-level decoding and language probing
Built With
- Language
- Python
- Frameworks
- PyTorch · tiktoken · numba · NumPy · triton · ffmpeg · more-itertools · tqdm · pytest
Tags
speech-recognition · asr · transcription · multilingual · speech-translation · language-identification · voice-activity-detection · audio · pytorch · openai · whisper · cli · inference · seq2seq · transformer