--- language: ["pt"] tags: - automatic-speech-recognition - whisperx - audio - speech-to-text - portuguese license: mit library_name: whisperx base_model: openai/whisper-large-v3 datasets: - your_dataset_name metrics: - wer - cer --- # WhisperX Large-v3 — PRE-ACORDO This model is a **fine-tuned [Whisper](https://github.com/m-bain/whisperX)** variant of `openai/whisper-large-v3`, trained for **European Portuguese (EP) (around 425h)** automatic speech recognition (ASR). From [CAMÕES](https://arxiv.org/pdf/2508.19721) work. This is the best model for long-form inference. The text is normalized. --- ## 🧠 Model Description - **Base model:** `openai/whisper-large-v3` - **Architecture:** Transformer encoder–decoder - **Training:** Fine-tuned on around 425 hours of Portuguese speech - **Task:** Transcription (`task="transcribe"`) - **Compute type:** float16 (recommended) ## 🧩 Usage ```python import whisperx device = "cuda" # or "cpu" compute_type = "float16" model = whisperx.load_model( "inesc-id/WhisperLv3-EP-X", device=device, compute_type=compute_type, language="pt", task="transcribe" ) ## Citation **BibTeX:** ``` @inproceedings{camoes, title={{CAMÕES: A Comprehensive Automatic Speech Recognition Benchmark for European Portuguese}}, author={Carlos Carvalho, Francisco Teixeira, Catarina Botelho, Anna Pompili, Rubén Solera-Ureña, Sérgio Paulo, Mariana Julião, Thomas Rolland, John Mendonça, Diogo Pereira, Isabel Trancoso, Alberto Abad}, booktitle={Proceedings of the IEEE Automatic Speech Recognition and Understanding Workshop (ASRU)}, year={2025}, } ```