37.9 GB
78 files
Updated 21 days ago
Name
Size
data
.gitattributes2.46 kB
xet
README.md2.32 kB
xet
README.md

Azerbaijani ASR Dataset

Dataset Description

This dataset contains Azerbaijani speech data for Automatic Speech Recognition (ASR) tasks.

Dataset Summary

  • Language: Azerbaijani (az)
  • Task: Automatic Speech Recognition
  • Total Duration: ~328 hours
  • Total Samples: ~345,643 audio-text pairs
  • Audio Format: WAV, 16kHz sampling rate
  • License: CC-BY-4.0

Dataset Structure

Each audio segment is specially numbered so that you can merge them if you need to create longer segments.

DatasetDict({
    train: Dataset({
        features: ['audio', 'text', 'duration', 'audio_file'],
        num_rows: [total_samples]
    })
})

Features

  • audio: Audio file (WAV format, 16kHz)
  • text: Transcription of the audio (Azerbaijani text)
  • duration: Duration of audio clip in seconds
  • audio_file: Original filename of the audio segment

Usage

from datasets import load_dataset

# Load the dataset
dataset = load_dataset("LocalDoc/azerbaijani_asr")

# Access train split
train_dataset = dataset["train"]

# Example usage
for example in train_dataset:
    audio = example["audio"]
    text = example["text"]
    duration = example["duration"]

Duration Distribution

  • 0-2 sec: 36.1%
  • 2-5 sec: 47.2%
  • 5-10 sec: 14.6%
  • 10-20 sec: 2.0%
  • 20+ sec: 0.1%

Use Cases

  • Fine-tuning Whisper models for Azerbaijani
  • Training new ASR models for Azerbaijani language
  • Benchmarking ASR performance on Azerbaijani

Citation

If you use this dataset, please cite:

@dataset{azerbaijani_asr_2025,
  title={Azerbaijani ASR Dataset},
  author={LocalDoc},
  year={2025},
  url={https://huggingface.co/datasets/LocalDoc/azerbaijani_asr}
}
Total size
37.9 GB
Files
78
Last updated
Sep 11
Pre-warmed CDN
US EU US EU

Contributors