Skip to content
Datasets

Yoruba Speech-Text Parallel Corpus

Verified
Datasets
Speech
Docs live

Large Yoruba parallel speech-text corpus of 1,647,022 audio-text pairs (~21.5 GB, WAV) aligned with the MMS-300M Forced Aligner for ASR and TTS, with clips of 0.04-12 seconds.

Category
Datasets
Pricing
Free / CC-BY 4.0
Country
🇳🇬 Nigeria
Last verified
25 Aug 2026
{
"name": "Yoruba Speech-Text Parallel Corpus",
"slug": "yoruba-speech-text-parallel-corpus",
"category": "DATASET",
"country": "NG",
"docs_status": "LIVE",
"licensing_required": "NONE",
"verified": true,
"last_verified": "2026-08-25",
"website": "https://huggingface.co/datasets/michsethowusu/yoruba-speech-text-parallel",
"documentation_url": "https://huggingface.co/datasets/michsethowusu/yoruba-speech-text-parallel"
}
get_resource("yoruba-speech-text-parallel-corpus") — via the Wycord MCP server

Verification history

  • 25 Aug 2026 · live
  • 22 Aug 2026 · live
  • 19 Aug 2026 · live
  • 16 Aug 2026 · live
  • 13 Aug 2026 · live
  • 10 Aug 2026 · live
  • 7 Aug 2026 · live
  • 4 Aug 2026 · live

Automated checks run every few days. See all recent status changes

Tags

speech
tts
asr
yoruba
parallel-corpus

Compare Yoruba Speech-Text Parallel Corpus

Side-by-side, verified specs against its closest speech alternatives.

See all verified datasets in Nigeria

Related in Datasets