Skip to content
Datasets

WURA

Datasets
Docs live
Editor’s note: Imported from a community submission, needs review.

[ingest-scout] 49 GB document-level pretraining corpus spanning 16 African languages (Yoruba, Amharic, Egyptian Arabic, Hausa, and others) plus English/French/Arabic/Portuguese, built by auditing mC4 and crawling verified news sources; fetched HuggingFace page and confirmed 239 monthly downloads, Apache 2.0 license, collection updated June 2025, and use as the training corpus for AfriTeVa V2. High-quality complement to Wycord's existing NLP datasets.

Category
Datasets
Pricing
Not listed
Country
🇳🇬 Nigeria
Last verified
Not recorded
{
"name": "WURA",
"slug": "wura",
"category": "DATASET",
"country": "NG",
"docs_status": "LIVE",
"licensing_required": "NONE",
"verified": false,
"last_verified": null,
"website": "https://huggingface.co/datasets/castorini/wura",
"documentation_url": null
}
get_resource("wura") — via the Wycord MCP server
See all verified datasets in Nigeria

Related in Datasets