KARAKALPAK SPEECH CORPUS: THE FIRST BENCHMARK DATASET FOR AUTOMATIC SPEECH RECOGNITION

Kudaybergenov, Tangirbergen, Uteuliev, Niyetbay, Khudaybergenov, Kabul, Kudaybergenov, Jabbar

Al-Farg'oniy avlodlari · 2026-yil

Annotatsiya

While large-scale pre-trained models have significantly advanced multilingual Automatic Speech Recognition (ASR), many low-resource languages remain under-served due to the scarcity of high-quality annotated speech corpora. This paper introduces the Karakalpak Speech Corpus (KSC), the first publicly available benchmark dataset for Karakalpak, a Turkic language spoken by over two million people primarily in Karakalpakstan. The corpus encompasses 50 hours of predominantly read speech. The data was collected from 25 native speakers with a balanced gender distribution. To establish a performance benchmark, we fine-tuned the Wav2Vec 2.0 architecture, specifically evaluating the efficacy of transfer learning from multilingual pre-trained models

Maqola ma’lumotlari
MualliflarKudaybergenov, Tangirbergen, Uteuliev, Niyetbay, Khudaybergenov, Kabul, Kudaybergenov, Jabbar
JurnalAl-Farg'oniy avlodlari
Nashr sanasi2026-03-18
Son1
Betlar262-269
TilRus

Kalit so‘zlar

speech dataset, speech recognition, speech-to-text, Transfer Learning, Wav2Vec 2.0 model, Machine Learning, Deep Learning

Ilmiy soha

Al-Farg'oniy avlodlari jurnalidan boshqa maqolalar

Al-Farg'oniy avlodlari — barcha maqolalar