COLLECTING TEXTUAL DATA FROM WEBSITES FOR LOW-RESOURCE LANGUAGES

Uteuliev, Nietbay Uteulievich, Abdalieva, Gulistan Rafikovna, Kalmuratov, Bekbos Kushkinbaevich, Asenbaeva, Dalloris Adilbayevna, Утеулиев, Ниетбай Утеулиевич, Абдалиева, Гулистан Рафиковна, Калмуратов, Бекбос Кушкинбаевич, Асенбаева, Даллорис Адилбаевна, Uteuliev, Nietbay Uteulievich, Abdalieva, Gulistan Rafikovna, Kalmuratov, Bekbos Kushkinbaevich, Asenbaeva, Dalloris Adilbay qizi

Ilim ha’m ja’miyet · 2026-yil

Annotatsiya

This article focuses on the automatic collection of textual data from websites for low-resource languages, using the Karakalpak language as a case study. The study developed a methodology for collecting article texts from kknews.uz, yuz.uz, and joqargikenes.uz using Python, Requests, and BeautifulSoup. As a result, 1 386 navigation pages were analyzed, and a primary raw text database containing 18 784 articles and 6 090 553 words was formed. The collected raw corpus may serve as an initial resource for further preprocessing and for future development of NLP systems, machine translation tools, and Transformer-based models for the Karakalpak language.

Maqola ma’lumotlari
MualliflarUteuliev, Nietbay Uteulievich, Abdalieva, Gulistan Rafikovna, Kalmuratov, Bekbos Kushkinbaevich, Asenbaeva, Dalloris Adilbayevna, Утеулиев, Ниетбай Утеулиевич, Абдалиева, Гулистан Рафиковна, Калмуратов, Бекбос Кушкинбаевич, Асенбаева, Даллорис Адилбаевна, Uteuliev, Nietbay Uteulievich, Abdalieva, Gulistan Rafikovna, Kalmuratov, Bekbos Kushkinbaevich, Asenbaeva, Dalloris Adilbay qizi
JurnalIlim ha’m ja’miyet
Nashr sanasi2026-06-30
Son4-1
Betlar46-48
Tiluz_Latn

Kalit so‘zlar

qoraqalpoq tili, web scraping, elektron korpus, kam resursli tillar, NLP, каракалпакский язык, веб-скрейпинг, электронный корпус, языки с ограниченными ресурсами, NLP, Karakalpak language, web scraping, electronic corpus, low-resource languages, NLP

Ilmiy soha

Ilim ha’m ja’miyet jurnalidan boshqa maqolalar

Ilim ha’m ja’miyet — barcha maqolalar