Arxiv
ELMİ TƏDQİQAT - 2026 ELMİ TƏDQİQAT - 2025 ELMİ TƏDQİQAT 2024 ELMİ TƏDQİQAT 2023 ELMİ TƏDQİQAT 2022 ELMİ TƏDQİQAT 2021

Rəqəmsallaşma şəraitində azresurslu dillərin böyük dil modelləri üçün sintaktik və semantik korpusunun qurulması prinsipləri

 

Yeganə Qəhrəmanova Изображение выглядит как круг, логотип, Графика, Шрифт

Содержимое, созданное искусственным интеллектом, может быть неверным.

 

Xülasə. Müasir dövrdə süni intellekt və təbii dil emalı ekosistemində böyük dil modellərinin sürətli inkişafı azresurslu dillərin rəqəmsal mühitdə qorunması və təbliği məsələsini aktuallaşdırır. Qlobal texnoloji tendensiyalar fonunda azresurslu dillər üçün keyfiyyətli sintaktik və semantik korpusların mövcud olmaması bu dillərin qabaqcıl neyron şəbəkə arxitekturalarına inteqrasiyasını əhəmiyyətli dərəcədə məhdudlaşdırır. Bu məqalənin əsas məqsədi azresurslu dillər, o cümlədən Azərbaycan dili üçün rəqəmsal transformasiya şəraitində sintaktik və semantik korpusların qurulmasının nəzəri-metodoloji prinsiplərini işləyib hazırlamaqdır. Tədqiqat işində verilənlərin toplanması, təmizlənməsi, annotasiya edilməsi və model təliminə hazırlanması mərhələləri ətraflı şəkildə işıqlandırılmışdır. Metodoloji baza olaraq korpus linqvistikasının klassik prinsipləri ilə müasir dərin öyrənmə və transformer əsaslı modellərin tələbləri sintez edilmişdir. Araşdırmanın nəticələri göstərir ki, morfoloji aqqlütinativ xüsusiyyətlərə malik azresurslu dillər üçün sintaktik ağac banklarının və semantik əlaqələr qrafiklərinin qurulması böyük dil modellərinin generasiya keyfiyyətini və kontekstual anlama qabiliyyətini azı 35-40% artırır. Eyni zamanda, təklif edilən modellər rəqəmsal mühitdə dilin təmizliyinin qorunmasına və süni intellekt sistemlərində yaranan hallüsinasiya hallarının minimuma endirilməsinə xidmət edir. Aparılan müzakirələr göstərir ki, korpus quruculuğu prosesində insan-kompüter əməkdaşlığına (human-in-the-loop) əsaslanan yarı-avtomatik annotasiya üsullarının tətbiqi nəticələrin dəqiqliyini əhəmiyyətli dərəcədə yüksəldir.

Bask, irland, uels və türk qrupundan olan digər azresurslu dillərin beynəlxalq rəqəmsal təcrübəsinin təhlili sübut edir ki, sintaktik interferensiyanın qarşısının alınması və xüsusi morfoloji seqmentasiya alqoritmlərinin tətbiqi qlobal miqyasda LLM-lərin effektivliyini təmin edən əsas amillərdəndir. Məqalənin sonunda irəli sürülən elmi-metodoloji tövsiyələr yerli tədqiqatçılar üçün açıq elmi resursların genişləndirilməsinə, beynəlxalq qabaqcıl təcrübələrin milli müstəviyə adaptasiya olunmasına və gələcək NLP layihələrinin səmərəliliyinin artırılmasına geniş zəmin yaradır.

 

Açar sözlər: böyük dil modelləri (LLM), azresurslu dillər, sintaktik korpus, semantik annotasiya, rəqəmsal transformasiya

 


Baxış: 12