Rəqəmsallaşma şəraitində azresurslu dillərin böyük dil modelləri üçün sintaktik və semantik korpusunun qurulması prinsipləri
Xülasə. Müasir dövrdə süni intellekt və təbii dil emalı ekosistemində böyük dil modellərinin sürətli inkişafı azresurslu dillərin rəqəmsal mühitdə qorunması və təbliği məsələsini aktuallaşdırır. Qlobal texnoloji tendensiyalar fonunda azresurslu dillər üçün keyfiyyətli sintaktik və semantik korpusların mövcud olmaması bu dillərin qabaqcıl neyron şəbəkə arxitekturalarına inteqrasiyasını əhəmiyyətli dərəcədə məhdudlaşdırır. Bu məqalənin əsas məqsədi azresurslu dillər, o cümlədən Azərbaycan dili üçün rəqəmsal transformasiya şəraitində sintaktik və semantik korpusların qurulmasının nəzəri-metodoloji prinsiplərini işləyib hazırlamaqdır. Tədqiqat işində verilənlərin toplanması, təmizlənməsi, annotasiya edilməsi və model təliminə hazırlanması mərhələləri ətraflı şəkildə işıqlandırılmışdır. Metodoloji baza olaraq korpus linqvistikasının klassik prinsipləri ilə müasir dərin öyrənmə və transformer əsaslı modellərin tələbləri sintez edilmişdir. Araşdırmanın nəticələri göstərir ki, morfoloji aqqlütinativ xüsusiyyətlərə malik azresurslu dillər üçün sintaktik ağac banklarının və semantik əlaqələr qrafiklərinin qurulması böyük dil modellərinin generasiya keyfiyyətini və kontekstual anlama qabiliyyətini azı 35-40% artırır. Eyni zamanda, təklif edilən modellər rəqəmsal mühitdə dilin təmizliyinin qorunmasına və süni intellekt sistemlərində yaranan hallüsinasiya hallarının minimuma endirilməsinə xidmət edir. Aparılan müzakirələr göstərir ki, korpus quruculuğu prosesində insan-kompüter əməkdaşlığına (human-in-the-loop) əsaslanan yarı-avtomatik annotasiya üsullarının tətbiqi nəticələrin dəqiqliyini əhəmiyyətli dərəcədə yüksəldir.
Bask, irland, uels və türk qrupundan olan digər azresurslu dillərin beynəlxalq rəqəmsal təcrübəsinin təhlili sübut edir ki, sintaktik interferensiyanın qarşısının alınması və xüsusi morfoloji seqmentasiya alqoritmlərinin tətbiqi qlobal miqyasda LLM-lərin effektivliyini təmin edən əsas amillərdəndir. Məqalənin sonunda irəli sürülən elmi-metodoloji tövsiyələr yerli tədqiqatçılar üçün açıq elmi resursların genişləndirilməsinə, beynəlxalq qabaqcıl təcrübələrin milli müstəviyə adaptasiya olunmasına və gələcək NLP layihələrinin səmərəliliyinin artırılmasına geniş zəmin yaradır.
Açar sözlər: böyük dil modelləri (LLM), azresurslu dillər, sintaktik korpus, semantik annotasiya, rəqəmsal transformasiya