Odkrivanje besedil, generiranih z umetno inteligenco, za jezike z omejenimi jezikovnimi viri (inavguracijsko predavanje)

Hiter razvoj velikih jezikovnih modelov (LLM) je ustvaril vse večjo potrebo po zanesljivih metodah za razlikovanje med besedili, ustvarjenimi z umetno inteligenco, in besedili, ki so jih napisali ljudje. Obstoječi pristopi za zaznavanje vključujejo statistične metode, stilometrično analizo, tehnike, ki temeljijo na perplexity oziroma meri presenečenja modela, klasifikatorje na osnovi transformerjev ter velike nevronske modele, posebej naučene za zaznavanje besedil, ustvarjenih z umetno inteligenco.

Čeprav številne od teh metod dosegajo visoko natančnost na referenčnih podatkovnih zbirkah, se njihova učinkovitost pogosto zmanjša pri uporabi na novih področjih, novih jezikovnih modelih, parafraziranih besedilih ali spremenjenih vsebinah. Pomembna omejitev je tudi jezikovna pristranskost. Večina obstoječih detektorjev je razvita in ovrednotena predvsem za angleščino, medtem ko je njihova učinkovitost pri drugih jezikih pogosto bistveno slabša, zlasti pri morfološko bogatih jezikih in jezikih z malo jezikovnimi viri.

V tem predavanju obravnavamo preprosto vprašanje: kako se obstoječi detektorji obnesejo pri premalo zastopanih jezikih — pri čemer v dobi velikih jezikovnih modelov v to skupino pravzaprav sodijo vsi neangleški jeziki — ter pri morfološko bogatih jezikih.

Predlagana metoda se osredotoča na preproste statistične lastnosti vektorskih predstavitev (embeddingov) in tako ponuja bolj jezikovno neodvisno alternativo za večjezično zaznavanje besedil, ustvarjenih z umetno inteligenco, zlasti za jezike, ki so v trenutnih raziskavah premalo zastopani.

Predavatelj: prof. dr. Jernej Vičič

Jernej je profesor na Fakulteti za matematiko, naravoslovje in informacijske tehnologije Univerze na Primorskem.
Je ustanovitelj in ko-predstojnik laboratorija D(LT)^2 (laboratorij za blockchain in jezikovne tehnologije).
Zaključil je študij računalništva, med katerim je razvil raziskovalno zanimanje za jezikovne tehnologije, strojno učenje, porazdeljene sisteme in analizo omrežij. Pri svojem delu se trenutno osredotoča na umetno inteligenco, obdelavo naravnega jezika, porazdeljeno računalništvo in sisteme, ki temeljijo na tehnologiji veriženja blokov. Sodeluje pri več nacionalnih in mednarodnih raziskovalnih projektih s področij umetne inteligence, analize podatkov in naprednih digitalnih tehnologij.

Predavanje bo potekalo v okviru Ponedeljkovega seminarja računalništva in informatike
v ponedeljek, 5.10.2026 s pričetkom ob 16:00 v predavalnici FAMNIT-VP3.

Delite z drugimi

Orodna vrstica za dostopnost