Close-up of a high-tech server rack with glowing fiber optic
Technický rozbor č. 042

Ako fungujú magické jazykové modely?

Zabudnite na rozprávky o digitálnom vedomí. LLM (Large Language Models) sú v skutočnosti len masívne štatistické kalkulačky, ktoré predpovedajú nasledujúci kúsok textu. Marketingoví experti vám predávajú „kreativitu“, my vám ukážeme surovú matematiku za každým slovom.

Tokenizácia: Prečo AI nečíta slová?

Keď do ChatGPT napíšete vetu, model ju okamžite rozbije na drobné fragmenty zvané tokeny. Token nie je nutne celé slovo; môže to byť slabika, predpona alebo dokonca len jedno písmeno. Tento proces je nevyhnutný, pretože neurónové siete nepracujú s písmenami, ale s číselnými vektormi v multidimenzionálnom priestore.

Priemerný token v angličtine má približne 4 znaky, čo znamená, že 1000 tokenov je zhruba 750 slov. V slovenčine je tento pomer kvôli diakritike a zložitej morfológii menej efektívny. Ak model nerozumie kontextu, je to často preto, že tokenizácia rozbila kľúčový odborný termín na nezmyselné fragmenty, ktoré stratili svoj sémantický náboj.

Fakt: GPT-4 spracováva informácie v kontextovom okne, ktoré môže presiahnuť 128 000 tokenov.

Vektorový priestor

Každý token je reprezentovaný ako bod v priestore s tisíckami dimenzií. Slová „kráľ“ a „kráľovná“ sú v tomto priestore matematicky blízko seba, zatiaľ čo „kráľ“ a „hriankovač“ sú od seba vzdialené.

  • Sémantické mapovanie
  • Matematické vzťahy
Viac o vektoroch →

Pravdepodobnosť vs. Kreativita

Predstavte si LLM ako extrémne sofistikovanú funkciu automatického dopĺňania v telefóne. Keď model generuje text, nerobí to na základe „pochopenia“ témy, ale na základe výpočtu pravdepodobnosti. Ak veta začína slovami „Hlavné mesto Slovenska je...“, model nevyťahuje informáciu z pamäti ako človek. Namiesto toho vypočíta, že token „Bratislava“ má 99,9 % pravdepodobnosť, že bude nasledovať.

„Jazykový model nemá názor. Má len distribúciu pravdepodobnosti nad množinou tokenov, ktorú mu vnútil tréningový dataset.“

Tu prichádza na rad takzvaná „teplota“ (temperature). Ak nastavíte teplotu na 0, model bude vždy vyberať ten najpravdepodobnejší token. Výsledok bude fakticky presný, ale nudný a repetitívny. Ak teplotu zvýšite, model začne vyberať menej pravdepodobné cesty. To je to, čo marketéri nazývajú „kreativitou“, ale v skutočnosti je to len riadený chaos. Príliš vysoká teplota vedie k blábolom, príliš nízka k robotickému textu, ktorý Google ľahko identifikuje.

Problém nastáva, keď sa pravdepodobnosť stretne s nedostatkom dát. Ak sa spýtate na neexistujúcu historickú udalosť, model sa stále pokúsi predpovedať „najpravdepodobnejšie“ nasledujúce slovo. Výsledkom je presvedčivo znejúca lož. Tento mechanizmus je základom halucinácií, o ktorých podrobnejšie píšeme v sekcii o korekcii AI výstupov.

Analýza chybovosti: Prečo AI klame?

Nasledujúca tabuľka ukazuje typické scenáre, kedy štatistický model zlyháva a prečo je ľudský dohľad kritický pre zachovanie integrity obsahu.

Typ zlyhania Príčina (Mechanika) Miera rizika Riešenie
Faktuálna halucinácia Nedostatok tréningových dát pre špecifickú niche tému. Vysoká Externé overenie dát (RAG - Retrieval-Augmented Generation).
Logický klam Model sleduje gramatickú štruktúru, nie logickú kauzalitu. Stredná Chain-of-Thought prompting (krok za krokom).
Sémantický drift Dlhé texty spôsobujú stratu pozornosti (Attention mechanism). Nízka Rozdelenie textu na menšie logické bloky.
Bias (Predpojatosť) Odraz stereotypov prítomných v internetových dátach. Stredná Špecifikácia tónu a perspektívy v system prompte.

Architektúra Transformer: Revolúcia pozornosti

Všetky moderné modely ako GPT, Claude alebo Llama stoja na architektúre zvanej Transformer, predstavenej spoločnosťou Google v roku 2017. Kľúčovým prvkom je mechanizmus „self-attention“ (vlastná pozornosť). Ten umožňuje modelu pri generovaní každého slova brať do úvahy všetky predchádzajúce slová v kontexte a priradiť im rôznu váhu dôležitosti.

Pred Transformerom spracovávali modely text lineárne – slovo po slove. Ak bola veta príliš dlhá, model na jej začiatok „zabudol“. Transformer tento problém vyriešil tým, že vidí celú vetu (alebo celý dokument) naraz. To je dôvod, prečo AI dokáže udržať tému v článku, ale zároveň je to dôvod extrémnej náročnosti na výpočtový výkon a pamäť GPU.

Prečo na tom copywriterovi záleží?

Pochopenie týchto mechanizmov nie je len pre programátorov. Ak viete, že model funguje na princípe pozornosti, pochopíte, prečo sú inštrukcie na konci promptu často efektívnejšie ako tie na začiatku (tzv. recency bias). Ak viete, ako funguje tokenizácia, prestanete sa čudovať, prečo AI robí chyby v rýmoch alebo v počítaní písmen v slove – pre model totiž písmená neexistujú, existujú len číselné ID tokenov.

  • Dátová čerstvosť: Modely sú limitované dátumom ukončenia tréningu (knowledge cutoff).
  • RLHF: Reinforcement Learning from Human Feedback je proces, kde ľudia „učia“ model, ktoré odpovede sú bezpečné a užitočné.
  • Parametre: Počet parametrov (napr. 175 miliárd pri GPT-3) určuje komplexnosť vzťahov, ktoré si model dokáže zapamätať.

Ste pripravení na prax?

Teória je len začiatok. Zistite, ako tieto technické znalosti aplikovať pri tvorbe obsahu, ktorý skutočne konvertuje a neznie ako produkt generického algoritmu.