Tokenizácia: Prečo AI nečíta slová?
Keď do ChatGPT napíšete vetu, model ju okamžite rozbije na drobné fragmenty zvané tokeny. Token nie je nutne celé slovo; môže to byť slabika, predpona alebo dokonca len jedno písmeno. Tento proces je nevyhnutný, pretože neurónové siete nepracujú s písmenami, ale s číselnými vektormi v multidimenzionálnom priestore.
Priemerný token v angličtine má približne 4 znaky, čo znamená, že 1000 tokenov je zhruba 750 slov. V slovenčine je tento pomer kvôli diakritike a zložitej morfológii menej efektívny. Ak model nerozumie kontextu, je to často preto, že tokenizácia rozbila kľúčový odborný termín na nezmyselné fragmenty, ktoré stratili svoj sémantický náboj.