Naar de inhoud

Hoe large language models werken

Van transformerarchitectuur tot tokenization: begrijp hoe LLM's en de chatmodellen die erop draaien tekst genereren.

5 minuten lezen

Wat is een LLM?

Een Large Language Model (LLM) is een type neuraal netwerk dat getraind is op enorme hoeveelheden tekst om taal te begrijpen en te genereren. “Large” verwijst naar het enorme aantal parameters: de geleerde getallen in het netwerk.

Tokenization: tekst naar getallen

LLM’s kunnen alleen met getallen werken, niet met tekst. Tokenization splitst tekst op in stukjes (tokens) en wijst elk stukje een nummer toe.

Hoe4821
werkt9310
een512
taal7735
model2064
?30
Voorbeeld van tokenization. Elk token krijgt een uniek ID uit het vocabulaire van het model, dat doorgaans tienduizenden tot honderdduizenden tokens telt. De ID's hier zijn ter illustratie.

De transformer-architectuur

Vrijwel alle LLM’s zijn gebaseerd op de transformerarchitectuur, geïntroduceerd in 2017. De vernieuwing: sequenties parallel verwerken via het attentionmechanisme.

Embeddinglaag

Zet token-ID’s om in dichte vectoren (vaak duizenden dimensies) die de betekenis coderen.

Attentionlagen

Berekenen hoe elk token samenhangt met de tokens ervoor. “Welke eerdere woorden zijn relevant voor dit woord?”

Feed-forwardlagen

Lagen van het neurale netwerk die de representaties bewerken en “kennis” opslaan.

Uitvoerlaag

Geeft een kansverdeling over alle mogelijke volgende tokens.

Attention: de kern van LLM’s

“Attention is All You Need”: de titel van het oorspronkelijke paper uit 2017. Het attentionmechanisme laat elk token naar andere tokens “kijken” om de context te begrijpen. In een LLM dat tekst genereert, kijkt elk token naar alle tokens ervóór: wat erna komt, is nog niet geschreven. (De encoder uit het oorspronkelijke paper zag wel alle tokens tegelijk.)

Voorbeeld: in “De kat zat op de mat omdat hij moe was”

Attention leert dat “hij” verwijst naar “kat”, niet naar “mat”. Het model berekent attention weights die aangeven hoe sterk elk woord samenhangt met de woorden ervoor.

Training: next token prediction

LLM’s worden getraind met één simpele taak: voorspel het volgende token. Dit heet “autoregressive language modeling” of “causal language modeling”.

Invoer"De kat zat op de"
Doel"mat"
Dit wordt biljoenen keren herhaald over gigantische tekstcorpora (internet, boeken, code).

Na pre-training volgen vaak extra stappen:

  • Supervised Fine-Tuning (SFT): training op vraag-antwoordparen.
  • RLHF: Reinforcement Learning from Human Feedback voor betere antwoorden.

Inference: tekst genereren

Bij inference genereert het model tekst token voor token:

  1. Neem de prompt en zet deze om in tokens.
  2. Bereken de kans voor elk mogelijk volgend token.
  3. Kies een token door te samplen (bijv. met temperature of top-p).
  4. Voeg het token toe aan de reeks en herhaal.

Parameters en schaal

“Parameters” zijn de geleerde gewichten in het neurale netwerk. Meer parameters betekent meer capaciteit om patronen en kennis op te slaan.

Prestaties nemen vrij voorspelbaar toe naarmate parameters, trainingsdata en rekenkracht samen groeien (scaling laws). Tegelijk kost elke extra parameter geheugen en rekenwerk, bij training én bij elk gegenereerd token. Grootte is daarom een afweging, geen doel op zich.

Schaal Waar het draait Wat dat betekent
Klein Op een laptop, een telefoon of één GPU Snel en goedkoop, maar minder kennis en redeneervermogen.
Middel Op een of enkele servers met GPU’s Goede balans tussen kwaliteit en kosten.
Groot Alleen in een datacenter Meeste kennis, maar trainen en draaien kost een veelvoud.

Een vraag over dit onderwerp?

Stuur een bericht via het formulier. Alles loopt via e-mail; u krijgt binnen twee werkdagen antwoord.