Wat is een LLM?
Een Large Language Model (LLM) is een type neuraal netwerk dat getraind is op enorme hoeveelheden tekst om taal te begrijpen en te genereren. “Large” verwijst naar het enorme aantal parameters: de geleerde getallen in het netwerk.
Tokenization: tekst naar getallen
LLM’s kunnen alleen met getallen werken, niet met tekst. Tokenization splitst tekst op in stukjes (tokens) en wijst elk stukje een nummer toe.
De transformer-architectuur
Vrijwel alle LLM’s zijn gebaseerd op de transformerarchitectuur, geïntroduceerd in 2017. De vernieuwing: sequenties parallel verwerken via het attentionmechanisme.
Embeddinglaag
Attentionlagen
Feed-forwardlagen
Uitvoerlaag
Attention: de kern van LLM’s
“Attention is All You Need”: de titel van het oorspronkelijke paper uit 2017. Het attentionmechanisme laat elk token naar andere tokens “kijken” om de context te begrijpen. In een LLM dat tekst genereert, kijkt elk token naar alle tokens ervóór: wat erna komt, is nog niet geschreven. (De encoder uit het oorspronkelijke paper zag wel alle tokens tegelijk.)
Voorbeeld: in “De kat zat op de mat omdat hij moe was”
Attention leert dat “hij” verwijst naar “kat”, niet naar “mat”. Het model berekent attention weights die aangeven hoe sterk elk woord samenhangt met de woorden ervoor.
Training: next token prediction
LLM’s worden getraind met één simpele taak: voorspel het volgende token. Dit heet “autoregressive language modeling” of “causal language modeling”.
Na pre-training volgen vaak extra stappen:
- Supervised Fine-Tuning (SFT): training op vraag-antwoordparen.
- RLHF: Reinforcement Learning from Human Feedback voor betere antwoorden.
Inference: tekst genereren
Bij inference genereert het model tekst token voor token:
- Neem de prompt en zet deze om in tokens.
- Bereken de kans voor elk mogelijk volgend token.
- Kies een token door te samplen (bijv. met temperature of top-p).
- Voeg het token toe aan de reeks en herhaal.
Parameters en schaal
“Parameters” zijn de geleerde gewichten in het neurale netwerk. Meer parameters betekent meer capaciteit om patronen en kennis op te slaan.
Prestaties nemen vrij voorspelbaar toe naarmate parameters, trainingsdata en rekenkracht samen groeien (scaling laws). Tegelijk kost elke extra parameter geheugen en rekenwerk, bij training én bij elk gegenereerd token. Grootte is daarom een afweging, geen doel op zich.
| Schaal | Waar het draait | Wat dat betekent |
|---|---|---|
| Klein | Op een laptop, een telefoon of één GPU | Snel en goedkoop, maar minder kennis en redeneervermogen. |
| Middel | Op een of enkele servers met GPU’s | Goede balans tussen kwaliteit en kosten. |
| Groot | Alleen in een datacenter | Meeste kennis, maar trainen en draaien kost een veelvoud. |