Wat zijn LRM’s?
Large Reasoning Models (LRM’s) zijn een klasse AI-modellen die verder gaan dan standaard large language models. Waar LLM’s een antwoord direct genereren, nemen LRM’s de tijd om stap voor stap te redeneren voordat ze een conclusie trekken.
De naam “reasoning model” verwijst naar het vermogen om redeneringen in meerdere stappen uit te voeren: het splitsen van een complex probleem in kleinere stappen, net zoals een mens zou doen bij een wiskundige bewijsvoering of logische puzzel.
LLM vs LRM: het verschil
Standaard-LLM
Vraag:
"Wat is 17 × 24?"
Antwoord:
"408"Direct antwoord, snel, maar soms fouten bij complexe problemen.
Reasoning-model (LRM)
Vraag:
"Wat is 17 × 24?"
Denken:
"17 × 24 = 17 × (20 + 4)
= (17 × 20) + (17 × 4)
= 340 + 68 = 408"
Antwoord:
"408"Expliciet redeneringsproces, betrouwbaarder op complexe taken.
Het verschil wordt groter naarmate problemen complexer worden. Bij eenvoudige vragen geven beide modellen vergelijkbare resultaten. Maar bij wiskundige bewijzen, programmeeruitdagingen of logische puzzels presteren LRM’s duidelijk beter.
Chain-of-thought reasoning
De kernmethode achter LRM’s is Chain-of-Thought (CoT) reasoning. In plaats van direct naar het antwoord te springen, genereert het model eerst een reeks tussenstappen.
Bij LRM’s is dit denkproces niet alleen een prompttechniek, maar is het ingebouwd in het model via speciale training (vooral reinforcement learning dat correcte eindantwoorden beloont). Het model leert dat “nadenken” loont, omdat het vaker tot het goede antwoord leidt.
Test-time compute scaling
Een belangrijk inzicht achter LRM’s is test-time compute scaling. Traditioneel maak je modellen slimmer door ze groter te maken of langer te trainen. LRM’s tonen aan dat je ook kunt schalen tijdens inference: door het model langer te laten “nadenken”.
Dit betekent dat je voor moeilijkere problemen meer “denktijd” kunt toewijzen. Het model kan itereren, alternatieve paden verkennen, en zijn eigen fouten corrigeren, allemaal binnen één inference-aanroep.
Soorten reasoning-modellen in de praktijk
Gesloten reasoning-modellen
Alleen bereikbaar via de API van de aanbieder. Vaak in varianten: een kleine, snelle en goedkope versie en een grotere versie met meer denktijd voor de zwaarste taken. Het denkproces zelf is meestal verborgen; je ziet hooguit een samenvatting.
Open-weights reasoning-modellen
De gewichten zijn openbaar, dus je kunt het model zelf hosten en het volledige denkproces inzien. Vaak zijn er ook gedistilleerde versies: kleinere modellen die getraind zijn op de redeneringen van een groot reasoning-model.
Instelbare denktijd
Veel reasoning-modellen laten je kiezen hoeveel ze mogen nadenken, bijvoorbeeld via een reasoning-niveau of een maximum aantal denktokens. Sommige modellen schakelen zelf tussen direct antwoorden en uitgebreid redeneren.
Use cases
LRM’s excelleren waar diep redeneren nodig is:
Wiskunde en logica
Programmeren
Wetenschappelijk onderzoek
AI-agents
Beperkingen
LRM’s zijn niet altijd de beste keuze:
- Trager: het “denken” kost tijd, dus het past niet bij real-time toepassingen die direct een antwoord nodig hebben. Voor simpele vragen is een standaard LLM sneller en goedkoper.
- Duurder: meer tokens (de redeneerketen) betekent hogere kosten per aanvraag.
- Geen garantie: lange redeneerketens kunnen alsnog tot verkeerde conclusies leiden.