Attention & Transformers — de motor onder de LLM #
Attention is hoe een model bepaalt wélke woorden er voor elkaar toe doen; de Transformer (uit “Attention Is All You Need”, 2017) maakte attention het hart van het model en is de basis van vrijwel alle moderne LLM’s.
Inhoud #
Het probleem dat attention oploste #
Oudere modellen (RNN’s) lazen tekst woord voor woord en verloren verbanden over lange afstand. In “The book that was on the table near the window was missing” moet “was missing” verbonden worden met “the book”, veel woorden eerder. Attention laat het model woorden direct met elkaar vergelijken, ongeacht afstand.
Self-attention: de kernidee #
Elke token vraagt in feite: “welke andere tokens in deze tekst doen er voor mij toe?” Voorbeeld: “The dog chased the ball because it was excited.” — “it” verwijst naar “dog”. Verander één woord (“…because it rolled away”) en “it” verschuift naar “ball”. Self-attention vangt precies dat soort context.
Query, Key, Value (de bibliotheek-analogie) #
Elke token maakt drie representaties:
– Query — wat deze token zoekt (jouw vraag).
– Key — een label dat aangeeft welke info een token bevat (de titels/index in de bibliotheek).
– Value — de eigenlijke informatie die wordt doorgegeven (de pagina’s).
Het model vergelijkt query’s met keys → attention-scores → gewichten → het mengt de values tot een nieuwe, context-bewuste representatie. Dit gebeurt over vele lagen: vroege lagen vangen simpele relaties, diepere lagen abstracte (toon, grammatica, redeneren).
Multi-head attention #
Het model draait meerdere attention-processen parallel (“heads”). De ene head let op grammatica, de andere op verwijzingen, de andere op lange-afstandsverbanden — meerdere invalshoeken tegelijk.
Positie telt nog steeds #
“De kat joeg op de muis” ≠ “De muis joeg op de kat”. Daarom voegen Transformers positionele informatie toe, zodat volgorde behouden blijft.
Causale (masked) attention #
GPT-achtige modellen voorspellen het volgende token en mogen alleen naar eerdere tokens kijken, niet vooruit. BERT-achtige modellen kijken juist twee kanten op (bidirectioneel) — sterker voor classificatie/zoeken, terwijl GPT-stijl sterk is in generatie.
De prijs: kwadratische kosten #
Standaard self-attention vergelijkt alle tokens met elkaar → het aantal vergelijkingen groeit kwadratisch met de lengte. Daarom is lange context duur/traag en bestaat er onderzoek (Longformer, FlashAttention, GQA) om dit efficiënter te maken. Dit verklaart mede [[kosten-van-llms|waarom lange prompts kosten opdrijven]].
Belangrijke nuance #
Attention is wiskunde, geen menselijk begrip. Hoge attention-gewichten zijn niet automatisch een betrouwbare “verklaring” van het antwoord, en het model kan op het verkeerde stuk letten.
Sleutelinzichten #
- Dit is je verdiepingsmodule — voor doelgroepen die “onder de motorkap” willen kijken (developers, nieuwsgierige professionals). Voor beginners volstaat [[hoe-llms-werken]].
- De QKV-bibliotheekanalogie en het “it = dog/ball”-voorbeeld werken uitstekend op slides.
- Kwadratische kosten = de brug naar het kosten- en context-window-verhaal.
Inzetbaar voor #
- Gevorderde training/workshop: “Hoe denkt een Transformer?” met live zinsvoorbeelden.
- Video: geanimeerde QKV-uitleg met de bibliotheekanalogie.
- Blog: “Attention Is All You Need — in gewone taal.”
Gerelateerd #
- [[hoe-llms-werken]] — het grotere plaatje
- [[kernbegrippen-llm]] — token, embedding, context window
- [[kosten-van-llms]] — waarom lange context duur is
Bronnen #
- [[RAW/Attention Mechanism in LLMs Explained in Simple Terms.md]] — QuarkAndCode, self-attention/QKV/multi-head/causaal (2026-05)
- [[RAW/How LLMs Work Tokens, Embeddings, and Transformers.md]] — transformer-pijplijn
- [[RAW/Modern AI and LLM Concepts.md]] — context en efficiëntie (long context, MoE)