Een AI-agent verbruikt ongeveer vier keer zoveel tokens als een gewone chatvraag, en een groepje samenwerkende agents zelfs vijftien keer zoveel. Dat cijfer komt uit de eigen metingen van Anthropic. Precies daar zit de verrassing in je maandrekening: de agent werkt door terwijl jij naar iets anders kijkt, en elke stap wordt apart afgerekend. Toch hoeft dat niet duur uit te pakken. In de prijsdocumentatie van Anthropic staat een rekenvoorbeeld waarin tienduizend klantgesprekken op het goedkoopste model samen ongeveer 37 dollar kosten, omgerekend zo'n 32 euro. Het verschil tussen die 32 euro en een rekening waar je van schrikt zit in een handvol keuzes die je vooraf maakt.
Wat een AI-agent kost, reken je uit met drie getallen: hoeveel tokens erin gaan, hoeveel er uit komen, en de prijs per miljoen tokens van het model dat je kiest. Output kost ongeveer vijf keer zoveel als input. Laat je herhaalde context cachen, dan betaal je daarvoor nog een tiende van de inputprijs.
Waarom is een agent zoveel duurder dan een chatvraag?
Een agent stelt zichzelf steeds opnieuw dezelfde vraag, en de aanloop wordt elke keer langer. In een chat stuur je één vraag en krijg je één antwoord. Een agent zet daar stappen bovenop: hij leest een bestand, voert een commando uit, bekijkt het resultaat en bedenkt de volgende stap.
Elke stap is een nieuwe aanvraag aan het model. En elke nieuwe aanvraag stuurt de hele voorgeschiedenis mee, want het model onthoudt zelf niets. In de technische uitleg over zijn eigen onderzoekssysteem met meerdere agents schrijft Anthropic dat agents ongeveer vier keer zoveel tokens gebruiken als chatgesprekken. Zet je meerdere samenwerkende agents die elkaar berichten sturen naast elkaar, dan loopt dat op tot ongeveer vijftien keer.
Denk aan een taxi met de meter aan. Zolang de agent rijdt, telt hij door, ook als jij op de achterbank je mail zit te lezen.
Even voor de beeldvorming: nog voordat je agent iets nuttigs doet, betaal je al voor het gereedschap. Alleen de beschrijving van de browser-gereedschapskist kost volgens de prijsdocumentatie van Anthropic ongeveer 6.600 inputtokens per aanvraag. Voor computerbediening zijn dat er zo'n 4.500. Dat is de gebruiksaanwijzing, niet het werk.
“Eén lange sessie kost meer dan hetzelfde werk verspreid over een paar korte, en meer dan je zou denken, want beurt 40 leest ook de 39 beurten ervoor opnieuw.”
Anthropic, in de uitleg over het kostenmodel van Claude Code, 14 augustus 2026
Wat betaal je per miljoen tokens?
Tussen het goedkoopste en het duurste Claude-model zit een factor tien in prijs, bij precies hetzelfde werk. Modelkeuze is daarmee de knop die het meeste oplevert. Hieronder de actuele tarieven uit de prijsdocumentatie van Anthropic, met een omrekening naar euro's tegen de koers van 1 september 2026 (1 dollar is ongeveer 0,86 euro). De bedragen zijn exclusief btw.
| Model | Input per miljoen | Output per miljoen | Lezen uit cache | Waarvoor je het gebruikt |
|---|---|---|---|---|
| Claude Haiku 4.5 | $1 (€0,86) | $5 (€4,30) | $0,10 | Sorteren, samenvatten, herhaald routinewerk |
| Claude Sonnet 5 | $2 (€1,72) | $10 (€8,60) | $0,20 | Het meeste productiewerk |
| Claude Opus 5 | $5 (€4,30) | $25 (€21,50) | $0,50 | Complex redeneerwerk en code |
| Claude Fable 5 | $10 (€8,60) | $50 (€43) | $1 | De zwaarste taken |
Twee dingen vallen op aan die tabel. De output is telkens vijf keer zo duur als de input, omdat het model bij het schrijven van een antwoord letterlijk token voor token opnieuw moet rekenen. En lezen uit de cache kost een tiende van de gewone inputprijs. Daarmee is caching de makkelijkste besparing die er is.
Overigens zou Sonnet 5 per 1 september 2026 duurder worden, naar 3 en 15 dollar per miljoen. Anthropic heeft die verhoging geschrapt: de introductieprijs van 2 en 10 dollar is nu gewoon de standaardprijs. Er is wel iets wat makkelijk over het hoofd wordt gezien. Vanaf Claude 4.7 gebruikt Anthropic een nieuwe tokenizer die voor dezelfde tekst ongeveer 30 procent meer tokens telt. Een nieuwer model kan dus per token goedkoper zijn en toch een hogere rekening opleveren.
Wat kost één concrete taak?
Tienduizend klantgesprekken afhandelen op Claude Haiku 4.5 kost ongeveer 37 dollar, zo'n 32 euro. Dat rekenvoorbeeld staat in de prijsdocumentatie van Anthropic zelf en gaat uit van gemiddeld 3.700 tokens per gesprek. Per klantvraag kom je daarmee op ongeveer een derde eurocent.
Een tweede voorbeeld uit dezelfde documentatie laat zien wat caching doet. Een sessie van een uur op Claude Opus 5, met 50.000 tokens erin en 15.000 eruit, kost 0,71 dollar. Komt 40.000 van die inputtokens uit de cache, dan zakt dezelfde sessie naar 0,53 dollar. Dat is 26 procent minder voor exact hetzelfde werk.
Reken ook de bijkomende posten mee, want die staan los van de tokenprijs:
- Een zoekopdracht op het web kost 10 dollar per duizend zoekopdrachten, ongeveer 8,60 euro.
- Een gemiddelde webpagina ophalen levert zo'n 2.500 tokens context op, een uitgebreide documentatiepagina zo'n 25.000.
- Een pdf van een halve megabyte is goed voor ongeveer 125.000 tokens. Dat is één bestand dat het hele werkgeheugen van het model vult.
Zo meet je in een half uur wat jouw taak kost
Neem één echte taak, draai die drie keer, en deel de rekening door drie. Dat is nauwkeuriger dan elke schatting vooraf, omdat je eigen documenten, koppelingen en instructies meetellen. Werk deze zes stappen af.
- Kies één taak die vaak terugkomt. Een offerte voorbereiden, een klantvraag beantwoorden, een verslag samenvatten. Geen uitzonderingsgeval.
- Gebruik een aparte API-sleutel of een apart project. Alleen zo kun je de kosten van deze taak scheiden van al het andere gebruik.
- Draai de taak drie keer volledig af, inclusief de correcties die je normaal ook doet.
- Lees het tokenverbruik af in het antwoord van de API of, in Claude Code, met het commando
/context. - Reken door naar je maandvolume. Kosten per taak maal het aantal keer per maand.
- Zet het naast de menselijke tijd die dezelfde taak nu kost, tegen een reëel uurtarief.
Bij stap 4 krijg je van de API een blok als dit terug. De vier getallen zijn alles wat je nodig hebt:
"usage": {
"input_tokens": 105,
"output_tokens": 6039,
"cache_read_input_tokens": 7123,
"cache_creation_input_tokens": 7345
}De rekensom eronder is simpel genoeg voor een spreadsheet. Vul je eigen tarieven in uit de tabel hierboven:
kosten = (input_tokens / 1.000.000 * inputprijs)
+ (cache_read_tokens / 1.000.000 * inputprijs * 0,1)
+ (cache_creation_tokens / 1.000.000 * inputprijs * 1,25)
+ (output_tokens / 1.000.000 * outputprijs)Welke knoppen verlagen de rekening echt?
Caching en modelkeuze leveren samen het meeste op, de rest is fijnregeling. Vijf ingrepen, op volgorde van opbrengst.
1. Laat herhaalde context cachen. Lezen uit de cache kost een tiende van de inputprijs. Het wegschrijven kost eenmalig 1,25 keer de inputprijs bij een cache van vijf minuten, of twee keer bij een cache van een uur. Bij vijf minuten heb je dat na één hergebruik al terugverdiend, bij een uur na twee.
2. Kies per stap een ander model. Haiku voor sorteren en samenvatten, Sonnet voor het meeste werk, Opus alleen waar echt geredeneerd moet worden. Veel agents draaien nog volledig op het duurste model omdat dat bij het bouwen het makkelijkst was.
3. Gebruik de Batch API waar haast niet nodig is. Die geeft 50 procent korting op zowel input als output. Alles wat vannacht klaar mag zijn, hoort daar thuis.
4. Knip het werk op in korte sessies. Anthropic voerde drie taken twee keer uit: één keer in één doorlopende sessie, één keer met een schone start tussen elke taak. De doorlopende sessie stuurde 1,9 keer zoveel tokens naar het model.

5. Zet gereedschap uit dat je niet gebruikt. Elke gekoppelde tool en elke MCP-server, een vaste koppeling naar een externe bron, voegt een beschrijving toe aan iedere aanvraag. Ook als de agent er die dag niets mee doet.
In Claude Code zitten daar directe commando's voor. Deze vijf zijn de moeite waard om aan te leren:
/context # laat zien wat er al in het venster zit voordat je begint /clear # begin schoon aan een nieuwe taak /compact # vat het gesprek samen voordat je pauze neemt /rewind # draai de laatste beurten terug, kost niets /mcp # zet koppelingen uit die je nu niet gebruikt
Niet alleen de lengte van de sessie telt, ook de route die de agent kiest. In een tweede vergelijking van Anthropic had een sessie die meteen de twee juiste bestanden opende vijf aanvragen nodig. Een sessie die eerst ging zoeken had er achttien nodig, voor hetzelfde resultaat.

Waarom blijven bedrijven investeren zonder bewijs?
Omdat de kosten per taak wel gemeten worden en de opbrengst per taak niet. Het Financieele Dagblad schreef eind augustus dat de AI-kosten voor bedrijven snel oplopen terwijl de opbrengst nog vaak onduidelijk is. Uit de AI Pulse van KPMG, een onderzoek onder ruim 2.100 bestuurders in twintig landen, blijkt dat 58 procent van de Nederlandse organisaties duidelijke bedrijfswaarde uit AI haalt, tegen 64 procent wereldwijd. De tweede uitkomst is veelzeggender: 62 procent van de Nederlandse bedrijven blijft investeren, ook als de opbrengst nog niet goed meetbaar is.
Er zit nog een lastige kant aan het bezuinigen zelf. Uit het onderzoek van Anthropic naar systemen met meerdere agents blijkt dat het tokenverbruik alleen al 80 procent van de prestatieverschillen verklaart. Tel je daar het aantal keren bij op dat de agent gereedschap gebruikt, plus de modelkeuze, dan kom je op 95 procent. Meer tokens betekent in de praktijk dus meestal ook een beter resultaat.
Hard snijden in het tokenbudget kost daarom vrijwel altijd kwaliteit. De winst zit in het weghalen van verspilling, niet in het model minder laten nadenken. Denk aan context die nooit gebruikt wordt, gereedschap dat aan staat zonder reden, en sessies die eindeloos doorlopen.
Wanneer een agent zich terugverdient, en wanneer je beter kunt wachten
De grens ligt niet bij de tokenprijs maar bij de herhaling. Een taak die je duizend keer per maand doet, verdient een agent bijna altijd terug, ook op een duur model. Een taak die één keer per kwartaal langskomt verdient hem vrijwel nooit terug, want dan betaal je vooral voor het bouwen en het onderhoud.
Drie kenmerken maken een taak geschikt: hij komt vaak terug, hij volgt een vast patroon, en je kunt achteraf controleren of het antwoord klopt. Vergaderverslagen zijn een goed voorbeeld, want een uur vergadering uitschrijven kost inmiddels ongeveer dertig cent. Klantvragen sorteren en offertes voorbereiden vallen in dezelfde categorie.
Wacht nog even als je alle output alsnog woord voor woord moet nalezen. Dan verplaats je het werk, in plaats van het weg te nemen, en betaal je er ook nog voor. Datzelfde geldt als niemand in je bedrijf kan uitleggen welk probleem de agent precies oplost.
En tot slot het advies dat het meeste scheelt: reken de kosten per taak uit voordat je bouwt, niet als de eerste factuur binnenkomt. Die som is het verschil tussen een proef die doorgaat en een proef die na twee maanden stilletjes wordt afgeblazen. Je hebt er de zes stappen hierboven en een spreadsheet voor nodig, en anders vraag je het aan degene die de agent voor je bouwt. Meer artikelen over agents in de praktijk staan op het blog.
Veelgestelde vragen
Wat is een token precies?
Een token is een stukje tekst dat het model verwerkt, ongeveer vier tekens of driekwart woord. Je betaalt apart voor de tokens die je naar het model stuurt en voor de tokens die het terugschrijft.
Waarom is output vijf keer zo duur als input?
Bij het lezen van je vraag verwerkt het model alles in één keer. Bij het schrijven van een antwoord rekent het token voor token opnieuw, waardoor de hardware veel langer bezet blijft. Dat verschil zit in de prijs verwerkt.
Hoeveel scheelt prompt caching in de praktijk?
Lezen uit de cache kost een tiende van de gewone inputprijs. In het rekenvoorbeeld van Anthropic zakt een sessie van een uur op Claude Opus 5 daardoor van 0,71 naar 0,53 dollar, ongeveer 26 procent minder.
Kun je vooraf een maximum instellen op je AI-kosten?
Je stelt in de console van de aanbieder een uitgavenlimiet en waarschuwingen per maand in. Dat is geen harde rem per taak, dus combineer het met een meting per taak zodat je weet wat één opdracht kost voordat je hem duizend keer draait.
Is een goedkoper model altijd voordeliger?
Nee. Een kleiner model heeft vaker meerdere pogingen nodig, en die extra rondes betaal je ook. Vergelijk daarom de kosten per geslaagde taak, niet de prijs per miljoen tokens.