Betalen voor AI-content: wat het echt kost in 2026

We zijn er allemaal aan gewend geraakt om artikelen aan AI uit te besteden. Aan die gewoonte hangt een prijskaartje. Hier is wat een artikel van gemiddelde lengte in augustus 2026 daadwerkelijk kost bij de grote API’s — en het moment waarop die rekening geen zin meer heeft.

De catalogusprijs

Prijzen zijn per 1M tokens in USD, in augustus 2026 geverifieerd aan de hand van de prijspagina’s van de providers. De tabel is in de ene maand sinds onze juli-editie opnieuw omgeslagen — controleer de providerpagina’s voordat je een pipeline begroot.

ProviderModelInputOutput
AnthropicClaude Fable 5 (flagship)$10$50
Claude Opus 5$5$25
Claude Sonnet 5 (mid)$3$15
Claude Haiku 4.5 (budget)$1$5
OpenAIGPT-5.5 Pro (flagship)$30$180
GPT-5.6 Sol$5$30
GPT-5.6 Terra (mid)$2$12
GPT-5.6 Luna (budget)$0.20$1.20
GoogleGemini 3.1 Pro$2.00$12
Gemini 3.7 Flash$0.75$3.75
Gemini 3.5 Flash-Lite$0.30$2.50
xAIGrok 4.6$2$6
Grok 4.3$1.25$2.50
DeepSeekV4 Pro (off-peak)$0.66$1.98
V4 Flash (off-peak)$0.22$0.66
AlibabaQwen3.8 Max$2$6
Qwen3.7 Plus$0.32$1.28
Qwen3.7 Flash$0.03$0.13
MoonshotKimi K3$3$15
Kimi K2.5$0.60$3.00
MistralMedium 3.5$1.50$7.50
Large 3$0.50$1.50
Small 4$0.15$0.60

Mistral is het enige blok dat deze maand niet is veranderd — alle andere prijzen hierboven zijn nieuw sinds juli, en Moonshot’s Kimi voegt zich voor het eerst bij de tabel (het vlaggenschip K3 komt uit op precies de prijs van Claude Sonnet 5). Output is in elke categorie 2–6× duurder dan input. Dat is relevant: een lang artikel bestaat vooral uit output-tokens. Een korte briefing met een lange system prompt bestaat vooral uit input. Er rijden meer voetnoten dan ooit mee op de hoofdcijfers — de introductieprijs van Claude Sonnet 5 ($2/$10) eindigt op 2026-08-31; Gemini 3.7 Flash is ook op introductieprijs ($1.50/$7.50 vanaf januari 2027); Gemini 3.1 Pro en Grok 4.6 verdubbelen ruwweg boven een context van 200K tokens ($4/$18 en $4/$12); DeepSeek wordt getarifeerd per tijdstip — de tabel toont off-peak, en tijdens piekuren (01:00–04:00 en 06:00–10:00 UTC) verdubbelt de prijs; en Qwen3.7 Flash is getrapt naar requestlengte ($0.03/$0.13 onder 32K tokens, tot $0.20/$0.80).

Wat één artikel werkelijk kost

Een artikel van gemiddelde lengte — ruwweg 2,500 woorden — komt uit op ongeveer 3,000 input tokens (system prompt, briefing, sjabloonrichtlijnen, bronmateriaal) en 3,500 output tokens (~2,500 woorden). Met die getallen:

ModelCatalogusprijs per artikelMet cache (leeskorting)Met cache + batch
GPT-5.5 Pro~$0.72n/a~$0.36
Claude Fable 5~$0.21~$0.18~$0.089
GPT-5.6 Sol~$0.12~$0.11~$0.053
Claude Opus 5~$0.10~$0.089~$0.045
Claude Sonnet 5~$0.062~$0.053~$0.027
Kimi K3~$0.062~$0.053n/a
GPT-5.6 Terra~$0.048~$0.043~$0.021
Gemini 3.1 Pro~$0.048~$0.043~$0.021
Mistral Medium 3.5~$0.031~$0.027~$0.013
Qwen3.8 Max~$0.027~$0.024~$0.014 (alleen batch)
Grok 4.6~$0.027~$0.023~$0.018 (batch −20%)
Claude Haiku 4.5~$0.021~$0.018~$0.009
Gemini 3.7 Flash~$0.015~$0.013~$0.0067
Kimi K2.5~$0.012n/a~$0.0074 (batch −40%)
Gemini 3.5 Flash-Lite~$0.0097~$0.0088~$0.0044
DeepSeek V4 Pro (off-peak)~$0.0089~$0.0070n/a
Mistral Large 3~$0.0068~$0.0054~$0.0027
GPT-5.6 Luna~$0.0048~$0.0043~$0.0021
DeepSeek V4 Flash (off-peak)~$0.003~$0.0023n/a
Mistral Small 4~$0.0026~$0.0021~$0.0011
Qwen3.7 Flash~$0.00055n/a~$0.00027

Een budgettier als Luna, Gemini Flash-Lite of Haiku brengt een artikel op een cent of twee tegen catalogusprijs. Qwen3.7 Flash komt uit rond een twintigste van een cent — de nieuwe bodem nu DeepSeek’s prijsherziening die plek heeft overgenomen. Een echte flagship als GPT-5.5 Pro is ruwweg 1,300× zo duur als Qwen Flash en 12–15× zo duur als een mid-tier als Sonnet 5 of GPT-5.6 Terra.

De kortingen die daadwerkelijk gelden

Twee mechanismen doen ertoe voor iedereen die AI-content op schaal draait — en allebei zijn deze maand opnieuw voorwaardelijker geworden:

  • Prompt caching. Anthropic, OpenAI, Google, xAI, DeepSeek, Alibaba, Moonshot en Mistral geven allemaal korting op cached input-reads — doorgaans 90% korting (Anthropic, OpenAI, Google, Mistral, Moonshot), 75% korting (xAI) en rond de 97% korting bij DeepSeek, waarvan de cache-hit-prijs ook na de augustusherziening nog altijd de grootste hefboom op deze pagina is. De adder zit aan de andere kant: cache-writes kennen een toeslag (Anthropic rekent 1.25× voor een TTL van 5 minuten en 2× voor een uur; OpenAI voegde een write-toeslag van 1.25× toe op de GPT-5.6-familie), en Google rekent opslag per uur. Caching betaalt zich pas terug zodra je de gecachete prefix daadwerkelijk een paar keer herleest.
  • Batch API. Anthropic, OpenAI, Google, Alibaba en Mistral bieden 50% korting voor async jobs die binnen 24 uur klaar zijn. Het is geen universele 50%: xAI geeft slechts 20% korting, Moonshot rekent voor batch 60% van de catalogusprijs (−40%, en vermeldt zijn vlaggenschip K3 helemaal niet op de batchpagina), Alibaba laat batch en cache niet combineren op hetzelfde verzoek, en bij DeepSeek is de korting het tijdstip, geen wachtrij — de prijsherziening van 16 augustus bracht peak/off-peak-tarifering terug, waarbij off-peak (het grootste deel van de dag) half het piektarief kost.

De twee stapelen waar ze allebei bestaan. Batch + cache levert je ruwweg 95% korting op input en 50% korting op output ten opzichte van de catalogusprijs. Genereer je content in geplande batches met een vaste system prompt, dan zou je beide moeten gebruiken.

De rekensom op schaal

Neem een redelijk mid-tier model — Claude Sonnet 5 tegen catalogusprijs, $0.062 per artikel:

VolumePure-AI (elke keer opnieuw genereren)AI-sjabloon één keer + lokale renders
1 artikel$0.06$0.06
100 artikelen~$6.15~$0.06
1,000 artikelen~$61.50~$0.06
10,000 artikelen~$615~$0.06

Tegenover een flagship als GPT-5.5 Pro wordt het gat groter: 10,000 artikelen kosten ongeveer $7,200 tegen catalogusprijs, versus de kosten van het genereren van één goed sjabloon (ruim onder $1) en dat gratis door een lokale renderer halen. Dat is het moment waarop de rekening geen zin meer heeft.

Het modellenaanbod verandert sneller dan je contentplan

Er zit hier nog een kostenpost die op geen enkele prijspagina staat. Elk model dat in onze editie van april 2026 werd genoemd — GPT-5.4, Gemini 3 Flash, Grok 4, DeepSeek V3 en R1, Qwen3 Max, Mistral Small 3.1, Claude Opus 4.7 en Sonnet 4.6 — is sindsdien hernoemd, opgevolgd of uitgefaseerd. Drie maanden. OpenAI liet numerieke tiers vallen ten gunste van namen (Sol / Terra / Luna). DeepSeek trok de aliassen deepseek-chat en deepseek-reasoner zonder meer in.

De juli-editie hield het amper een maand vol. Sindsdien: Anthropic bracht Claude Opus 5 uit (2026-07-24) en de Opus die de tabel vermeldde werd de vorige generatie; OpenAI verlaagde GPT-5.6 Terra met 20% en Luna met 80% (2026-07-30); Google lanceerde Gemini 3.6 Flash en vijf weken later 3.7 Flash; xAI bracht Grok 4.6 uit (2026-08-12); Alibaba verving Qwen3.7 Max door Qwen3.8 Max (2026-08-03); en DeepSeek verhoogde de prijzen met tot wel 1,100% in de piek (2026-08-16), waarmee het de tijdstipafhankelijke tarifering herintroduceerde die het met V4 had losgelaten. Eén maand; zes van de zeven providers wijzigden hun prijslijst.

Roept je content-pipeline bij elke render een model aan, dan is elk van die wijzigingen een migratie: nieuwe model-ID’s, opnieuw afgestemde prompts, herijkte kosten en output die anders leest dan vorig kwartaal. Roept je pipeline één keer een model aan om een sjabloon te schrijven en rendert het daarna lokaal, dan raakt niets daarvan je. Modelverloop is een argument vóór het sjabloon, niet slechts een ongemak.

Wanneer je per artikel zou moeten betalen

Niet elk artikel is een herhaling. De API-rekening betalen is zinvol voor:

  • eenmalige redactionele stukken met een eigen stem of invalshoek;
  • nieuwe onderwerpen die je nooit eerder hebt behandeld, waarbij het model echt research doet;
  • long-form features waar nuance zwaarder weegt dan volume;
  • concepten die je toch zwaar met de hand gaat redigeren.

Voor dit soort werk wil je het beste model dat je je kunt veroorloven. Output op flagship-niveau betaalt zichzelf terug in minder redactietijd.

Wanneer je één keer zou moeten betalen en vaak renderen

De rekensom kantelt zodra je dezelfde vorm van artikel meer dan een paar keer moet produceren:

  • productpagina’s over een catalogus van SKU’s;
  • gelokaliseerde varianten over talen en regio’s;
  • SEO-landingspagina’s voor een lange zoekwoordenlijst;
  • multi-tenant SaaS-marketingsites met een gedeelde structuur;
  • alles waar de structuur constant is en de feiten veranderen.

Hier is betalen per render pure verspilling. Schrijf het sjabloon één keer met AI en geef het renderen daarna uit handen aan een tool die het gratis doet.

De hybride workflow

Dit is de workflow waarvoor Spintax is gebouwd:

  1. Betaal de flagship één keer. Gebruik het beste model dat je je kunt veroorloven — Fable 5, Opus 5, GPT-5.6 Sol, Gemini 3.1 Pro — om het sjabloon te schrijven. Je betaalt $0.05–$1 en je krijgt een hoogwaardig, grammaticaal veilig sjabloon met meerdere varianten.
  2. Render voor altijd, lokaal. Spintax verwerkt het sjabloon op je eigen CPU. Duizenden varianten kosten effectief niets.
  3. Werk bij wanneer de betekenis verandert. Genereer het sjabloon alleen opnieuw wanneer de feiten of de positionering veranderen — niet wanneer de leverancier een model hernoemt. Voor een stabiel product kan dat per kwartaal zijn.

Je betaalt voor kwaliteit waar die ertoe doet. Je stopt met betalen voor kwantiteit.

Kanttekeningen

  • Prijzen veranderen, en namen ook. De volledige tabel hierboven is tussen april en juli 2026 omgeslagen — en dan opnieuw tussen juli en augustus. Controleer de providerpagina’s opnieuw voordat je begroot, en hardcode nooit een model-ID dat je dit kwartaal niet opnieuw hebt geverifieerd.
  • Cache-writes zijn niet gratis. De “90% korting” uit de kop geldt voor cache-reads. Anthropic en OpenAI rekenen allebei een toeslag op de write, en Google rekent opslag per uur. Een cache die één keer wordt gelezen is duurder dan geen cache.
  • Batch is niet overal 50%. xAI is 20%. Moonshot is 40% en sluit zijn vlaggenschip uit. Alibaba weigert batch met cache te stapelen. Bij DeepSeek is de korting het tijdstip van de dag, geen batch-wachtrij. Ga er niet vanuit dat de stack geldt voordat je het hebt gecontroleerd.
  • Lange context kost bij sommige providers extra. De Gemini Pro-tiers en Grok 4.6 verdubbelen ruwweg voorbij 200K tokens. Anthropic en OpenAI rekenen vaste tarieven over hun hele contextvenster.
  • Kwaliteit is niet op elke tier hetzelfde. Budgettiers zijn prima voor steigerwerk en herschrijvingen. Genuanceerde stem, long-context-getrouwheid en feitelijke onderbouwing blijven het terrein van de flagships. Gebruik goedkope modellen voor lokale renders, niet voor het sjabloon zelf.

Waar je verder kunt lezen

Klaar om één goede AI-generatie om te zetten in duizenden renders? Begin met de serie schrijfgidsen:

De serie schrijfgidsen is alleen in het Engels beschikbaar.

Databronnen: prijspagina’s van Anthropic, OpenAI, Google, xAI, DeepSeek, Alibaba, Moonshot, Mistral — geverifieerd 2026-08-20. De berekeningen per artikel gaan uit van 3,000 input tokens + 3,500 output tokens per artikel.