KI für Content bezahlen: Was es 2026 wirklich kostet
Wir haben uns alle daran gewöhnt, Artikel an die KI zu übergeben. Diese Gewohnheit hat einen Preis. Hier steht, was ein mittellanger Artikel im August 2026 in den großen APIs tatsächlich kostet — und ab wann sich diese Rechnung nicht mehr rechnet.
Der Listenpreis
Preise gelten pro 1M Token in USD, im August 2026 gegen die Preisseiten der Anbieter geprüft. Die Tabelle hat sich im einzigen Monat seit unserer Juli-Ausgabe erneut komplett gedreht — prüfen Sie die Anbieterseiten, bevor Sie eine Pipeline budgetieren.
| Anbieter | Modell | Input | Output |
|---|---|---|---|
| Anthropic | Claude Fable 5 (Flaggschiff) | $10 | $50 |
| Claude Opus 5 | $5 | $25 | |
| Claude Sonnet 5 (Mittelklasse) | $3 | $15 | |
| Claude Haiku 4.5 (Budget) | $1 | $5 | |
| OpenAI | GPT-5.5 Pro (Flaggschiff) | $30 | $180 |
| GPT-5.6 Sol | $5 | $30 | |
| GPT-5.6 Terra (Mittelklasse) | $2 | $12 | |
| GPT-5.6 Luna (Budget) | $0.20 | $1.20 | |
| Gemini 3.1 Pro | $2.00 | $12 | |
| Gemini 3.7 Flash | $0.75 | $3.75 | |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | |
| xAI | Grok 4.6 | $2 | $6 |
| Grok 4.3 | $1.25 | $2.50 | |
| DeepSeek | V4 Pro (off-peak) | $0.66 | $1.98 |
| V4 Flash (off-peak) | $0.22 | $0.66 | |
| Alibaba | Qwen3.8 Max | $2 | $6 |
| Qwen3.7 Plus | $0.32 | $1.28 | |
| Qwen3.7 Flash | $0.03 | $0.13 | |
| Moonshot | Kimi K3 | $3 | $15 |
| Kimi K2.5 | $0.60 | $3.00 | |
| Mistral | Medium 3.5 | $1.50 | $7.50 |
| Large 3 | $0.50 | $1.50 | |
| Small 4 | $0.15 | $0.60 |
Mistral ist der einzige Block, der sich in diesem Monat nicht bewegt hat — alle anderen Preise oben sind neu seit Juli, und Moonshots Kimi ist zum ersten Mal in der Tabelle vertreten (das Flaggschiff K3 landet exakt beim Preis von Claude Sonnet 5). Output kostet auf jeder Stufe das 2–6-fache von Input. Das ist relevant: Ein langer Artikel besteht überwiegend aus Output-Token. Ein kurzes Briefing mit langem System-Prompt besteht überwiegend aus Input. Mehr Fußnoten als je zuvor hängen an den Schlagzeilenzahlen — Claude Sonnet 5 läuft mit Einführungspreisen ($2/$10) bis 2026-08-31; Gemini 3.7 Flash ist ebenfalls auf Einführungspreisen ($1.50/$7.50 ab Januar 2027); Gemini 3.1 Pro und Grok 4.6 verdoppeln sich in etwa oberhalb eines Kontexts von 200K Token ($4/$18 und $4/$12); DeepSeek wird nach Uhrzeit tarifiert — die Tabelle zeigt den off-peak-Preis, und in den Spitzenstunden (01:00–04:00 und 06:00–10:00 UTC) verdoppelt er sich; und Qwen3.7 Flash ist nach Anfragelänge gestaffelt ($0.03/$0.13 unter 32K Token, bis zu $0.20/$0.80).
Was ein Artikel wirklich kostet
Ein mittellanger Artikel — grob 2,500 Wörter — landet bei etwa 3,000 input tokens (System-Prompt, Briefing, Template-Vorgaben, Quellmaterial) und 3,500 output tokens (~2,500 Wörter). Mit diesen Zahlen:
| Modell | Liste pro Artikel | Mit Cache (Read-Rabatt) | Mit Cache + Batch |
|---|---|---|---|
| GPT-5.5 Pro | ~$0.72 | n/a | ~$0.36 |
| Claude Fable 5 | ~$0.21 | ~$0.18 | ~$0.089 |
| GPT-5.6 Sol | ~$0.12 | ~$0.11 | ~$0.053 |
| Claude Opus 5 | ~$0.10 | ~$0.089 | ~$0.045 |
| Claude Sonnet 5 | ~$0.062 | ~$0.053 | ~$0.027 |
| Kimi K3 | ~$0.062 | ~$0.053 | n/a |
| GPT-5.6 Terra | ~$0.048 | ~$0.043 | ~$0.021 |
| Gemini 3.1 Pro | ~$0.048 | ~$0.043 | ~$0.021 |
| Mistral Medium 3.5 | ~$0.031 | ~$0.027 | ~$0.013 |
| Qwen3.8 Max | ~$0.027 | ~$0.024 | ~$0.014 (nur Batch) |
| Grok 4.6 | ~$0.027 | ~$0.023 | ~$0.018 (Batch −20%) |
| Claude Haiku 4.5 | ~$0.021 | ~$0.018 | ~$0.009 |
| Gemini 3.7 Flash | ~$0.015 | ~$0.013 | ~$0.0067 |
| Kimi K2.5 | ~$0.012 | n/a | ~$0.0074 (Batch −40%) |
| Gemini 3.5 Flash-Lite | ~$0.0097 | ~$0.0088 | ~$0.0044 |
| DeepSeek V4 Pro (off-peak) | ~$0.0089 | ~$0.0070 | n/a |
| Mistral Large 3 | ~$0.0068 | ~$0.0054 | ~$0.0027 |
| GPT-5.6 Luna | ~$0.0048 | ~$0.0043 | ~$0.0021 |
| DeepSeek V4 Flash (off-peak) | ~$0.003 | ~$0.0023 | n/a |
| Mistral Small 4 | ~$0.0026 | ~$0.0021 | ~$0.0011 |
| Qwen3.7 Flash | ~$0.00055 | n/a | ~$0.00027 |
Eine Budget-Stufe wie Luna, Gemini Flash-Lite oder Haiku bringt einen Artikel zum Listenpreis auf ein bis zwei Cent. Qwen3.7 Flash landet bei rund einem Zwanzigstel Cent — der neue Boden, seit DeepSeeks Preiserhöhung das Modell aus dieser Position verdrängt hat. Ein echtes Flaggschiff wie GPT-5.5 Pro kostet grob 1300× so viel wie Qwen Flash und etwa 12–15× so viel wie eine Mittelklasse wie Sonnet 5 oder GPT-5.6 Terra.
Die Rabatte, die tatsächlich greifen
Zwei Mechanismen sind für alle relevant, die KI-Content in Menge produzieren — und beide sind in diesem Monat erneut bedingter geworden:
- Prompt Caching. Anthropic, OpenAI, Google, xAI, DeepSeek, Alibaba, Moonshot und Mistral rabattieren allesamt das Lesen gecachten Inputs — typischerweise 90% Rabatt (Anthropic, OpenAI, Google, Mistral, Moonshot), 75% Rabatt (xAI) und rund 97% bei DeepSeek, dessen Cache-hit-Preis auch nach der August-Preiserhöhung der größte einzelne Hebel auf dieser Seite bleibt. Der Haken liegt auf der anderen Seite: Cache-Writes kosten Aufschlag (Anthropic berechnet 1.25× bei 5-Minuten-TTL und 2× bei einer Stunde; OpenAI hat einen Write-Aufschlag von 1.25× für die GPT-5.6-Familie eingeführt), und Google berechnet stündlichen Speicher. Caching zahlt sich erst aus, wenn Sie das gecachte Prefix tatsächlich mehrfach erneut lesen.
- Batch API. Anthropic, OpenAI, Google, Alibaba und Mistral geben 50% Rabatt auf async Jobs, die innerhalb von 24 Stunden fertig werden. Es sind nicht überall dieselben 50%: xAI rabattiert nur um 20%, Moonshot berechnet Batch mit 60% des Listenpreises (−40%, und listet sein Flaggschiff K3 auf der Batch-Seite überhaupt nicht), Alibaba lässt Batch und Cache nicht in derselben Anfrage kombinieren, und DeepSeeks Rabatt ist die Uhrzeit, nicht eine Warteschlange — die Preiserhöhung vom 16. August hat die Abrechnung nach Peak/Off-Peak zurückgebracht, wobei off-peak (der größte Teil des Tages) beim halben Peak-Satz liegt.
Wo beides existiert, stapeln sich die Rabatte. Batch + Cache bringt Sie auf grob 95% unter Liste beim Input und 50% unter Liste beim Output. Wenn Sie Content in geplanten Batches mit festem System-Prompt erzeugen, sollten Sie beides nutzen.
Die Rechnung im großen Maßstab
Nehmen wir ein vernünftiges Mittelklasse-Modell — Claude Sonnet 5 zum Listenpreis, $0.062 pro Artikel:
| Volumen | Pure-AI (jedes Mal neu generieren) | AI-Template einmal + lokale Renders |
|---|---|---|
| 1 Artikel | $0.06 | $0.06 |
| 100 Artikel | ~$6.15 | ~$0.06 |
| 1,000 Artikel | ~$61.50 | ~$0.06 |
| 10,000 Artikel | ~$615 | ~$0.06 |
Gegen ein Flaggschiff wie GPT-5.5 Pro wird die Lücke größer: 10,000 Artikel kosten zum Listenpreis rund $7,200 — gegenüber den Kosten für eine einzige gute Template-Generierung (deutlich unter $1) und einem lokalen Renderer, der gratis läuft. Genau da hört die Rechnung auf, Sinn zu ergeben.
Das Modell-Lineup wechselt schneller als Ihr Content-Plan
Hier steckt ein zweiter Kostenblock, den keine Preisseite ausweist. Jedes Modell, das in unserer April-2026-Ausgabe dieses Artikels genannt wurde — GPT-5.4, Gemini 3 Flash, Grok 4, DeepSeek V3 und R1, Qwen3 Max, Mistral Small 3.1, Claude Opus 4.7 und Sonnet 4.6 — wurde seither umbenannt, abgelöst oder abgekündigt. Drei Monate. OpenAI hat numerische Stufen zugunsten benannter aufgegeben (Sol / Terra / Luna). DeepSeek hat die Aliase deepseek-chat und deepseek-reasoner ersatzlos zurückgezogen.
Die Juli-Ausgabe hielt kaum einen Monat. Seither: Anthropic hat Claude Opus 5 veröffentlicht (2026-07-24), und der Opus aus der Tabelle wurde zur vorigen Generation; OpenAI hat GPT-5.6 Terra um 20% und Luna um 80% gesenkt (2026-07-30); Google hat Gemini 3.6 Flash und fünf Wochen später 3.7 Flash veröffentlicht; xAI hat Grok 4.6 ausgeliefert (2026-08-12); Alibaba hat Qwen3.7 Max durch Qwen3.8 Max ersetzt (2026-08-03); und DeepSeek hat die Preise im Peak um bis zu 1100% angehoben (2026-08-16) und damit die Abrechnung nach Tageszeit wieder eingeführt, die mit V4 abgeschafft worden war. Ein Monat — und sechs der sieben Anbieter haben ihre Preisliste geändert.
Wenn Ihre Content-Pipeline bei jedem Render ein Modell aufruft, ist jede dieser Änderungen eine Migration: neue Modell-IDs, nachjustierte Prompts, neu kalkulierte Kosten und Output, der sich anders liest als im letzten Quartal. Wenn Ihre Pipeline ein Modell einmal aufruft, um ein Template zu schreiben, und danach lokal rendert, betrifft Sie nichts davon. Der Modellwechsel ist ein Argument für das Template, nicht bloß ein Ärgernis.
Wann Sie pro Artikel zahlen sollten
Nicht jeder Artikel ist eine Wiederholung. Die API-Rechnung lohnt sich für:
- einmalige redaktionelle Stücke mit eigener Stimme oder eigenem Blickwinkel;
- neue Themen, die Sie nie behandelt haben und bei denen das Modell echte Recherche leistet;
- Longform-Features, bei denen Nuance wichtiger ist als Masse;
- Entwürfe, die Sie ohnehin stark von Hand überarbeiten.
Für diese Art Arbeit wollen Sie das beste Modell, das Sie sich leisten können. Flaggschiff-Output zahlt sich durch weniger Redaktionsaufwand selbst zurück.
Wann Sie einmal zahlen und vielfach rendern sollten
Die Kostenrechnung kippt in dem Moment, in dem Sie dieselbe Artikelform mehr als ein paar Mal produzieren müssen:
- Produktseiten über einen Katalog von SKUs;
- lokalisierte Varianten über Sprachen und Regionen hinweg;
- SEO-Landingpages für eine lange Keyword-Liste;
- Multi-Tenant-SaaS-Marketingseiten mit gemeinsamer Struktur;
- alles, wo die Struktur konstant bleibt und sich nur die Fakten ändern.
Hier ist Zahlen pro Render reine Verschwendung. Schreiben Sie das Template einmal mit KI und übergeben Sie das Rendern einem Tool, das es gratis erledigt.
Der hybride Workflow
Genau für diesen Workflow ist Spintax gebaut:
- Zahlen Sie dem Flaggschiff einmal. Nutzen Sie das beste Modell, das Sie sich leisten können — Fable 5, Opus 5, GPT-5.6 Sol, Gemini 3.1 Pro — um das Template zu schreiben. Sie zahlen $0.05–$1 und bekommen ein hochwertiges, grammatikalisch sicheres, mehrvariantiges Template.
- Rendern Sie für immer — lokal. Spintax löst das Template auf Ihrer CPU auf. Tausende Varianten kosten effektiv null.
- Aktualisieren Sie, wenn sich die Bedeutung ändert. Generieren Sie das Template nur neu, wenn sich Fakten oder Positionierung ändern — nicht, wenn ein Anbieter ein Modell umbenennt. Bei einem stabilen Produkt kann das quartalsweise sein.
Sie zahlen für Qualität dort, wo sie zählt. Und hören auf, für Quantität zu zahlen.
Einschränkungen
- Preise ändern sich — und Namen auch. Die gesamte Tabelle oben hat sich zwischen April und Juli 2026 erneuert — und dann erneut zwischen Juli und August. Prüfen Sie die Anbieterseiten vor der Budgetierung erneut und hardcoden Sie nie eine Modell-ID, die Sie in diesem Quartal nicht neu verifiziert haben.
- Cache-Writes sind nicht gratis. Die Schlagzeile „90% Rabatt“ gilt für Cache-Reads. Anthropic und OpenAI berechnen beide einen Aufschlag auf den Write, und Google berechnet stündlichen Speicher. Ein Cache, der nur einmal gelesen wird, ist teurer als gar kein Cache.
- Batch bedeutet nicht überall 50%. xAI liegt bei 20%. Moonshot liegt bei 40% und schließt sein Flaggschiff aus. Alibaba verweigert die Kombination von Batch mit Cache. DeepSeeks Rabatt ist die Tageszeit, nicht eine Batch-Warteschlange. Gehen Sie nicht davon aus, dass der Stack greift, bevor Sie es geprüft haben.
- Langer Kontext kostet bei manchen Anbietern extra. Die Gemini-Pro-Stufen und Grok 4.6 verdoppeln sich jenseits von 200K Token in etwa. Anthropic und OpenAI berechnen über ihre Kontextfenster hinweg Pauschalpreise.
- Qualität ist nicht auf jeder Stufe gleich. Budget-Stufen taugen für Gerüste und Umschreibungen. Feine Tonalität, Long-Context-Treue und faktische Fundierung sprechen weiterhin für das Flaggschiff. Nutzen Sie günstige Modelle für lokale Renders, nicht für das Template selbst.
Wie es weitergeht
Bereit, aus einer guten KI-Generierung tausende Renders zu machen? Beginnen Sie mit der Authoring-Serie:
Hinweis: Die verlinkte Guide-Serie ist bislang nur auf Englisch verfügbar.
Datenquellen: Preisseiten von Anthropic, OpenAI, Google, xAI, DeepSeek, Alibaba, Moonshot, Mistral — verifiziert am 2026-08-20. Die Berechnungen pro Artikel setzen 3,000 input tokens + 3,500 output tokens pro Artikel an.