Pagare l’AI per i contenuti: quanto costa davvero nel 2026

Ci siamo tutti abituati ad affidare gli articoli all’AI. Questa abitudine ha un conto da pagare. Ecco quanto costa realmente un articolo di media lunghezza sulle principali API ad agosto 2026 — e il momento in cui quel conto smette di avere senso.

Il prezzo di listino

I prezzi sono per 1M di token in USD, verificati ad agosto 2026 sulle pagine di pricing dei provider. La tabella si è rinnovata di nuovo nel solo mese trascorso dalla nostra edizione di luglio — controllate le pagine dei provider prima di mettere a budget una pipeline.

ProviderModelloInputOutput
AnthropicClaude Fable 5 (flagship)$10$50
Claude Opus 5$5$25
Claude Sonnet 5 (medio)$3$15
Claude Haiku 4.5 (budget)$1$5
OpenAIGPT-5.5 Pro (flagship)$30$180
GPT-5.6 Sol$5$30
GPT-5.6 Terra (medio)$2$12
GPT-5.6 Luna (budget)$0.20$1.20
GoogleGemini 3.1 Pro$2.00$12
Gemini 3.7 Flash$0.75$3.75
Gemini 3.5 Flash-Lite$0.30$2.50
xAIGrok 4.6$2$6
Grok 4.3$1.25$2.50
DeepSeekV4 Pro (off-peak)$0.66$1.98
V4 Flash (off-peak)$0.22$0.66
AlibabaQwen3.8 Max$2$6
Qwen3.7 Plus$0.32$1.28
Qwen3.7 Flash$0.03$0.13
MoonshotKimi K3$3$15
Kimi K2.5$0.60$3.00
MistralMedium 3.5$1.50$7.50
Large 3$0.50$1.50
Small 4$0.15$0.60

Mistral è l’unico blocco che non si è mosso questo mese — tutti gli altri prezzi dei provider qui sopra sono nuovi da luglio, e il Kimi di Moonshot entra in tabella per la prima volta (il suo flagship K3 si posiziona esattamente al prezzo di Claude Sonnet 5). L’output costa 2–6× più dell’input su ogni fascia. E questo conta: un articolo lungo è fatto soprattutto di token di output. Un brief breve con un system prompt lungo è fatto soprattutto di input. Più note a piè di pagina che mai accompagnano i numeri di copertina — il prezzo introduttivo di Claude Sonnet 5 ($2/$10) termina il 2026-08-31; anche Gemini 3.7 Flash è in prezzo introduttivo ($1.50/$7.50 da gennaio 2027); Gemini 3.1 Pro e Grok 4.6 raddoppiano circa oltre un contesto da 200K token ($4/$18 e $4/$12); DeepSeek è tariffato in base all’ora — la tabella mostra l’off-peak, e le ore di picco (01:00–04:00 e 06:00–10:00 UTC) lo raddoppiano; e Qwen3.7 Flash è scaglionato in base alla lunghezza della richiesta ($0.03/$0.13 sotto i 32K token, fino a $0.20/$0.80).

Quanto costa davvero un articolo

Un articolo di media lunghezza — circa 2,500 parole — si attesta su circa 3,000 input tokens (system prompt, brief, istruzioni sul template, materiale di partenza) e 3,500 output tokens (~2,500 parole). Con questi numeri:

ModelloListino per articoloCon cache (sconto in lettura)Con cache + batch
GPT-5.5 Pro~$0.72n/a~$0.36
Claude Fable 5~$0.21~$0.18~$0.089
GPT-5.6 Sol~$0.12~$0.11~$0.053
Claude Opus 5~$0.10~$0.089~$0.045
Claude Sonnet 5~$0.062~$0.053~$0.027
Kimi K3~$0.062~$0.053n/a
GPT-5.6 Terra~$0.048~$0.043~$0.021
Gemini 3.1 Pro~$0.048~$0.043~$0.021
Mistral Medium 3.5~$0.031~$0.027~$0.013
Qwen3.8 Max~$0.027~$0.024~$0.014 (solo batch)
Grok 4.6~$0.027~$0.023~$0.018 (batch −20%)
Claude Haiku 4.5~$0.021~$0.018~$0.009
Gemini 3.7 Flash~$0.015~$0.013~$0.0067
Kimi K2.5~$0.012n/a~$0.0074 (batch −40%)
Gemini 3.5 Flash-Lite~$0.0097~$0.0088~$0.0044
DeepSeek V4 Pro (off-peak)~$0.0089~$0.0070n/a
Mistral Large 3~$0.0068~$0.0054~$0.0027
GPT-5.6 Luna~$0.0048~$0.0043~$0.0021
DeepSeek V4 Flash (off-peak)~$0.003~$0.0023n/a
Mistral Small 4~$0.0026~$0.0021~$0.0011
Qwen3.7 Flash~$0.00055n/a~$0.00027

Una fascia budget come Luna, Gemini Flash-Lite o Haiku porta un articolo a uno o due centesimi a listino. Qwen3.7 Flash si ferma vicino a un ventesimo di centesimo — il nuovo minimo ora che la rilistinazione di DeepSeek lo ha spodestato da quel posto. Un vero flagship come GPT-5.5 Pro costa circa 1,300× Qwen Flash e 12–15× una fascia media come Sonnet 5 o GPT-5.6 Terra.

Gli sconti che si applicano davvero

Due meccanismi contano per chiunque produca contenuti AI a volume — ed entrambi sono diventati ancora più condizionati questo mese:

  • Prompt caching. Anthropic, OpenAI, Google, xAI, DeepSeek, Alibaba, Moonshot e Mistral scontano tutti le letture dell’input in cache — tipicamente 90% di sconto (Anthropic, OpenAI, Google, Mistral, Moonshot), 75% (xAI), e circa 97% su DeepSeek, il cui prezzo cache-hit resta la leva singola più potente di questa pagina anche dopo la rilistinazione di agosto. La fregatura sta dall’altro lato: le scritture in cache hanno un sovrapprezzo (Anthropic fattura 1.25× per un TTL di 5 minuti e 2× per un’ora; OpenAI ha aggiunto un costo di scrittura di 1.25× sulla famiglia GPT-5.6), e Google fattura lo storage a ore. La cache conviene solo quando il prefisso in cache viene effettivamente riletto più volte.
  • Batch API. Anthropic, OpenAI, Google, Alibaba e Mistral offrono il 50% di sconto sui job asincroni completati entro 24 ore. Non è un 50% universale: xAI sconta solo il 20%, Moonshot fattura il batch al 60% del listino (−40%, e non elenca affatto il suo flagship K3 nella pagina del batch), Alibaba non permette di combinare batch e cache sulla stessa richiesta, e lo sconto di DeepSeek è l’ora del giorno, non una coda — la rilistinazione del 16 agosto ha ripristinato la tariffazione peak/off-peak, con l’off-peak (la maggior parte della giornata) alla metà della tariffa di picco.

I due si sommano dove esistono entrambi. Batch + cache porta a circa il 95% di sconto sul listino dell’input e al 50% sull’output. Se generate contenuti in batch pianificati con un system prompt fisso, dovreste usarli entrambi.

La matematica su scala

Prendiamo un ragionevole modello di fascia media — Claude Sonnet 5 a listino, $0.062 per articolo:

VolumePure-AI (rigenerare ogni volta)Template AI una volta + render locali
1 articolo$0.06$0.06
100 articoli~$6.15~$0.06
1,000 articoli~$61.50~$0.06
10,000 articoli~$615~$0.06

Contro un flagship come GPT-5.5 Pro il divario si allarga: 10,000 articoli costano circa $7,200 a listino, contro il costo di generare un buon template (ben sotto $1) e passarlo attraverso un renderer locale gratuitamente. È il momento in cui il conto smette di avere senso.

Il parco modelli cambia più in fretta del vostro piano editoriale

C’è un secondo costo che nessuna pagina di pricing elenca. Ogni modello citato nell’edizione di aprile 2026 di questo articolo — GPT-5.4, Gemini 3 Flash, Grok 4, DeepSeek V3 e R1, Qwen3 Max, Mistral Small 3.1, Claude Opus 4.7 e Sonnet 4.6 — da allora è stato rinominato, sostituito o deprecato. Tre mesi. OpenAI ha abbandonato le fasce numeriche in favore di nomi (Sol / Terra / Luna). DeepSeek ha ritirato del tutto gli alias deepseek-chat e deepseek-reasoner.

L’edizione di luglio è sopravvissuta appena un mese. Da allora: Anthropic ha rilasciato Claude Opus 5 (2026-07-24) e l’Opus elencato nella tabella è diventato la generazione precedente; OpenAI ha tagliato GPT-5.6 Terra del 20% e Luna dell’80% (2026-07-30); Google ha lanciato Gemini 3.6 Flash e poi 3.7 Flash a cinque settimane di distanza; xAI ha rilasciato Grok 4.6 (2026-08-12); Alibaba ha sostituito Qwen3.7 Max con Qwen3.8 Max (2026-08-03); e DeepSeek ha alzato i prezzi fino all’1.100% nelle ore di picco (2026-08-16), reintroducendo la tariffazione per fascia oraria che aveva abbandonato con V4. Un mese; sei provider su sette hanno cambiato il proprio listino.

Se la vostra pipeline di contenuti chiama un modello a ogni render, ognuno di questi cambiamenti è una migrazione: nuovi ID di modello, prompt da ritarare, costi da ricalibrare e output che si legge diversamente rispetto al trimestre scorso. Se la vostra pipeline chiama un modello una sola volta per scrivere un template e poi renderizza in locale, niente di tutto questo vi tocca. Il ricambio dei modelli è un argomento a favore del template, non solo un fastidio.

Quando conviene pagare per articolo

Non ogni articolo è una ripetizione. Pagare il conto dell’API ha senso per:

  • pezzi editoriali one-off con una voce o un’angolazione unica;
  • temi nuovi mai trattati, dove il modello fa ricerca vera;
  • approfondimenti long-form dove la sfumatura conta più del volume;
  • bozze che comunque riscriverete pesantemente a mano.

Per questo tipo di lavoro serve il miglior modello che potete permettervi. L’output di fascia flagship si ripaga in tempo di editing risparmiato.

Quando conviene pagare una volta e renderizzare tante volte

La matematica dei costi si ribalta nel momento in cui dovete produrre la stessa forma di articolo più di qualche volta:

  • pagine prodotto su un catalogo di SKU;
  • varianti localizzate per lingue e aree geografiche;
  • landing page SEO per una lunga lista di keyword;
  • siti marketing SaaS multi-tenant che condividono la struttura;
  • tutto ciò in cui la struttura è costante e cambiano i fatti.

Qui pagare per render è puro spreco. Scrivete il template una volta con l’AI, poi affidate il rendering a uno strumento che lo fa gratis.

Il workflow ibrido

È il workflow per cui Spintax è stato costruito:

  1. Pagate il flagship una volta. Usate il miglior modello che potete permettervi — Fable 5, Opus 5, GPT-5.6 Sol, Gemini 3.1 Pro — per scrivere il template. Pagate $0.05–$1 e ottenete un template di alta qualità, grammaticalmente sicuro e multi-variante.
  2. Renderizzate per sempre, in locale. Spintax risolve il template sulla vostra CPU. Migliaia di varianti costano di fatto zero.
  3. Aggiornate quando cambia il significato. Rigenerate il template solo quando cambiano i fatti o il posizionamento — non quando il vendor rinomina un modello. Per un prodotto stabile, magari una volta a trimestre.

Pagate per la qualità dove conta. Smettete di pagare per la quantità.

Avvertenze

  • Cambiano i prezzi, e cambiano i nomi. L’intera tabella qui sopra si è rinnovata tra aprile e luglio 2026 — e poi di nuovo tra luglio e agosto. Ricontrollate le pagine dei provider prima di fare budget, e non hardcodate mai un ID di modello che non avete riverificato in questo trimestre.
  • Le scritture in cache non sono gratis. Il “90% di sconto” di copertina vale per le letture dalla cache. Anthropic e OpenAI fatturano entrambe un sovrapprezzo sulla scrittura, e Google fattura lo storage a ore. Una cache letta una volta sola costa più di nessuna cache.
  • Il batch non è ovunque al 50%. xAI è al 20%. Moonshot è al 40% ed esclude il suo flagship. Alibaba rifiuta di sommare batch e cache. Lo sconto di DeepSeek è l’ora del giorno, non una coda batch. Non date per scontato che lo stack si applichi prima di aver verificato.
  • Il contesto lungo costa di più su alcuni provider. Le fasce Gemini Pro e Grok 4.6 raddoppiano circa oltre i 200K token. Anthropic e OpenAI applicano tariffe piatte su tutta la finestra di contesto.
  • La qualità non è la stessa su ogni fascia. Le fasce budget vanno bene per impalcature e riscritture. Voce sfumata, fedeltà su contesti lunghi e aderenza ai fatti restano terreno dei flagship. Usate i modelli economici per i render locali, non per il template stesso.

Dove andare adesso

Pronti a trasformare una buona generazione AI in migliaia di render? Partite dalla serie sulla scrittura:

La serie di guide alla scrittura è disponibile solo in inglese.

Fonti dei dati: pagine di pricing di Anthropic, OpenAI, Google, xAI, DeepSeek, Alibaba, Moonshot, Mistral — verificate 2026-08-20. I calcoli per articolo assumono 3,000 input tokens + 3,500 output tokens per articolo.