Pagar IA por conteúdo: quanto isso custa de verdade em 2026

Todos nos acostumamos a entregar artigos para a IA escrever. Esse hábito vem com uma conta. Veja quanto custa de fato um artigo de tamanho médio nas principais APIs em agosto de 2026 — e o momento em que essa conta deixa de fazer sentido.

O preço de tabela

Os preços são por 1M de tokens em USD, verificados em agosto de 2026 nas páginas oficiais de preços dos provedores. A tabela mudou de novo no único mês desde a nossa edição de julho — confira as páginas dos provedores antes de orçar um pipeline.

ProvedorModeloInputOutput
AnthropicClaude Fable 5 (flagship)$10$50
Claude Opus 5$5$25
Claude Sonnet 5 (intermediário)$3$15
Claude Haiku 4.5 (econômico)$1$5
OpenAIGPT-5.5 Pro (flagship)$30$180
GPT-5.6 Sol$5$30
GPT-5.6 Terra (intermediário)$2$12
GPT-5.6 Luna (econômico)$0.20$1.20
GoogleGemini 3.1 Pro$2.00$12
Gemini 3.7 Flash$0.75$3.75
Gemini 3.5 Flash-Lite$0.30$2.50
xAIGrok 4.6$2$6
Grok 4.3$1.25$2.50
DeepSeekV4 Pro (off-peak)$0.66$1.98
V4 Flash (off-peak)$0.22$0.66
AlibabaQwen3.8 Max$2$6
Qwen3.7 Plus$0.32$1.28
Qwen3.7 Flash$0.03$0.13
MoonshotKimi K3$3$15
Kimi K2.5$0.60$3.00
MistralMedium 3.5$1.50$7.50
Large 3$0.50$1.50
Small 4$0.15$0.60

A Mistral é o único bloco que não mudou neste mês — todos os outros preços de provedores acima são novos desde julho, e o Kimi da Moonshot entra na tabela pela primeira vez (seu flagship K3 chega exatamente ao preço do Claude Sonnet 5). O output custa de 2–6× mais que o input em todos os níveis. Isso importa: um artigo longo é majoritariamente composto de tokens de output. Um briefing curto com um system prompt longo é majoritariamente input. Mais notas de rodapé do que nunca sustentam os números da manchete — o preço promocional de lançamento do Claude Sonnet 5 ($2/$10) termina em 2026-08-31; o Gemini 3.7 Flash também é promocional ($1.50/$7.50 a partir de janeiro de 2027); o Gemini 3.1 Pro e o Grok 4.6 praticamente dobram acima de um contexto de 200K tokens ($4/$18 e $4/$12); a DeepSeek é precificada pelo relógio — a tabela mostra o horário de menor movimento (off-peak), e os horários de pico (01:00–04:00 e 06:00–10:00 UTC) dobram o preço; e o Qwen3.7 Flash é escalonado por tamanho da requisição ($0.03/$0.13 abaixo de 32K tokens, até $0.20/$0.80).

Quanto custa de fato um artigo

Um artigo de tamanho médio — cerca de 2,500 words — fica em torno de 3,000 input tokens (system prompt, briefing, instruções de template, material de origem) e 3,500 output tokens (~2,500 words). Com esses números:

ModeloTabela, por artigoCom cache (desconto de leitura)Com cache + batch
GPT-5.5 Pro~$0.72n/a~$0.36
Claude Fable 5~$0.21~$0.18~$0.089
GPT-5.6 Sol~$0.12~$0.11~$0.053
Claude Opus 5~$0.10~$0.089~$0.045
Claude Sonnet 5~$0.062~$0.053~$0.027
Kimi K3~$0.062~$0.053n/a
GPT-5.6 Terra~$0.048~$0.043~$0.021
Gemini 3.1 Pro~$0.048~$0.043~$0.021
Mistral Medium 3.5~$0.031~$0.027~$0.013
Qwen3.8 Max~$0.027~$0.024~$0.014 (somente batch)
Grok 4.6~$0.027~$0.023~$0.018 (batch −20%)
Claude Haiku 4.5~$0.021~$0.018~$0.009
Gemini 3.7 Flash~$0.015~$0.013~$0.0067
Kimi K2.5~$0.012n/a~$0.0074 (batch −40%)
Gemini 3.5 Flash-Lite~$0.0097~$0.0088~$0.0044
DeepSeek V4 Pro (off-peak)~$0.0089~$0.0070n/a
Mistral Large 3~$0.0068~$0.0054~$0.0027
GPT-5.6 Luna~$0.0048~$0.0043~$0.0021
DeepSeek V4 Flash (off-peak)~$0.003~$0.0023n/a
Mistral Small 4~$0.0026~$0.0021~$0.0011
Qwen3.7 Flash~$0.00055n/a~$0.00027

Um nível econômico como Luna, Gemini Flash-Lite ou Haiku coloca um artigo na casa de um ou dois centavos no preço de tabela. O Qwen3.7 Flash fica perto de um vigésimo de centavo — o novo piso agora que a reprecificação da DeepSeek a tirou desse posto. Um flagship de verdade como o GPT-5.5 Pro custa cerca de 1,300× o preço do Qwen Flash e 12–15× o de um nível intermediário como Sonnet 5 ou GPT-5.6 Terra.

Os descontos que realmente valem

Dois mecanismos importam para quem produz conteúdo com IA em volume — e ambos ficaram mais condicionais outra vez neste mês:

  • Prompt caching. Anthropic, OpenAI, Google, xAI, DeepSeek, Alibaba, Moonshot e Mistral todos dão desconto na leitura de input em cache — tipicamente 90% de desconto (Anthropic, OpenAI, Google, Mistral, Moonshot), 75% de desconto (xAI) e cerca de 97% de desconto na DeepSeek, cujo preço de cache-hit ainda é a maior alavanca isolada desta página mesmo depois da reprecificação de agosto. A pegadinha está do outro lado: a escrita no cache tem sobretaxa (a Anthropic cobra 1.25× para um TTL de 5 minutos e 2× para uma hora; a OpenAI adicionou uma cobrança de escrita de 1.25× na família GPT-5.6), e o Google cobra armazenamento por hora. O cache só compensa quando você de fato relê o prefixo em cache algumas vezes.
  • Batch API. Anthropic, OpenAI, Google, Alibaba e Mistral oferecem 50% de desconto para jobs assíncronos concluídos em até 24 horas. Não é um 50% universal: a xAI desconta apenas 20%, a Moonshot cobra o batch a 60% da tabela (−40%, e nem lista seu flagship K3 na página de batch), a Alibaba não permite combinar batch e cache na mesma requisição, e o desconto da DeepSeek é o relógio, não uma fila — a reprecificação de 16 de agosto trouxe de volta a cobrança por horário de pico/fora de pico, com o horário de menor movimento (a maior parte do dia) na metade da tarifa de pico.

Os dois se acumulam onde ambos existem. Batch + cache dá aproximadamente 95% de desconto sobre a tabela no input e 50% no output. Se você gera conteúdo em lotes agendados com um system prompt fixo, você deveria estar usando os dois.

A matemática em escala

Pegue um modelo intermediário razoável — Claude Sonnet 5 no preço de tabela, $0.062 por artigo:

VolumeSó IA (regerar toda vez)Template com IA uma vez + renders locais
1 artigo$0.06$0.06
100 artigos~$6.15~$0.06
1,000 artigos~$61.50~$0.06
10,000 artigos~$615~$0.06

Contra um flagship como o GPT-5.5 Pro a diferença fica ainda maior: 10,000 artigos custam cerca de $7,200 no preço de tabela, contra o custo de gerar um bom template (bem abaixo de $1) e rodá-lo em um renderizador local de graça. É aí que a conta deixa de fazer sentido.

A linha de modelos muda mais rápido que seu plano de conteúdo

Há um segundo custo aqui que nenhuma página de preços lista. Todos os modelos citados na nossa edição de abril de 2026 deste artigo — GPT-5.4, Gemini 3 Flash, Grok 4, DeepSeek V3 e R1, Qwen3 Max, Mistral Small 3.1, Claude Opus 4.7 e Sonnet 4.6 — foram desde então renomeados, substituídos ou descontinuados. Três meses. A OpenAI abandonou os níveis numéricos em favor de nomes (Sol / Terra / Luna). A DeepSeek aposentou de vez os aliases deepseek-chat e deepseek-reasoner.

A edição de julho sobreviveu pouco mais de um mês. Desde então: a Anthropic lançou o Claude Opus 5 (2026-07-24) e o Opus listado na tabela virou geração anterior; a OpenAI cortou o GPT-5.6 Terra em 20% e o Luna em 80% (2026-07-30); o Google lançou o Gemini 3.6 Flash e depois o 3.7 Flash com cinco semanas de diferença; a xAI lançou o Grok 4.6 (2026-08-12); a Alibaba substituiu o Qwen3.7 Max pelo Qwen3.8 Max (2026-08-03); e a DeepSeek subiu os preços em até 1,100% no horário de pico (2026-08-16), reintroduzindo a cobrança por horário do dia que havia abandonado com o V4. Um mês; seis dos sete provedores mudaram sua lista de preços.

Se o seu pipeline de conteúdo chama um modelo a cada render, cada uma dessas mudanças é uma migração: novos IDs de modelo, prompts reajustados, custos recalculados e um texto que soa diferente do trimestre passado. Se o seu pipeline chama um modelo uma única vez para escrever um template e depois renderiza localmente, nada disso te atinge. A rotatividade de modelos é um argumento a favor do template, não apenas um inconveniente.

Quando faz sentido pagar por artigo

Nem todo artigo é repetição. Pagar a conta da API faz sentido para:

  • textos editoriais avulsos com voz ou ângulo únicos;
  • temas novos que você nunca cobriu, em que o modelo faz pesquisa de verdade;
  • matérias longas em que a nuance importa mais que o volume;
  • rascunhos que você vai editar pesadamente à mão de qualquer forma.

Para esse tipo de trabalho, você quer o melhor modelo que puder pagar. Output de nível flagship se paga em tempo de edição economizado.

Quando pagar uma vez e renderizar muitas

A matemática do custo se inverte no momento em que você precisa produzir a mesma forma de artigo mais do que algumas poucas vezes:

  • páginas de produto ao longo de um catálogo de SKUs;
  • variantes localizadas por idioma e região;
  • landing pages de SEO para uma longa lista de palavras-chave;
  • sites de marketing de SaaS multi-tenant que compartilham estrutura;
  • qualquer coisa em que a estrutura é constante e os fatos mudam.

Aqui, pagar por render é desperdício puro. Escreva o template uma vez com IA e entregue a renderização a uma ferramenta que faz isso de graça.

O fluxo híbrido

É para este fluxo que o Spintax foi construído:

  1. Pague o flagship uma vez. Use o melhor modelo que puder pagar — Fable 5, Opus 5, GPT-5.6 Sol, Gemini 3.1 Pro — para escrever o template. Você paga $0.05–$1 e recebe um template de alta qualidade, gramaticalmente seguro e com múltiplas variantes.
  2. Renderize para sempre, localmente. O Spintax resolve o template na sua CPU. Milhares de variantes custam efetivamente zero.
  3. Atualize quando o sentido mudar. Regere o template só quando os fatos ou o posicionamento mudarem — não quando o fornecedor renomear um modelo. Para um produto estável, isso pode ser trimestral.

Você paga por qualidade onde ela importa. E para de pagar por quantidade.

Ressalvas

  • Os preços mudam, e os nomes também. A tabela inteira acima mudou entre abril e julho de 2026 — e depois de novo entre julho e agosto. Reveja as páginas dos provedores antes de orçar e nunca deixe fixo no código um ID de modelo que você não reverificou neste trimestre.
  • Escrever no cache não é grátis. Os “90% de desconto” da manchete valem para a leitura do cache. Anthropic e OpenAI cobram um prêmio na escrita, e o Google cobra armazenamento por hora. Um cache lido uma única vez sai mais caro do que nenhum cache.
  • Batch nem sempre é 50%. A xAI dá 20%. A Moonshot dá 40% e exclui seu flagship. A Alibaba se recusa a combinar batch com cache. O desconto da DeepSeek é o horário do dia, não uma fila de batch. Não presuma que a combinação se aplica antes de verificar.
  • Contexto longo custa mais em alguns provedores. Os níveis Gemini Pro e o Grok 4.6 praticamente dobram acima de 200K tokens. Anthropic e OpenAI cobram tarifa fixa em toda a janela de contexto.
  • A qualidade não é a mesma em todos os níveis. Níveis econômicos servem bem para estrutura e reescritas. Voz com nuance, fidelidade em contexto longo e ancoragem factual ainda favorecem o flagship. Use modelos baratos para renders locais, não para o template em si.

Para onde ir depois

Pronto para transformar uma boa geração de IA em milhares de renders? Comece pela série de autoria:

A série de guias de autoria está disponível apenas em inglês.

Fontes dos dados: páginas de preços de Anthropic, OpenAI, Google, xAI, DeepSeek, Alibaba, Moonshot, Mistral — verificadas em 2026-08-20. Os cálculos por artigo assumem 3,000 input tokens + 3,500 output tokens por artigo.