O blog de segurança da FireAI

Por FireAI Security & Research Team · Publicado

Quanto Custava um Token de IA, de 2022 a 2026: OpenAI, Anthropic e DeepSeek

Quanto Custava um Token de IA, de 2022 a 2026: OpenAI, Anthropic e DeepSeek

Um token é aproximadamente três quartos de uma palavra em inglês, explicava a própria página de preços da OpenAI em 2022, logo depois de notar que uma frase de 35 tokens custava uma fração de um cêntimo. Esse enquadramento quase não sobrevive ao confronto com 2026: os modelos mais pequenos custam agora uma fração de uma fração de um cêntimo por token, os maiores custam cinquenta dólares por milhão de tokens de saída, e três fornecedores — OpenAI, Anthropic e DeepSeek — cortaram, subiram, dividiram e voltaram a dividir os seus preços várias vezes. Cada valor abaixo vem de uma página que fomos consultar: ou a página de preços atual do fornecedor, ou uma captura do Internet Archive dessa mesma página na data indicada. Onde calculamos uma razão, ambos os números em que se baseia estão citados no mesmo parágrafo.

OpenAI, de 2022 a 2026

Em novembro de 2022, a página de preços da OpenAI listava quatro modelos de base, Ada, Babbage, Curie e Davinci, cada um com o mesmo preço por token independentemente de ser de entrada ou de saída — ainda não havia divisão entrada/saída. O Davinci, o mais capaz dos quatro, custava 0,02 USD por 1000 tokens. A atual página de descontinuações da OpenAI confirma de forma independente esse mesmo valor, 20,00 USD por milhão de tokens, como o preço a que o text-davinci-003 — o modelo específico construído sobre esse nível — foi faturado até ao seu encerramento em 2024. Quatro meses depois, o GPT-4 foi lançado a 0,03 USD por 1000 tokens de entrada e 0,06 USD por 1000 tokens de conclusão para a sua versão de contexto de 8K, duplicando para 0,06 e 0,12 USD na versão de 32K — a primeira vez que os preços públicos da OpenAI cobravam mais pelos tokens de saída do que pelos de entrada. O gpt-3.5-turbo foi lançado no mesmo mês a um preço fixo de 0,002 USD por 1000 tokens, também sem divisão entrada/saída.

Preços de tabela da OpenAI. As linhas "atual" referem-se à data de publicação deste artigo.
ModeloEntrada USD/1MSaída USD/1MPreço a partir deFonte
text-davinci-00320,00 USD20,00 USDNov 2022página de preços arquivada
gpt-3.5-turbo (lançamento)2,00 USD2,00 USDMar 2023página de preços arquivada
GPT-4, contexto 8K (lançamento)30,00 USD60,00 USDMar 2023página de preços arquivada
gpt-4o-2024-05-13 (lançamento)5,00 USD15,00 USDMai 2024documentação de preços da OpenAI
o1 (raciocínio)15,00 USD60,00 USDlistagem atualdocumentação de preços da OpenAI
gpt-4o (preço atual)2,50 USD10,00 USDatualdocumentação de preços da OpenAI
gpt-6-luna (nível mais barato atual)0,10 USD0,50 USDatualdocumentação de preços da OpenAI
gpt-6-astra (topo de gama atual)10,00 USD50,00 USDatualdocumentação de preços da OpenAI

Duas comparações, ambas construídas apenas a partir das linhas acima: o preço de entrada de 20,00 USD do text-davinci-003 face aos atuais 0,10 USD do gpt-6-luna é uma queda de 200 vezes ao longo de cerca de quatro anos, para o nível mais barato disponível da OpenAI em cada momento. Mas o preço de entrada original de 30,00 USD do GPT-4 face aos atuais 10,00 USD do gpt-6-astra é apenas uma queda de 3 vezes, numa comparação de topo de gama para topo de gama — o nível barato caiu muito mais depressa do que o caro. O próprio gpt-4o foi repreçado para baixo depois do lançamento, de 5,00/15,00 USD em maio de 2024 para os atuais 2,50/10,00 USD, um caso simples do mesmo modelo a ficar mais barato sem alterar em nada a sua capacidade.

Anthropic, de 2023 a 2026

A folha de preços para programadores mais antiga da Anthropic que conseguimos recuperar, um PDF arquivado de julho de 2023, apresentava o Claude 2 — lançado nesse mesmo mês — a 11,02 USD por milhão de tokens de entrada e 32,68 USD por milhão de tokens de saída, e notava que o Claude 1 continuava disponível ao mesmo preço. O Claude Instant, o nível barato da altura, custava 1,63 USD de entrada e 5,51 USD de saída. No início de 2024, antes do lançamento do Claude 3, uma captura arquivada mostra o Claude 2.0 e o 2.1 reduzidos para 8,00/24,00 USD e o Instant reduzido para 0,80/2,40 USD — reduções modestas na gama existente. O Claude 3, lançado em março de 2024, redefiniu por completo o fundo da gama: o Haiku surgiu a 0,25/1,25 USD, bem abaixo de tudo o que a Anthropic tinha oferecido antes, enquanto o Sonnet e o Opus foram lançados a 3,00/15,00 USD e 15,00/75,00 USD. O Claude 3.5 Sonnet, três meses depois, foi lançado exatamente ao mesmo preço de 3,00/15,00 USD do Claude 3 Sonnet — um caso de preço estável enquanto o próprio modelo melhorava.

Preços de tabela da Anthropic, API do Claude.
ModeloEntrada USD/1MSaída USD/1MPreço a partir deFonte
Claude 1 / Claude 2 (mesmo preço)11,02 USD32,68 USDJul 2023PDF de preços arquivado
Claude Instant1,63 USD5,51 USDJul 2023PDF de preços arquivado
Claude 2.0 / 2.1 (após corte de preço)8,00 USD24,00 USDFev 2024PDF de preços arquivado
Claude 3 Haiku (lançamento)0,25 USD1,25 USDMar 2024página da API arquivada
Claude 3 Sonnet (lançamento)3,00 USD15,00 USDMar 2024página da API arquivada
Claude 3 Opus (lançamento)15,00 USD75,00 USDMar 2024página da API arquivada
Claude 3.5 Sonnet (lançamento)3,00 USD15,00 USDJun 2024captura de preços arquivada
Haiku 4.5 (mais barato atual)1,00 USD5,00 USDatualpreços do Claude
Sonnet 5 (atual)2,00 USD10,00 USDatualpreços do Claude
Fable 5.1 (topo de gama atual)10,00 USD50,00 USDatualpreços do Claude

Aqui a curva não desce simplesmente. O Claude 3 Haiku foi lançado a 0,25 USD de entrada em março de 2024; o atual modelo mais barato da Anthropic, o Haiku 4.5, tem um preço de tabela de 1,00 USD — quatro vezes mais caro, por token, do que o nível barato de dois anos antes. Lido isoladamente, isso parece a IA a ficar mais cara. Lido ao lado do resto deste artigo, parece outra coisa: a Anthropic manteve o preço por token do seu nível mais baixo aproximadamente estável a ligeiramente crescente, ao mesmo tempo que tornava esse nível muito mais capaz, e acrescentou ainda um novo nível topo de gama, mais caro (o Fable 5.1, a 10,00/50,00 USD), acima do que o Opus costumava ser o topo. A gama cresceu em número de níveis, em vez de simplesmente ficar uniformemente mais barata.

A DeepSeek e o choque de preços do raciocínio

A DeepSeek entrou neste mercado já com preços muito abaixo dos seus dois rivais. Em maio de 2024, a sua página de preços arquivada mostra o deepseek-chat, assente no DeepSeek-V2, a um preço fixo de 0,14 USD de entrada e 0,28 USD de saída — mais barato do que tudo o que a OpenAI ou a Anthropic ofereciam na altura, antes de qualquer uma delas ter lançado um token abaixo de 0,25 USD. Em dezembro de 2024, o deepseek-chat tinha sido atualizado internamente para o DeepSeek-V3, e a página de preços da DeepSeek introduziu uma divisão entre acerto e falha de cache: uma captura arquivada mostra a tarifa padrão (pós-promoção) a 0,07 USD de entrada com acerto de cache, 0,27 USD de entrada com falha de cache e 1,10 USD de saída. Depois, a 20 de janeiro de 2025, a DeepSeek lançou o R1, um modelo de raciocínio, a 0,14 USD de entrada com acerto de cache, 0,55 USD com falha de cache e 2,19 USD de saída — uma captura arquivada de oito dias depois confirma esse preço, explicitamente excluído de qualquer desconto promocional.

Preços de tabela da DeepSeek; as linhas atuais mostram a tarifa fora de pico (a DeepSeek desconta a utilização em horário de pico de forma inversa — ver abaixo).
ModeloEntrada USD/1M (acerto / falha de cache)Saída USD/1MPreço a partir deFonte
DeepSeek-V2 (deepseek-chat)fixo 0,14 USD0,28 USDMai 2024página de preços arquivada
DeepSeek-V3 (deepseek-chat, tarifa padrão)0,07 / 0,27 USD1,10 USDDez 2024página de preços arquivada
DeepSeek-R1 (deepseek-reasoner, lançamento)0,14 / 0,55 USD2,19 USDJan 2025página de preços arquivada
deepseek-flash (atual, fora de pico)0,003 / 0,15 USD0,60 USDatualdocumentação de preços da DeepSeek
deepseek-v4-pro (atual, fora de pico)0,022 / 0,66 USD1,98 USDatualdocumentação de preços da DeepSeek

O lançamento do R1 é o número mais marcante de todo este artigo: 2,19 USD de saída contra os 60,00 USD de saída do o1 da OpenAI, um modelo de raciocínio comparável — uma diferença de 27 vezes, ambos os valores retirados das tabelas acima. Essa comparação é exatamente o que tornou o R1 uma notícia para além do público habitual de programadores em janeiro de 2025. Vale também a pena notar o que os próprios números da DeepSeek dizem sobre o raciocínio especificamente: o preço de saída de 2,19 USD do R1 é aproximadamente o dobro do 1,10 USD do V3, dentro do mesmo fornecedor, no mesmo momento. O raciocínio em cadeia de pensamento não se limita a acrescentar um multiplicador de custo ao nível da API; a própria documentação da DeepSeek nota que a contagem de tokens de saída de um modelo de raciocínio inclui cada token do seu percurso de raciocínio, não apenas a resposta final, pelo que uma consulta de raciocínio consome muito mais tokens de saída do que uma consulta direta, mesmo antes de se aplicar o preço por token. E os preços atuais da DeepSeek acrescentam um mecanismo que nenhum dos outros fornecedores usa: as tarifas de hora de pico duplicam aproximadamente as tarifas fora de pico no mesmo modelo, uma forma de tarifação por procura mais próxima da faturação da eletricidade do que de uma lista de preços fixa.

O padrão que os números planos escondem

Ponha os valores do token mais barato disponível dos três fornecedores numa única linha do tempo e a forma não é uma curva suave. O nível barato da OpenAI caiu de 20,00 USD (nov. de 2022) para perto de 0,10 USD hoje, de forma essencialmente monótona. O nível barato da Anthropic caiu bruscamente uma vez, de 1,63 USD (2023, Claude Instant) para 0,25 USD (mar. de 2024, Claude 3 Haiku), depois voltou a subir para 1,00 USD (atual, Haiku 4.5) à medida que esse nível se tornou mais capaz. A DeepSeek entrou já barata e manteve-se assim, acrescentando ainda uma tarifação por hora do dia. Nenhuma das três curvas dos fornecedores se parece com as outras, e nenhuma delas se parece com um simples declínio exponencial assim que se segue um nível específico, em vez de "seja qual for o modelo mais barato chamado este ano".

A saída custa mais do que a entrada, e a razão alargou-se

No lançamento do GPT-4 em março de 2023, a saída custava exatamente o dobro da entrada: 60,00 USD contra 30,00 USD. Olhe para os atuais modelos de topo de gama e de nível intermédio dos três fornecedores e a razão alargou-se: o gpt-6-astra é 5 vezes (50,00 USD contra 10,00 USD), o Claude 3 Opus foi lançado a 5 vezes (75,00 USD contra 15,00 USD) e manteve-se assim até ao Haiku 4.5 (5 vezes, 5,00 USD contra 1,00 USD), e a tarifa padrão do DeepSeek-V3 é aproximadamente 4 vezes (1,10 USD contra 0,27 USD com falha de cache). A explicação técnica habitual é arquitetural, e não comercial: gerar tokens de saída acontece um de cada vez, de forma autorregressiva, enquanto os tokens de entrada de um pedido podem ser processados em paralelo numa única passagem, pelo que o custo real de computação de um fornecedor por token de saída é maior do que por token de entrada, e os preços foram derivando no sentido de refletir essa diferença com mais rigor do que a divisão original, mais redonda, de 2 vezes do GPT-4.

Descontos de cache e de lote

Os três fornecedores descontam agora tokens que o modelo já viu, na prática. A atual página de preços da OpenAI lista a entrada em cache do gpt-6-astra a 1,00 USD contra uma tarifa de entrada normal de 10,00 USD, um desconto de 10 vezes por reutilizar um prefixo de pedido idêntico, e declara separadamente que a sua API de Lote processa pedidos dentro de uma janela de 24 horas a metade do preço síncrono padrão nos modelos elegíveis. Os preços atuais da Anthropic mostram o preço de leitura da cache de pedidos do Fable 5.1 a 0,25 USD contra uma tarifa de entrada normal de 10,00 USD — 40 vezes mais barato — enquanto uma escrita na cache custa 12,50 USD, um agravo sobre a tarifa normal de 10,00 USD, já que escrever uma nova entrada de cache faz trabalho extra real na primeira vez. A divisão de acerto/falha de cache da DeepSeek, descrita acima, está incorporada nos seus preços de base, em vez de oferecida como funcionalidade separada: a tarifa de acerto de cache de 0,14 USD do R1 contra a sua tarifa de falha de cache de 0,55 USD é aproximadamente uma diferença de 4 vezes em cada chamada, e não apenas em pedidos que optam por isso. Para qualquer carga de trabalho que repita uma longa instrução de sistema ou um conjunto fixo de definições de ferramentas ao longo de muitas chamadas — um pipeline de triagem de segurança que classifica uma linha de registo após outra contra as mesmas instruções é um exemplo claro — estes descontos alteram qual o fornecedor mais barato mais do que o preço por token em destaque.

O paradoxo de Jevons: por que os tokens mais baratos elevaram a despesa total

Em 1865, o economista William Stanley Jevons publicou The Coal Question, argumentando que o consumo de carvão da Grã-Bretanha subiu, e não desceu, depois de o motor a vapor mais eficiente de James Watt ter tornado o trabalho movido a carvão mais barato. Como o resumo da Wikipédia sobre o argumento coloca, citando o próprio Jevons:

É uma confusão de ideias supor que o uso económico do combustível equivale a um consumo diminuído. O contrário é que é a verdade.

William Stanley Jevons, 1865, citado em Wikipédia: paradoxo de Jevons

O argumento, desde então generalizado muito para além do carvão, é que tornar um recurso mais eficiente de usar reduz o seu preço efetivo, e um preço mais baixo aumenta a quantidade procurada em mais do que o ganho de eficiência poupa — pelo que o consumo total sobe. Segundo o mesmo resumo da Wikipédia, este exato argumento foi amplamente invocado no início de 2025 em torno do barato modelo R1 da DeepSeek, com comentadores incluindo o presidente executivo da Microsoft, Satya Nadella, e o economista Erik Brynjolfsson, citados a discutir se uma inferência de IA radicalmente mais barata iria encolher ou fazer crescer o total de recursos gastos em IA. Baseamo-nos aqui nesse resumo secundário de comentários com nome, e não num estudo económico primário que meça o efeito agregado, e a afirmação de que a despesa da indústria em IA está a subir por causa de tokens mais baratos — e não apesar de um boom de procura separado e sem relação — é uma interpretação debatida, não uma estatística assente. O que as tabelas de preços acima sustentam diretamente é a pré-condição do argumento: a mesma consulta que custava dezenas de dólares em computação em 2022 pode custar cêntimos hoje, em todos os fornecedores, o que é exatamente o tipo de colapso de preços que historicamente tem precedido uma subida, e não uma descida, do consumo.

O que isto significa para correr IA localmente em vez de na nuvem

Cada preço neste artigo é um custo medido, por chamada, faturado por uma empresa que necessariamente recebe o seu pedido para lhe responder — é isso que é uma chamada de API. Um modelo que corre inteiramente no seu próprio dispositivo não tem fatura por token depois de o ter pago ou descarregado uma vez, e não tem nada para enviar para lado nenhum, porque não há nenhum ponto remoto no percurso do pedido. Isso não é uma afirmação de que os modelos no dispositivo igualam os níveis de topo de gama com preços acima; um modelo suficientemente pequeno para correr confortavelmente num portátil não vai superar em raciocínio o Fable 5.1 ou o gpt-6-astra. É uma troca diferente: um custo fixo e uma fronteira de privacidade firme, em troca de qualquer capacidade que caiba na memória que realmente tem.

Essa troca não é abstrata; é a mesma que um pequeno modelo no dispositivo, de âmbito restrito, faz dentro de uma peça de software de segurança. O FireAI, a firewall para Mac da HisnLabs, inclui um modelo local opcional cuja única tarefa é rever uma ligação de uma aplicação para a qual ainda não tem regra — uma tarefa com um âmbito muito mais pequeno do que tudo o que foi cotado nas tabelas acima, e em que o modelo corre no próprio Mac em vez de chamar qualquer uma destas APIs. O objetivo de percorrer o historial de preços da OpenAI, da Anthropic e da DeepSeek com tanto pormenor não é vender essa conceção; é tornar a troca concreta: os tokens na nuvem compraram muito mais capacidade por muito menos dinheiro entre 2022 e 2026, e, em cada um desses pontos de preço, usá-los continuou a significar enviar os seus dados para o servidor de outra pessoa para obter uma resposta de volta.

O papel do FireAI e da HisnLabs

None of this makes FireAI a cost story — it is a firewall, not a rented model — but the same bet sits underneath its own on-device reviewer: no per-token bill and nothing sent off the Mac, because the review happens locally instead of being shipped to a server.

O FireAI é o produto da HisnLabs: uma firewall com IA que corre diretamente no seu Mac. Mostra, em linguagem clara, cada ligação que as suas aplicações fazem e deixa-o decidir o que sai do seu Mac — a IA funciona localmente, pelo que o seu tráfego nunca é enviado para nós nem para mais ninguém. A equipa de investigação em segurança da HisnLabs é quem mantém essas decisões fiáveis: cataloga que domínios são simples telemetria e quais são um serviço real, acompanha o país e a rede por detrás de uma ligação e treina o modelo local (a funcionalidade Autopilot) com padrões de tráfego reais, sem que nada disso saia do seu Mac.

Pode ler as decisões técnicas por detrás dele, ou experimentar o FireAI durante 17 dias, em FireAI, da HisnLabs.

Fontes