Um token é aproximadamente três quartos de uma palavra em inglês, explicava a própria página de preços da OpenAI lá em 2022, logo depois de observar que uma frase de 35 tokens custa uma fração de centavo. Essa descrição mal sobrevive ao contato com 2026: os menores modelos hoje custam uma fração de uma fração de centavo por token, os maiores custam cinquenta dólares por milhão de tokens de saída, e três fornecedores — OpenAI, Anthropic e DeepSeek — cada um cortou, aumentou, dividiu e redividiu seus preços várias vezes. Todo número abaixo vem de uma página que consultamos: ou a página de preços atual do fornecedor, ou um snapshot do Internet Archive dessa mesma página na data indicada. Onde calculamos uma razão, os dois números usados são citados no mesmo parágrafo.
OpenAI, de 2022 a 2026
Em novembro de 2022, a página de preços da OpenAI listava quatro modelos base, Ada, Babbage, Curie e Davinci, cada um com o mesmo preço para todo token, independentemente de ser prompt ou saída — ainda não havia divisão entrada/saída. O Davinci, o mais capaz dos quatro, custava US$ 0,02 por 1.000 tokens. A atual página de descontinuações da OpenAI confirma de forma independente esse número exato, US$ 20,00 por milhão de tokens, como o preço pelo qual o text-davinci-003 — o modelo específico construído nesse nível — foi cobrado até seu desligamento em 2024. Quatro meses depois, o GPT-4 foi lançado a US$ 0,03 por 1.000 tokens de prompt e US$ 0,06 por 1.000 tokens de conclusão para sua versão de contexto de 8K, dobrando para US$ 0,06 e US$ 0,12 na versão de 32K — a primeira vez que a tabela de preços pública da OpenAI cobrou mais pelos tokens de saída do que pelos de entrada. O gpt-3.5-turbo foi lançado no mesmo mês a um valor fixo de US$ 0,002 por 1.000 tokens, novamente sem divisão entrada/saída.
| Modelo | Entrada US$/1M | Saída US$/1M | Preço em | Fonte |
|---|---|---|---|---|
| text-davinci-003 | US$ 20,00 | US$ 20,00 | nov. 2022 | página de preços arquivada |
| gpt-3.5-turbo (lançamento) | US$ 2,00 | US$ 2,00 | mar. 2023 | página de preços arquivada |
| GPT-4, contexto de 8K (lançamento) | US$ 30,00 | US$ 60,00 | mar. 2023 | página de preços arquivada |
| gpt-4o-2024-05-13 (lançamento) | US$ 5,00 | US$ 15,00 | mai. 2024 | documentação de preços da OpenAI |
| o1 (raciocínio) | US$ 15,00 | US$ 60,00 | listagem atual | documentação de preços da OpenAI |
| gpt-4o (preço atual) | US$ 2,50 | US$ 10,00 | atual | documentação de preços da OpenAI |
| gpt-6-luna (mais barato atualmente) | US$ 0,10 | US$ 0,50 | atual | documentação de preços da OpenAI |
| gpt-6-astra (topo de linha atual) | US$ 10,00 | US$ 50,00 | atual | documentação de preços da OpenAI |
Duas comparações, ambas construídas apenas com as linhas acima: o preço de entrada de US$ 20,00 do text-davinci-003 contra o preço atual de US$ 0,10 do gpt-6-luna representa uma queda de 200 vezes em cerca de quatro anos, para o nível mais barato disponível da OpenAI em cada momento. Mas o preço original de entrada de US$ 30,00 do GPT-4 contra o preço atual de US$ 10,00 do gpt-6-astra é uma queda de apenas 3 vezes numa comparação de topo de linha contra topo de linha — o nível barato caiu muito mais rápido do que o caro. O próprio gpt-4o teve seu preço reduzido depois do lançamento, de US$ 5,00/US$ 15,00 em maio de 2024 para US$ 2,50/US$ 10,00 hoje, um caso simples do mesmo modelo ficando mais barato sem nenhuma mudança de capacidade.
Anthropic, de 2023 a 2026
A tabela de preços para desenvolvedores mais antiga da Anthropic que conseguimos recuperar, um PDF arquivado de julho de 2023, precificava o Claude 2 — lançado naquele mesmo mês — em US$ 11,02 por milhão de tokens de entrada e US$ 32,68 por milhão de tokens de saída, e observava que o Claude 1 continuava disponível pelo mesmo preço. O Claude Instant, o nível barato da época, custava US$ 1,63 de entrada e US$ 5,51 de saída. No início de 2024, antes do lançamento do Claude 3, um snapshot arquivado mostra o Claude 2.0 e o 2.1 reduzidos para US$ 8,00/US$ 24,00 e o Instant reduzido para US$ 0,80/US$ 2,40 — reduções modestas na linha existente. O Claude 3, lançado em março de 2024, redefiniu totalmente o piso da faixa: o Haiku chegou a US$ 0,25/US$ 1,25, bem abaixo de qualquer coisa que a Anthropic já tivesse oferecido, enquanto o Sonnet e o Opus foram lançados a US$ 3,00/US$ 15,00 e US$ 15,00/US$ 75,00. O Claude 3.5 Sonnet, três meses depois, foi lançado exatamente pelo mesmo US$ 3,00/US$ 15,00 do Claude 3 Sonnet — um caso de preço estável enquanto o próprio modelo melhorava.
| Modelo | Entrada US$/1M | Saída US$/1M | Preço em | Fonte |
|---|---|---|---|---|
| Claude 1 / Claude 2 (mesmo preço) | US$ 11,02 | US$ 32,68 | jul. 2023 | PDF de preços arquivado |
| Claude Instant | US$ 1,63 | US$ 5,51 | jul. 2023 | PDF de preços arquivado |
| Claude 2.0 / 2.1 (após corte de preço) | US$ 8,00 | US$ 24,00 | fev. 2024 | PDF de preços arquivado |
| Claude 3 Haiku (lançamento) | US$ 0,25 | US$ 1,25 | mar. 2024 | página de API arquivada |
| Claude 3 Sonnet (lançamento) | US$ 3,00 | US$ 15,00 | mar. 2024 | página de API arquivada |
| Claude 3 Opus (lançamento) | US$ 15,00 | US$ 75,00 | mar. 2024 | página de API arquivada |
| Claude 3.5 Sonnet (lançamento) | US$ 3,00 | US$ 15,00 | jun. 2024 | snapshot de preços arquivado |
| Haiku 4.5 (mais barato atualmente) | US$ 1,00 | US$ 5,00 | atual | preços do Claude |
| Sonnet 5 (atual) | US$ 2,00 | US$ 10,00 | atual | preços do Claude |
| Fable 5.1 (topo de linha atual) | US$ 10,00 | US$ 50,00 | atual | preços do Claude |
Aqui a curva não simplesmente cai. O Claude 3 Haiku foi lançado a US$ 0,25 de entrada em março de 2024; o modelo mais barato atual da Anthropic, o Haiku 4.5, está listado a US$ 1,00 — quatro vezes mais caro, por token, do que o nível barato de dois anos antes. Lido isoladamente, isso parece dizer que a IA ficou mais cara. Lido junto do restante deste artigo, parece outra coisa: a Anthropic manteve o preço por token do seu nível mais baixo aproximadamente estável, com leve alta, enquanto tornava esse nível muito mais capaz, e também acrescentou um novo nível topo de linha, mais caro (o Fable 5.1, a US$ 10,00/US$ 50,00), acima do que costumava ser o topo representado pelo Opus. A linha ganhou mais níveis em vez de simplesmente ficar uniformemente mais barata.
A DeepSeek e o choque de preço do raciocínio
A DeepSeek entrou nesse mercado já com preços bem abaixo dos dois rivais. Em maio de 2024, sua página de preços arquivada mostra o deepseek-chat, baseado no DeepSeek-V2, a um valor fixo de US$ 0,14 de entrada e US$ 0,28 de saída — mais barato do que qualquer coisa que a OpenAI ou a Anthropic oferecessem na época, antes de qualquer uma das duas lançar um token mais barato que US$ 0,25. Em dezembro de 2024, o deepseek-chat já havia sido atualizado internamente para o DeepSeek-V3, e a página de preços da DeepSeek introduziu uma divisão entre acerto e erro de cache: um snapshot arquivado mostra a taxa padrão (pós-promoção) em US$ 0,07 de entrada com acerto de cache, US$ 0,27 de entrada com erro de cache e US$ 1,10 de saída. Depois, em 20 de janeiro de 2025, a DeepSeek lançou o R1, um modelo de raciocínio, a US$ 0,14 de entrada com acerto de cache, US$ 0,55 com erro de cache e US$ 2,19 de saída — um snapshot arquivado oito dias depois confirma esse preço, explicitamente excluído de qualquer desconto promocional.
| Modelo | Entrada US$/1M (acerto de cache / erro de cache) | Saída US$/1M | Preço em | Fonte |
|---|---|---|---|---|
| DeepSeek-V2 (deepseek-chat) | fixo US$ 0,14 | US$ 0,28 | mai. 2024 | página de preços arquivada |
| DeepSeek-V3 (deepseek-chat, taxa padrão) | US$ 0,07 / US$ 0,27 | US$ 1,10 | dez. 2024 | página de preços arquivada |
| DeepSeek-R1 (deepseek-reasoner, lançamento) | US$ 0,14 / US$ 0,55 | US$ 2,19 | jan. 2025 | página de preços arquivada |
| deepseek-flash (atual, fora do pico) | US$ 0,003 / US$ 0,15 | US$ 0,60 | atual | documentação de preços da DeepSeek |
| deepseek-v4-pro (atual, fora do pico) | US$ 0,022 / US$ 0,66 | US$ 1,98 | atual | documentação de preços da DeepSeek |
O lançamento do R1 é o número mais marcante de todo este artigo: US$ 2,19 de saída contra os US$ 60,00 de saída do o1 da OpenAI, um modelo de raciocínio comparável — uma diferença de 27 vezes, os dois números vindos das tabelas acima. Essa comparação é exatamente o que fez do R1 uma notícia além do público habitual de desenvolvedores em janeiro de 2025. Também vale notar o que os próprios números da DeepSeek dizem especificamente sobre raciocínio: o preço de saída de US$ 2,19 do R1 é aproximadamente o dobro do US$ 1,10 do V3, dentro do mesmo fornecedor, no mesmo momento. O raciocínio em cadeia de pensamento não apenas adiciona um multiplicador de custo no nível da API; a própria documentação da DeepSeek observa que a contagem de tokens de saída de um modelo de raciocínio inclui cada token do seu rastro de raciocínio, não apenas a resposta final, então uma consulta de raciocínio consome muito mais tokens de saída do que uma consulta direta, mesmo antes de aplicar o preço por token. E a precificação atual da DeepSeek acrescenta um mecanismo que nenhum dos outros dois fornecedores usa: as tarifas de horário de pico chegam a dobrar as tarifas fora do pico no mesmo modelo, uma forma de precificação por demanda mais parecida com a cobrança de energia elétrica do que com uma tabela de preços fixa.
O padrão que os números isolados escondem
Colocando os números do token mais barato disponível dos três fornecedores em uma única linha do tempo, o formato não é uma curva suave. O nível barato da OpenAI caiu de US$ 20,00 (nov. 2022) até US$ 0,10 hoje, de forma praticamente monotônica. O nível barato da Anthropic caiu bruscamente uma vez, de US$ 1,63 (2023, Claude Instant) para US$ 0,25 (mar. 2024, Claude 3 Haiku), depois voltou a subir para US$ 1,00 (atual, Haiku 4.5) conforme esse nível ficou mais capaz. A DeepSeek entrou já barata e permaneceu assim, ao mesmo tempo em que acrescentou precificação por horário do dia. Nenhuma das três curvas se parece com as outras, e nenhuma delas se parece com um simples declínio exponencial quando se acompanha um nível específico em vez de "seja lá qual for o modelo mais barato chamado este ano".
A saída custa mais do que a entrada, e a razão aumentou
No lançamento do GPT-4 em março de 2023, a saída custava exatamente o dobro da entrada: US$ 60,00 contra US$ 30,00. Observando os modelos topo de linha e de nível intermediário atuais dos três fornecedores, essa razão aumentou: o gpt-6-astra está em 5 vezes (US$ 50,00 contra US$ 10,00), o Claude 3 Opus foi lançado em 5 vezes (US$ 75,00 contra US$ 15,00) e assim permaneceu até o Haiku 4.5 (5 vezes, US$ 5,00 contra US$ 1,00), e a taxa padrão do DeepSeek-V3 é de aproximadamente 4 vezes (US$ 1,10 contra US$ 0,27 de erro de cache). A explicação técnica usual é arquitetural, não comercial: gerar tokens de saída acontece um de cada vez, de forma autorregressiva, enquanto os tokens de entrada de um prompt podem ser processados em paralelo em uma única passagem direta, então o custo computacional real de um fornecedor por token de saída é maior do que por token de entrada, e a precificação foi se ajustando ao longo do tempo para refletir esse hiato com mais precisão do que a divisão original, mais arredondada, de 2 vezes do GPT-4.
Descontos de cache e de lote
Os três fornecedores hoje dão desconto em tokens que o modelo, na prática, já viu. A página de preços atual da OpenAI lista a entrada em cache do gpt-6-astra a US$ 1,00 contra uma tarifa de entrada padrão de US$ 10,00, um desconto de 10 vezes por reutilizar um prefixo de prompt idêntico, e afirma separadamente que sua Batch API processa requisições dentro de uma janela de 24 horas pela metade do preço síncrono padrão nos modelos elegíveis. Os preços atuais da Anthropic mostram o preço de leitura do prompt caching do Fable 5.1 a US$ 0,25 contra uma tarifa de entrada padrão de US$ 10,00 — 40 vezes mais barato —, enquanto uma escrita de cache custa US$ 12,50, um valor acima da tarifa padrão de US$ 10,00, já que escrever uma nova entrada de cache exige de fato trabalho extra na primeira vez. A divisão entre acerto e erro de cache da DeepSeek, descrita acima, está embutida na sua precificação básica em vez de oferecida como um recurso separado: a tarifa de acerto de cache de US$ 0,14 do R1 contra sua tarifa de erro de cache de US$ 0,55 representa uma diferença de aproximadamente 4 vezes em toda chamada, não apenas em requisições que optam por isso. Para qualquer carga de trabalho que repita um prompt de sistema longo ou um conjunto fixo de definições de ferramentas em muitas chamadas — um pipeline de triagem de segurança classificando uma linha de log após outra segundo as mesmas instruções é um exemplo claro —, esses descontos mudam qual fornecedor é mais barato mais do que o preço por token de destaque.
O paradoxo de Jevons: por que tokens mais baratos elevaram o gasto total
Em 1865, o economista William Stanley Jevons publicou The Coal Question, argumentando que o consumo de carvão da Grã-Bretanha aumentou, e não diminuiu, depois que a máquina a vapor mais eficiente de James Watt tornou o trabalho movido a carvão mais barato. Como o resumo da Wikipédia sobre o argumento coloca, citando Jevons diretamente:
É uma confusão de ideias supor que o uso econômico do combustível equivale à diminuição do consumo. A verdade é exatamente o contrário.
William Stanley Jevons, 1865, conforme citado em Wikipédia: paradoxo de Jevons
O argumento, desde então generalizado bem além do carvão, é que tornar um recurso mais eficiente de usar reduz seu preço efetivo, e um preço mais baixo aumenta a quantidade demandada em mais do que o ganho de eficiência economiza — então o consumo total sobe. Segundo o mesmo resumo da Wikipédia, esse exato argumento foi amplamente invocado no início de 2025 em torno do barato modelo R1 da DeepSeek, com comentaristas incluindo o CEO da Microsoft, Satya Nadella, e o economista Erik Brynjolfsson citados discutindo se uma inferência de IA radicalmente mais barata reduziria ou aumentaria o total de recursos gastos com IA. Aqui nos baseamos nesse resumo secundário de comentários nomeados, em vez de um estudo econômico primário medindo o efeito agregado, e a alegação de que o gasto do setor com IA está subindo por causa de tokens mais baratos — em vez de apesar de um boom de demanda separado e não relacionado — é uma interpretação debatida, não uma estatística consolidada. O que as tabelas de preços acima sustentam diretamente é a pré-condição do argumento: a mesma consulta que custava dezenas de dólares em computação em 2022 pode custar centavos hoje, em todos os fornecedores, o que é exatamente o tipo de colapso de preço que historicamente antecedeu o aumento, e não a queda, do consumo.
O que isso significa para rodar IA localmente em vez de na nuvem
Todo preço deste artigo é um custo medido, por chamada, cobrado por uma empresa que necessariamente recebe o seu prompt para respondê-lo — é isso que é uma chamada de API. Um modelo que roda inteiramente no seu próprio dispositivo não tem cobrança por token depois que você o pagou ou baixou uma única vez, e não tem nada para enviar a lugar nenhum, porque não existe nenhum endpoint remoto no caminho da requisição. Isso não é uma afirmação de que modelos no dispositivo se equiparam aos níveis de ponta precificados acima; um modelo pequeno o suficiente para rodar confortavelmente em um laptop não vai superar o raciocínio do Fable 5.1 ou do gpt-6-astra. É uma troca diferente: um custo fixo e uma fronteira de privacidade firme, em troca de qualquer capacidade que caiba na memória que você de fato tem.
Essa troca não é abstrata; é a mesma que um modelo pequeno e de escopo estreito no dispositivo faz dentro de um software de segurança. O FireAI, o firewall para Mac da HisnLabs, traz um modelo local opcional cuja única função é analisar uma conexão de um aplicativo para o qual ainda não existe uma regra — uma tarefa com um escopo muito menor do que qualquer coisa precificada nas tabelas acima, e uma na qual o modelo roda no próprio Mac em vez de chamar qualquer uma dessas APIs. O objetivo de percorrer o histórico de preços da OpenAI, da Anthropic e da DeepSeek com tanto detalhe não é vender esse design; é tornar a troca concreta: os tokens na nuvem compraram muito mais capacidade por muito menos dinheiro entre 2022 e 2026, e em cada um desses patamares de preço, usá-los ainda significava enviar seus dados para o servidor de outra pessoa para receber uma resposta de volta.
Onde FireAI e HisnLabs entram nessa história
None of this makes FireAI a cost story — it is a firewall, not a rented model — but the same bet sits underneath its own on-device reviewer: no per-token bill and nothing sent off the Mac, because the review happens locally instead of being shipped to a server.
O FireAI é o produto da HisnLabs: um firewall com IA que roda direto no seu Mac. Ele mostra, em linguagem simples, cada conexão que seus aplicativos fazem e deixa você decidir o que sai do seu Mac — a IA roda localmente, então seu tráfego nunca é enviado para nós nem para ninguém. A equipe de pesquisa em segurança da HisnLabs é quem mantém essas decisões confiáveis: cataloga quais domínios são telemetria comum e quais são um serviço de verdade, rastreia o país e a rede por trás de uma conexão e treina o modelo local (o recurso Autopilot) com padrões reais de tráfego, sem que nada disso saia do seu Mac.
Você pode ler as decisões técnicas por trás dele, ou testar o FireAI por 17 dias, em FireAI, da HisnLabs.
