El blog de seguridad de FireAI

Por FireAI Security & Research Team · Publicado

Cuánto cuesta un token de IA, de 2022 a 2026: OpenAI, Anthropic y DeepSeek

Cuánto cuesta un token de IA, de 2022 a 2026: OpenAI, Anthropic y DeepSeek

Un token es aproximadamente tres cuartos de una palabra en inglés, explicó la propia página de precios de OpenAI en 2022, justo después de señalar que una oración de 35 tokens cuesta una fracción de un centavo. Ese marco apenas sobrevive al contacto con 2026: los modelos más pequeños ahora cuestan una fracción de un centavo por token, los más grandes cuestan cincuenta dólares por millón de tokens de salida, y tres proveedores (OpenAI, Anthropic y DeepSeek) han recortado, aumentado, dividido y vuelto a dividir sus precios varias veces. Cada figura a continuación proviene de una página que obtuvimos: ya sea la página de precios actual del proveedor o una instantánea de Internet Archive de esa misma página desde la fecha que se muestra. Cuando calculamos una razón, ambos números a partir de los cuales se construye se citan en el mismo párrafo.

OpenAI, 2022 a 2026

En noviembre de 2022, la página de precios de OpenAI enumeró cuatro modelos base, Ada, Babbage, Curie y Davinci, cada uno con el mismo precio para cada token, independientemente de si era rápido o de salida; todavía no había una división de entrada/salida. Davinci, el más capaz de los cuatro, cuesta 0,02 dólares por cada 1.000 tokens. La página de obsolescencia actual de OpenAI confirma de forma independiente esa cifra exacta, 20 dólares por millón de tokens, como el precio al que se facturó text-davinci-003, el modelo específico construido en ese nivel, hasta su cierre en 2024. Cuatro meses después, GPT-4 se lanzó a $ 0,03 por 1000 tokens de aviso y $ 0,06 por 1000 tokens de finalización para su versión de contexto de 8K, duplicándose a $ 0,06 y $ 0,12 para la versión de 32K: la primera vez que el precio público de OpenAI cobraba más tokens de salida que tokens de entrada. gpt-3.5-turbo se lanzó el mismo mes a un precio fijo de $0,002 por cada 1000 tokens, nuevamente sin división de entrada/salida.

Precios de lista de OpenAI. Las filas "actuales" son la fecha de publicación de este artículo.
ModeloIngrese $/1 millónProducción $/1 millónPrecio a partir deFuente
texto-davinci-003$20.00$20.00noviembre de 2022@@ENLACE0@@
gpt-3.5-turbo (lanzamiento)$2.00$2.00marzo de 2023@@ENLACE0@@
GPT-4, contexto 8K (lanzamiento)$30.00$60.00marzo de 2023@@ENLACE0@@
gpt-4o-2024-05-13 (lanzamiento)$5.00$15.00mayo 2024@@ENLACE0@@
o1 (razonamiento)$15.00$60.00listado actual@@ENLACE0@@
gpt-4o (precio actual)$2.50$10.00actual@@ENLACE0@@
gpt-6-luna (corriente más barata)$0.10$0.50actual@@ENLACE0@@
gpt-6-astra (actual buque insignia)$10.00$50.00actual@@ENLACE0@@

Dos comparaciones, ambas construidas solo a partir de las filas anteriores: el precio de entrada de $20,00 de text-davinci-003 frente a los $0,10 actuales de gpt-6-luna es una caída de 200 veces en aproximadamente cuatro años, para el nivel más barato disponible de OpenAI en cada momento. Pero el precio de entrada original de $ 30,00 de GPT-4 frente a los $ 10,00 actuales de gpt-6-astra es solo una caída de 3 veces para una comparación entre buque insignia: el nivel barato cayó mucho más rápido que el caro. El precio del gpt-4o se redujo a la baja después del lanzamiento, de $ 5,00/$ 15,00 en mayo de 2024 a $ 2,50/$ 10,00 hoy, un caso sencillo en el que el mismo modelo se vuelve más barato sin cambiar su capacidad en absoluto.

Antrópico, 2023 a 2026

La primera hoja de precios para desarrolladores de Anthropic que pudimos recuperar, un PDF archivado de julio de 2023, valoraba a Claude 2, lanzado ese mismo mes, en 11,02 dólares por millón de tokens de entrada y 32,68 dólares por millón de tokens de salida, y señaló que Claude 1 seguía disponible al mismo precio. Claude Instant, el nivel más barato en ese momento, costaba 1,63 dólares de entrada y 5,51 dólares de salida. A principios de 2024, antes de que se enviara Claude 3, una instantánea archivada muestra Claude 2.0 y 2.1 reducidos a $8,00/$24,00 y Instant reducido a $0,80/$2,40: reducciones modestas en la línea existente. Claude 3, lanzado en marzo de 2024, restableció por completo el fondo del rango: Haiku llegó a $0,25/$1,25, muy por debajo de todo lo que Anthropic había ofrecido antes, mientras que Sonnet y Opus se lanzaron a $3,00/$15,00 y $15,00/$75,00. Claude 3.5 Sonnet, tres meses después, se lanzó exactamente a los mismos $ 3,00/$ 15,00 que Claude 3 Sonnet: un caso en el que el precio se mantuvo estable mientras el modelo en sí mejoraba.

Precios de lista antrópicos, Claude API.
ModeloIngrese $/1 millónProducción $/1 millónPrecio a partir deFuente
Claude 1 / Claude 2 (mismo precio)$11.02$32.68julio de 2023@@ENLACE0@@
Claude instantáneo$1.63$5.51julio de 2023@@ENLACE0@@
Claude 2.0 / 2.1 (después del recorte de precio)$8.00$24.00febrero de 2024@@ENLACE0@@
Claude 3 Haiku (lanzamiento)$0.25$1.25marzo de 2024@@ENLACE0@@
Claude 3 Soneto (lanzamiento)$3.00$15.00marzo de 2024@@ENLACE0@@
Claude 3 Opus (lanzamiento)$15.00$75.00marzo de 2024@@ENLACE0@@
Soneto Claude 3.5 (lanzamiento)$3.00$15.00junio de 2024@@ENLACE0@@
Haiku 4.5 (actualmente más barato)$1.00$5.00actual@@ENLACE0@@
Soneto 5 (actual)$2.00$10.00actual@@ENLACE0@@
Fable 5.1 (actual buque insignia)$10.00$50.00actual@@ENLACE0@@

Aquí la curva no desciende simplemente. Claude 3 Haiku se lanzó con un precio de entrada de 0,25 dólares en marzo de 2024; El modelo más barato actual de Anthropic, Haiku 4.5, cuesta $ 1,00, cuatro veces más caro, por token, que el nivel barato de dos años antes. Solo leyendo, parece que la IA se ha vuelto más cara. Lea a continuación el resto de este artículo, parece otra cosa: Anthropic mantuvo el precio por token de su nivel más bajo aproximadamente estable o ligeramente en aumento, al tiempo que hizo que ese nivel fuera mucho más capaz, y también agregó un nivel insignia nuevo y más caro (Fable 5.1 a $ 10,00/$ 50,00) por encima de lo que Opus solía ser el mejor. La alineación creció en más niveles en lugar de volverse uniformemente más barata.

DeepSeek y el shock razonamiento-precio

DeepSeek entró en este mercado con un precio muy inferior al de sus dos rivales. En mayo de 2024, su página de precios archivada muestra deepseek-chat, respaldado por DeepSeek-V2, con una entrada fija de $0,14 y una salida de $0,28, más barato que cualquier cosa que OpenAI o Anthropic ofrecieran en ese momento, antes de que cualquiera de ellos enviara un token más barato que $0,25. Para diciembre de 2024, deepseek-chat se había actualizado a DeepSeek-V3, y la página de precios de DeepSeek introdujo una división de aciertos/errores de caché: una instantánea archivada muestra la tarifa estándar (posterior a la promoción) de $0,07 de entrada de caché, $0,27 de entrada de caché y $1,10 de salida. Luego, el 20 de enero de 2025, DeepSeek lanzó R1, un modelo de razonamiento, con una entrada de caché de 0,14 dólares, una entrada de caché perdida de 0,55 dólares y una salida de 2,19 dólares; una instantánea archivada de ocho días después confirma ese precio, explícitamente excluido de cualquier descuento promocional.

precios de lista de DeepSeek; Las filas actuales muestran la tarifa fuera de las horas pico (DeepSeek descuenta el uso en horas pico a la inversa; consulte a continuación).
ModeloIngrese $/1M (acierto de caché/pérdida de caché)Producción $/1 millónPrecio a partir deFuente
DeepSeek-V2 (chat de búsqueda profunda)fijo $0.14$0.28mayo 2024@@ENLACE0@@
DeepSeek-V3 (chat de búsqueda profunda, tarifa estándar)$0,07 / $0,27$1.10diciembre de 2024@@ENLACE0@@
DeepSeek-R1 (razonador de búsqueda profunda, lanzamiento)$0,14 / $0,55$2.19enero de 2025@@ENLACE0@@
deepseek-flash (actual, fuera de horas pico)$0,003 / $0,15$0.60actual@@ENLACE0@@
deepseek-v4-pro (actual, fuera de horas pico)$0,022 / $0,66$1.98actual@@ENLACE0@@

El lanzamiento de R1 es el número más claro en todo este artículo: una producción de $2,19 frente a o1 de OpenAI, un modelo de razonamiento comparable, con una producción de $60,00, una diferencia de 27 veces, ambas cifras de las tablas anteriores. Esa comparación es exactamente lo que hizo de R1 una historia más allá de la audiencia habitual de desarrolladores en enero de 2025. También vale la pena notar lo que dicen los propios números de DeepSeek sobre el razonamiento específico: el precio de salida de $2,19 de R1 es aproximadamente el doble de los $1,10 de V3, dentro del mismo proveedor, en el mismo momento. El razonamiento en cadena de pensamiento no sólo añade un multiplicador de costos a nivel de API; La propia documentación de DeepSeek señala que el recuento de tokens de salida de un modelo de razonamiento incluye cada token de su rastreo de razonamiento, no solo la respuesta final, por lo que una consulta de razonamiento quema muchos más tokens de salida que una directa incluso antes de que se aplique el precio por token. Y los precios actuales de DeepSeek añaden un mecanismo que ningún otro proveedor utiliza: las tarifas en horas pico aproximadamente duplican las tarifas fuera de las horas pico en el mismo modelo, una forma de fijación de precios basada en la demanda más cercana a la facturación de electricidad que a una lista de precios fijos.

El patrón que esconden los números planos

Si se colocan las cifras de los tokens más baratos disponibles de los tres proveedores en una línea de tiempo, la forma no es una curva suave. El nivel barato de OpenAI cayó de 20,00 dólares (noviembre de 2022) a 0,10 dólares hoy, esencialmente de forma monótona. El nivel económico de Anthropic cayó con fuerza una vez, de $ 1,63 (2023, Claude Instant) a $ 0,25 (marzo de 2024, Claude 3 Haiku), luego volvió a subir a $ 1,00 (actual, Haiku 4.5) a medida que ese nivel se volvió más capaz. DeepSeek entró ya a bajo precio y se ha mantenido allí, añadiendo además precios según la hora del día. Ninguna de las curvas de los tres proveedores se parece a la otra, y ninguna parece una simple caída exponencial una vez que se rastrea un nivel específico en lugar de "como se llame el modelo más barato este año".

Los productos cuestan más que los insumos y la proporción se amplió

En el lanzamiento de GPT-4 en marzo de 2023, la producción costaba exactamente el doble de la entrada: 60,00 dólares frente a 30,00 dólares. Si observa los modelos actuales emblemáticos y de nivel medio de los tres proveedores, la relación se ha ampliado: gpt-6-astra es 5x ($50,00 frente a $10,00), Claude 3 Opus se lanzó a 5x ($75,00 frente a $15,00) y permaneció allí hasta Haiku 4.5 (5x, $5,00 frente a $1,00), y la tasa estándar de DeepSeek-V3 es aproximadamente 4x ($1,10 frente a $0,27 de pérdida de caché). La explicación técnica habitual es arquitectónica más que comercial: la generación de tokens de salida ocurre uno a la vez, de manera autorregresiva, mientras que los tokens de entrada de un mensaje se pueden procesar en paralelo en un solo paso hacia adelante, por lo que el costo de cómputo real de un proveedor por token de salida es mayor que por token de entrada, y los precios se han desviado para reflejar esa brecha con mayor precisión con el tiempo que la división 2x ​​original y más redonda de GPT-4.

Descuentos en caché y por lotes

Los tres proveedores ahora descuentan tokens que el modelo ya ha visto. La página de precios actual de OpenAI enumera la entrada en caché de gpt-6-astra a $ 1,00 frente a una tarifa de entrada estándar de $ 10,00, un descuento de 10 veces por reutilizar un prefijo de aviso idéntico y establece por separado que su API por lotes procesa solicitudes dentro de un período de 24 horas a la mitad del precio sincrónico estándar en todos los modelos elegibles. El precio actual de Anthropic muestra el precio de lectura de caché rápida de Fable 5.1 a $0,25 frente a una tarifa de entrada estándar de $10,00 (40 veces más barata), mientras que una escritura en caché cuesta $12,50, una prima sobre la tarifa estándar de $10,00, ya que escribir una nueva entrada de caché supone un verdadero trabajo extra la primera vez. La división de aciertos/errores de caché de DeepSeek, descrita anteriormente, está integrada en su precio base en lugar de ofrecerse como una característica separada: la tasa de aciertos de caché de R1 de $0,14 frente a su tasa de aciertos de caché de $0,55 es aproximadamente una diferencia de 4 veces en cada llamada, no solo en las solicitudes que se inscriben. Para cualquier carga de trabajo que repita un mensaje largo del sistema o un conjunto fijo de definiciones de herramientas en muchas llamadas: un canal de clasificación de seguridad que clasifica una línea de registro tras otra según las mismas instrucciones es un claro ejemplo: estos descuentos cambian qué proveedor es más barato más que el precio principal por token.

La paradoja de Jevons: por qué los tokens más baratos aumentaron el gasto total

En 1865, el economista William Stanley Jevons publicó The Coal Question, argumentando que el consumo de carbón en Gran Bretaña aumentó, no disminuyó, después de que la máquina de vapor más eficiente en combustible de James Watt abaratara el trabajo impulsado por carbón. Como lo expresa el resumen del argumento de Wikipedia, citando directamente a Jevons:

Es una confusión de ideas suponer que el uso económico del combustible equivale a un menor consumo. La verdad es todo lo contrario.

William Stanley Jevons, 1865, as quoted in Wikipedia: Jevons paradox

El argumento, que desde entonces se ha generalizado mucho más allá del carbón, es que hacer que un recurso sea más eficiente en su uso reduce su precio efectivo, y un precio más bajo aumenta la cantidad demandada en más de lo que ahorra la ganancia de eficiencia, por lo que el consumo total aumenta. Según el mismo resumen de Wikipedia, este argumento exacto fue ampliamente invocado a principios de 2025 en torno al modelo R1 barato de DeepSeek, y comentaristas como el CEO de Microsoft, Satya Nadella, y el economista Erik Brynjolfsson citaron discusiones sobre si una inferencia de IA radicalmente más barata reduciría o aumentaría los recursos totales gastados en IA. Nos basamos aquí en ese resumen secundario de comentarios mencionados en lugar de en un estudio económico primario que mide el efecto agregado, y la afirmación de que el gasto en IA en toda la industria está aumentando debido a tokens más baratos, en lugar de a pesar de un auge de demanda separado y no relacionado, es una interpretación debatida, no una estadística establecida. Lo que las tablas de precios anteriores respaldan directamente es la condición previa para el argumento: la misma consulta que costó decenas de dólares en cómputo en 2022 puede costar centavos hoy, a todos los proveedores, que es exactamente el tipo de colapso de precios que históricamente ha precedido al aumento del consumo en lugar de su caída.

Qué significa esto para ejecutar la IA localmente en lugar de en la nube

Cada precio en este artículo es un costo medido por llamada facturado por una empresa que necesariamente recibe su mensaje para responder; eso es lo que es una llamada API. Un modelo que se ejecuta completamente en su propio dispositivo no tiene factura por token después de haberlo pagado o descargado una vez, y no tiene nada que enviar a ninguna parte, porque no hay ningún punto final remoto en la ruta de solicitud. Esto no es una afirmación de que los modelos en el dispositivo coincidan con los niveles fronterizos con precios anteriores; un modelo lo suficientemente pequeño como para funcionar cómodamente en una computadora portátil no superará a Fable 5.1 o gpt-6-astra. Es un oficio diferente: un costo fijo y un límite de privacidad firme, a cambio de cualquier capacidad que quepa en la memoria que realmente tienes.

Esa compensación no es abstracta; es el mismo que crea un modelo pequeño y de alcance limitado dentro de un software de seguridad. FireAI, el firewall para Mac de HisnLabs, incluye un modelo local opcional cuyo único trabajo es revisar una conexión desde una aplicación para la que aún no tiene una regla, una tarea con un alcance mucho menor que cualquier cosa que se indique en las tablas anteriores, y en la que el modelo se ejecuta en la propia Mac en lugar de llamar a cualquiera de estas API. El objetivo de analizar con tanto detalle el historial de precios de OpenAI, Anthropic y DeepSeek no es vender ese diseño; es hacer que el comercio sea concreto: los tokens en la nube compraron mucha más capacidad por mucho menos dinero entre 2022 y 2026, y en cada uno de esos precios, usarlos aún significaba enviar sus datos al servidor de otra persona para obtener una respuesta.

El papel de FireAI y de HisnLabs

None of this makes FireAI a cost story — it is a firewall, not a rented model — but the same bet sits underneath its own on-device reviewer: no per-token bill and nothing sent off the Mac, because the review happens locally instead of being shipped to a server.

FireAI es el propio producto de HisnLabs: un cortafuegos con IA integrada para Mac. Muestra, en lenguaje claro, cada conexión que hacen tus aplicaciones y te deja decidir qué sale de tu Mac; su IA funciona en el propio equipo, así que tu tráfico nunca se envía a HisnLabs ni a nadie más. El equipo de investigación en seguridad de HisnLabs es quien mantiene esas decisiones fiables: cataloga qué dominios son simple telemetría frente a un servicio real, sigue el país y la red detrás de una conexión, y entrena el modelo local (la función Autopilot) con tráfico real, sin que nada salga de tu Mac.

Puedes leer las decisiones técnicas detrás de esto, o probar FireAI durante 17 días, en FireAI, de HisnLabs.

Fuentes