Le blog sécurité de FireAI

Par FireAI Security & Research Team · Publié

Quel est le coût d’un jeton IA, 2022 à 2026 : OpenAI, Anthropic et DeepSeek

Quel est le coût d’un jeton IA, 2022 à 2026 : OpenAI, Anthropic et DeepSeek

Un jeton représente environ les trois quarts d’un mot anglais, a expliqué la propre page de tarification d’OpenAI en 2022, juste après avoir noté qu’une phrase de 35 jetons coûte une fraction de centime. Ce cadre survit à peine au contact avec 2026 : les plus petits modèles coûtent désormais une fraction de cent par jeton, les plus grands coûtent cinquante dollars par million de jetons de sortie, et trois fournisseurs – OpenAI, Anthropic et DeepSeek – ont chacun réduit, augmenté, divisé et redivisé leurs prix plusieurs fois. Chaque figure ci-dessous provient d'une page que nous avons récupérée : soit la page de tarification actuelle du fournisseur, soit un instantané d'Internet Archive de cette même page à partir de la date indiquée. Lorsque nous calculons un ratio, les deux nombres à partir desquels il est construit sont cités dans le même paragraphe.

OpenAI, 2022 à 2026

En novembre 2022, la page de tarification d'OpenAI répertoriait quatre modèles de base, Ada, Babbage, Curie et Davinci, chacun au même prix pour chaque jeton, qu'il s'agisse d'une invite ou d'une sortie – il n'y avait pas encore de répartition entrée/sortie. Davinci, le plus performant des quatre, coûte 0,02 $ pour 1 000 jetons. La page actuelle des dépréciations d'OpenAI confirme indépendamment ce chiffre exact, 20,00 $ par million de jetons, comme prix auquel text-davinci-003 – le modèle spécifique construit sur ce niveau – a été facturé jusqu'à son arrêt en 2024. Quatre mois plus tard, GPT-4 a été lancé à 0,03 USD pour 1 000 jetons d'invite et à 0,06 USD pour 1 000 jetons d'achèvement pour sa version contextuelle 8K, doublant à 0,06 USD et 0,12 USD pour la version 32K - la première fois que la tarification publique d'OpenAI facturait les jetons de sortie plus que les jetons d'entrée. gpt-3.5-turbo a été lancé le même mois à un prix fixe de 0,002 $ pour 1 000 jetons, encore une fois sans répartition entrée/sortie.

Tarifs catalogue OpenAI. Les lignes « actuelles » correspondent à la date de publication de cet article.
ModèleEntrée $/1MProduction $/1MPrix ​​à partir deSource
texte-davinci-00320,00 $20,00 $novembre 2022@@LIEN0@@
gpt-3.5-turbo (lancement)2,00 $2,00 $mars 2023@@LIEN0@@
GPT-4, contexte 8K (lancement)30,00 $60,00 $mars 2023@@LIEN0@@
gpt-4o-2024-05-13 (lancement)5,00 $15,00 $mai 2024@@LIEN0@@
o1 (raisonnement)15,00 $60,00 $inscription actuelle@@LIEN0@@
gpt-4o (prix actuel)2,50 $10,00 $actuel@@LIEN0@@
gpt-6-luna (courant le moins cher)0,10 $0,50 $actuel@@LIEN0@@
gpt-6-astra (phare actuel)10,00 $50,00 $actuel@@LIEN0@@

Deux comparaisons, toutes deux construites uniquement à partir des lignes ci-dessus : le prix d'entrée de 20,00 $ de text-davinci-003 par rapport au prix actuel de 0,10 $ de gpt-6-luna représente une baisse de 200 fois sur environ quatre ans, pour le niveau disponible le moins cher d'OpenAI à chaque instant. Mais le prix d'entrée initial de 30,00 $ de GPT-4 par rapport aux 10,00 $ actuels de gpt-6-astra ne représente qu'une baisse de 3 fois pour une comparaison de produit phare à produit phare – le niveau bon marché a chuté beaucoup plus rapidement que le niveau cher. Le prix du gpt-4o lui-même a été revu à la baisse après son lancement, passant de 5,00 $/15,00 $ en mai 2024 à 2,50 $/10,00 $ aujourd'hui, un cas simple où le même modèle devient moins cher sans changer du tout ses capacités.

Anthropique, 2023 à 2026

La première fiche tarifaire d'Anthropic que nous avons pu récupérer, un PDF archivé de juillet 2023, fixait le prix de Claude 2 – lancé le même mois – à 11,02 $ par million de jetons d'entrée et 32,68 $ par million de jetons de sortie, et notait que Claude 1 restait disponible au même prix. Claude Instant, le niveau le moins cher à l'époque, coûtait 1,63 $ en entrée et 5,51 $ en sortie. Début 2024, avant l'expédition de Claude 3, un instantané archivé montre Claude 2.0 et 2.1 réduits à 8,00 $/24,00 $ et Instant réduits à 0,80 $/2,40 $ – des réductions modestes sur la gamme existante. Claude 3, lancé en mars 2024, a complètement réinitialisé le bas de gamme : Haiku est arrivé à 0,25 $/1,25 $, bien en dessous de tout ce qu'Anthropic avait proposé auparavant, tandis que Sonnet et Opus ont été lancés à 3,00 $/15,00 $ et 15,00 $/75,00 $. Claude 3.5 Sonnet, trois mois plus tard, a été lancé exactement au même prix de 3,00 $/15,00 $ que Claude 3 Sonnet – un cas où le prix reste stable pendant que le modèle lui-même s'améliore.

Tarifs catalogue Anthropique, Claude API.
ModèleEntrée $/1MProduction $/1MPrix ​​à partir deSource
Claude 1 / Claude 2 (même prix)11,02 $32,68 $juillet 2023@@LIEN0@@
Claude Instant1,63 $5,51 $juillet 2023@@LIEN0@@
Claude 2.0 / 2.1 (après baisse de prix)8,00 $24,00 $février 2024@@LIEN0@@
Claude 3 Haïku (lancement)0,25 $1,25 $mars 2024@@LIEN0@@
Claude 3 Sonnet (lancement)3,00 $15,00 $mars 2024@@LIEN0@@
Claude 3 Opus (lancement)15,00 $75,00 $mars 2024@@LIEN0@@
Claude 3.5 Sonnet (lancement)3,00 $15,00 $juin 2024@@LIEN0@@
Haiku 4.5 (actuellement le moins cher)1,00 $5,00 $actuel@@LIEN0@@
Sonnet 5 (actuel)2,00 $10,00 $actuel@@LIEN0@@
Fable 5.1 (phare actuel)10,00 $50,00 $actuel@@LIEN0@@

Ici, la courbe ne descend pas simplement. Claude 3 Haiku a été lancé à 0,25 $ en mars 2024 ; Le modèle le moins cher actuel d'Anthropic, Haiku 4.5, coûte 1,00 $, soit quatre fois plus cher, par jeton, que le niveau bon marché de deux ans plus tôt. À lire seule, il semble que l’IA soit devenue plus chère. Lisez à côté du reste de cet article, cela ressemble à autre chose : Anthropic a maintenu le prix par jeton de son niveau le plus bas à peu près stable ou légèrement en hausse tout en rendant ce niveau beaucoup plus performant, et il a également ajouté un nouveau niveau phare plus cher (Fable 5.1 à 10,00 $/50,00 $) au-dessus de ce qu'Opus était autrefois le sommet. La gamme a augmenté de plus en plus de niveaux au lieu de simplement devenir uniformément moins chère.

DeepSeek et le choc raisonnement-prix

DeepSeek est entré sur ce marché à un prix déjà bien inférieur à celui de ses deux concurrents. En mai 2024, sa page de tarification archivée montre deepseek-chat, soutenu par DeepSeek-V2, à une entrée fixe de 0,14 $ et une sortie de 0,28 $ – moins cher que tout ce qu'OpenAI ou Anthropic proposaient à l'époque, avant que l'un ou l'autre n'expédie un jeton moins cher que 0,25 $. En décembre 2024, deepseek-chat avait été mis à niveau vers DeepSeek-V3, et la page de tarification de DeepSeek a introduit une répartition entre les accès au cache et les échecs de cache : un instantané archivé montre le tarif standard (post-promotion) à 0,07 $ d'entrée de cache-hit, 0,27 $ d'entrée de cache-miss et 1,10 $ de sortie. Puis, le 20 janvier 2025, DeepSeek a publié R1, un modèle de raisonnement, à 0,14 $ d'entrée de cache, 0,55 $ d'entrée de cache et 2,19 $ de sortie – un instantané archivé de huit jours plus tard confirme ce prix, explicitement exclu de toute remise promotionnelle.

Prix ​​catalogue DeepSeek ; les lignes actuelles affichent le tarif hors pointe (DeepSeek réduit l'utilisation aux heures de pointe à l'envers - voir ci-dessous).
ModèleEntrée $/1 M (accès au cache/manque de cache)Production $/1MPrix ​​à partir deSource
DeepSeek-V2 (deepseek-chat)plat 0,14 $0,28 $mai 2024@@LIEN0@@
DeepSeek-V3 (deepseek-chat, tarif standard)0,07 $ / 0,27 $1,10 $décembre 2024@@LIEN0@@
DeepSeek-R1 (raisonneur de recherche profonde, lancement)0,14 $ / 0,55 $2,19 $janvier 2025@@LIEN0@@
deepseek-flash (courant, heures creuses)0,003 $ / 0,15 $0,60 $actuel@@LIEN0@@
deepseek-v4-pro (actuel, heures creuses)0,022 $ / 0,66 $1,98 $actuel@@LIEN0@@

Le lancement de R1 est le chiffre le plus précis de tout cet article : un rendement de 2,19 $ par rapport au o1 d'OpenAI, un modèle de raisonnement comparable, à un rendement de 60,00 $ – un écart de 27x, les deux chiffres des tableaux ci-dessus. Cette comparaison est exactement ce qui a fait de R1 une histoire au-delà du public habituel des développeurs en janvier 2025. Il convient également de noter ce que les propres chiffres de DeepSeek disent sur le raisonnement spécifique : le prix de sortie de 2,19 $ de R1 est à peu près le double de celui de 1,10 $ de V3, chez le même fournisseur, au même moment. Le raisonnement en chaîne de pensée n’ajoute pas seulement un multiplicateur de coûts au niveau de l’API ; La propre documentation de DeepSeek note que le nombre de jetons de sortie d'un modèle de raisonnement inclut chaque jeton de sa trace de raisonnement, pas seulement la réponse finale, de sorte qu'une requête de raisonnement brûle beaucoup plus de jetons de sortie qu'une requête directe, avant même que le prix par jeton ne soit appliqué. Et la tarification actuelle de DeepSeek ajoute un mécanisme qu’aucun autre fournisseur n’utilise : les tarifs aux heures de pointe doublent à peu près les tarifs hors pointe sur le même modèle, une forme de tarification basée sur la demande plus proche de la facturation de l’électricité que d’une liste de prix fixes.

Le motif que cachent les nombres plats

Mettez les chiffres des jetons les moins chers disponibles des trois fournisseurs sur une seule chronologie et la forme n’est pas une courbe lisse. Le niveau bon marché d’OpenAI est passé de 20,00 $ (novembre 2022) à 0,10 $ aujourd’hui, de manière essentiellement monotone. Le niveau bon marché d’Anthropic a chuté une fois, de 1,63 $ (2023, Claude Instant) à 0,25 $ (mars 2024, Claude 3 Haiku), puis est remonté à 1,00 $ (actuel, Haiku 4.5) à mesure que ce niveau devenait plus performant. DeepSeek est déjà entré à bas prix et y est resté, tout en ajoutant en plus des prix en fonction de l'heure de la journée. Aucune des courbes des trois fournisseurs ne se ressemble, et aucune d'entre elles ne ressemble à une simple baisse exponentielle une fois que vous suivez un niveau spécifique plutôt que « quel que soit le nom du modèle le moins cher cette année ».

La production coûte plus cher que l’intrant, et le ratio s’est élargi

Lors du lancement de GPT-4 en mars 2023, la sortie coûtait exactement le double de l'entrée : 60,00 $ contre 30,00 $. Regardez les modèles phares et intermédiaires actuels des trois fournisseurs et le ratio s'est élargi : gpt-6-astra est 5x (50,00 $ contre 10,00 $), Claude 3 Opus a été lancé à 5x (75,00 $ contre 15,00 $) et y est resté jusqu'à Haiku 4.5 (5x, 5,00 $ contre 1,00 $), et le tarif standard de DeepSeek-V3 est d'environ 4x (1,10 $). contre 0,27 $ de cache-miss). L’explication technique habituelle est architecturale plutôt que commerciale : la génération de jetons de sortie s’effectue un par un, de manière autorégressive, tandis que les jetons d’entrée d’une invite peuvent être traités en parallèle en un seul passage, de sorte que le coût de calcul réel d’un fournisseur par jeton de sortie est plus élevé que par jeton d’entrée, et les prix ont dérivé vers un reflet plus précis de cet écart au fil du temps que la répartition 2x originale et plus ronde de GPT-4.

Remises sur le cache et les lots

Les trois fournisseurs proposent désormais des remises sur les jetons que le modèle a effectivement déjà vus. La page de tarification actuelle d'OpenAI répertorie l'entrée en cache de gpt-6-astra à 1,00 $ contre un taux d'entrée standard de 10,00 $, une remise de 10 fois pour la réutilisation d'un préfixe d'invite identique, et indique séparément que son API Batch traite les demandes dans un délai de 24 heures à la moitié du prix synchrone standard sur tous les modèles éligibles. Le prix actuel d'Anthropic indique le prix de lecture de la mise en cache rapide de Fable 5.1 à 0,25 $ contre un taux d'entrée standard de 10,00 $ – 40 fois moins cher – tandis qu'une écriture en cache coûte 12,50 $, une prime par rapport au taux standard de 10,00 $, car l'écriture d'une nouvelle entrée de cache entraîne un réel travail supplémentaire la première fois. La répartition des accès au cache et des échecs de cache de DeepSeek, décrite ci-dessus, est intégrée à son prix de base plutôt que proposée en tant que fonctionnalité distincte : le taux d'accès au cache de 0,14 $ de R1 par rapport à son taux d'échec du cache de 0,55 $ représente environ une différence de 4 x pour chaque appel, et pas seulement pour les demandes d'adhésion. Pour toute charge de travail qui répète une longue invite système ou un ensemble fixe de définitions d'outils sur de nombreux appels, un pipeline de triage de sécurité classe une ligne de journal après l'autre en fonction des mêmes instructions. est un exemple clair : ces remises changent davantage le fournisseur le moins cher que le prix global par jeton.

Le paradoxe de Jevons : pourquoi les jetons moins chers ont augmenté les dépenses totales

En 1865, l’économiste William Stanley Jevons a publié The Coal Question, affirmant que la consommation britannique de charbon avait augmenté, et non diminué, après que la machine à vapeur plus économe en carburant de James Watt ait rendu le travail au charbon moins cher. Comme le dit le résumé de l’argument de Wikipédia, citant directement Jevons :

C'est une confusion d'idées que de supposer qu'une utilisation économique du carburant équivaut à une diminution de la consommation. C’est tout le contraire qui est la vérité.

William Stanley Jevons, 1865, as quoted in Wikipedia: Jevons paradox

L’argument, généralisé depuis bien au-delà du charbon, est que le fait de rendre une ressource plus efficace à utiliser abaisse son prix effectif, et qu’un prix plus bas augmente la quantité demandée plus que ce que le gain d’efficacité permet d’économiser – donc la consommation totale augmente. Selon le même résumé de Wikipédia, cet argument précis a été largement invoqué début 2025 autour du modèle R1 bon marché de DeepSeek, avec des commentateurs, dont le PDG de Microsoft, Satya Nadella, et l'économiste Erik Brynjolfsson, cités pour discuter de la question de savoir si l'inférence d'IA radicalement moins chère réduirait ou augmenterait les ressources totales consacrées à l'IA. Nous nous appuyons ici sur ce résumé secondaire des commentaires nommés plutôt que sur une étude économique primaire mesurant l’effet global, et l’affirmation selon laquelle les dépenses en IA à l’échelle de l’industrie augmentent en raison de jetons moins chers – plutôt qu’en dépit d’un boom de la demande distinct et sans rapport – est une interprétation débattue, pas une statistique établie. Ce que les tableaux de prix ci-dessus soutiennent directement est la condition préalable à l’argument : la même requête qui a coûté des dizaines de dollars en calcul en 2022 peut coûter des centimes aujourd’hui, chez chaque fournisseur, ce qui est exactement le genre d’effondrement des prix qui, historiquement, a précédé la hausse plutôt que la baisse de la consommation.

Ce que cela signifie pour exécuter l’IA localement plutôt que dans le cloud

Chaque prix indiqué dans cet article correspond à un coût par appel facturé par une entreprise qui reçoit nécessairement votre invitation à y répondre - c'est ce qu'est un appel API. Un modèle qui fonctionne entièrement sur votre propre appareil n'a pas de facture par jeton une fois que vous l'avez payé ou téléchargé une fois, et il n'a rien à envoyer nulle part, car il n'y a aucun point de terminaison distant dans le chemin de la requête. Cela ne veut pas dire que les modèles intégrés correspondent aux niveaux frontières indiqués ci-dessus ; un modèle suffisamment petit pour fonctionner confortablement sur un ordinateur portable ne surpassera pas Fable 5.1 ou gpt-6-astra. Il s'agit d'un marché différent : un coût fixe et une limite de confidentialité ferme, en échange de la capacité qui correspond à la mémoire dont vous disposez réellement.

Ce compromis n’est pas abstrait ; c'est le même que celui créé par un petit modèle intégré à une portée étroite dans un logiciel de sécurité. FireAI, le pare-feu Mac de HisnLabs, propose un modèle local facultatif dont le seul travail consiste à examiner une connexion à partir d'une application pour laquelle il n'a pas encore de règle – une tâche avec une portée bien plus petite que tout ce qui est indiqué dans les tableaux ci-dessus, et où le modèle s'exécute sur le Mac lui-même plutôt que d'appeler l'une de ces API. L’intérêt de parcourir l’historique des prix d’OpenAI, d’Anthropic et de DeepSeek avec autant de détails n’est pas de vendre cette conception ; il s'agit de rendre le commerce concret : les jetons cloud ont acheté beaucoup plus de capacités pour beaucoup moins d'argent entre 2022 et 2026, et à chacun de ces niveaux de prix, les utiliser signifiait toujours envoyer vos données au serveur de quelqu'un d'autre pour obtenir une réponse.

Le rôle de FireAI et de HisnLabs

None of this makes FireAI a cost story — it is a firewall, not a rented model — but the same bet sits underneath its own on-device reviewer: no per-token bill and nothing sent off the Mac, because the review happens locally instead of being shipped to a server.

FireAI est le produit de HisnLabs : un pare-feu IA embarqué pour Mac. Il montre en langage clair chaque connexion faite par vos applications et vous laisse décider ce qui sort de votre Mac — son IA fonctionne en local, votre trafic ne nous est jamais envoyé, ni à personne d’autre. L’équipe de recherche en sécurité de HisnLabs est celle qui garde ces décisions fiables : elle recense les domaines de simple télémétrie face à ceux d’un vrai service, suit le pays et le réseau derrière une connexion, et entraîne le modèle embarqué (la fonction Autopilot) sur du trafic réel, sans que rien ne quitte votre Mac.

Vous pouvez lire les choix techniques qui s’y trouvent, ou essayer FireAI pendant 17 jours, sur FireAI, par HisnLabs.

Sources