Et token er omtrent tre fjerdedeler av et engelsk ord, forklarte OpenAIs egen prisside tilbake i 2022, rett etter å ha lagt merke til at en setning på 35 symboler koster en brøkdel av en cent. Denne innrammingen overlever knapt kontakt med 2026: de minste modellene koster nå en brøkdel av en brøkdel av en cent per token, den største koster femti dollar per million produksjonssymboler, og tre leverandører – OpenAI, Anthropic og DeepSeek – har hver kuttet, hevet, delt og delt prisene sine flere ganger. Hver figur nedenfor kommer fra en side vi hentet: enten leverandørens gjeldende prisside, eller et øyeblikksbilde fra Internettarkivet av den samme siden fra den viste datoen. Der vi beregner et forhold, er begge tallene det er bygget fra, sitert i samme avsnitt.
OpenAI, 2022 til 2026
I november 2022 listet OpenAIs prisside opp fire basismodeller, Ada, Babbage, Curie og Davinci, hver priset likt for hvert token uavhengig av om det var prompt eller utgang – det var ingen input/output-deling ennå. Davinci, den mest kapable av de fire, kostet $0,02 per 1000 tokens. OpenAIs nåværende avskrivningsside bekrefter uavhengig av det nøyaktige tallet, $20,00 per million tokens, som prisen tekst-davinci-003 – den spesifikke modellen bygget på det nivået – ble fakturert til frem til nedleggelsen i 2024. Fire måneder senere ble GPT-4 lansert til $0,03 per 1000 prompt-tokens og $0,06 per 1000 fullførings-tokener for sin 8K-kontekstversjon, doblet til $0,06 og $0,12 for 32K-versjonen - første gang OpenAIs offentlige prising belaster mer enn utdatatokener. gpt-3.5-turbo ble lansert samme måned til en flat $0,002 per 1000 tokens, igjen uten inn-/utgangsdeling.
| Modell | Inndata $/1M | Utgang $/1M | Priset pr | Kilde |
|---|---|---|---|---|
| tekst-davinci-003 | $20,00 | $20,00 | november 2022 | arkivert prisside |
| gpt-3.5-turbo (lansering) | $2,00 | $2,00 | mars 2023 | arkivert prisside |
| GPT-4, 8K kontekst (lansering) | $30,00 | $60,00 | mars 2023 | arkivert prisside |
| gpt-4o-2024-05-13 (lansering) | $5,00 | $15,00 | mai 2024 | OpenAI-prisdokumenter |
| o1 (resonnement) | $15,00 | $60,00 | gjeldende oppføring | OpenAI-prisdokumenter |
| gpt-4o (gjeldende pris) | $2,50 | $10,00 | nåværende | OpenAI-prisdokumenter |
| gpt-6-luna (billigste strøm) | $0,10 | $0,50 | nåværende | OpenAI-prisdokumenter |
| gpt-6-astra (nåværende flaggskip) | $10,00 | $50,00 | nåværende | OpenAI-prisdokumenter |
To sammenligninger, begge bygget bare fra radene over: text-davinci-003s inngangspris på $20,00 mot gpt-6-lunas nåværende $0,10 er et fall på 200 ganger i løpet av omtrent fire år, for OpenAIs billigste tilgjengelige nivå på hvert tidspunkt. Men GPT-4s opprinnelige inngangspris på $30,00 mot gpt-6-astras nåværende $10,00 er bare en 3x nedgang for en flaggskip-til-flaggskip-sammenligning - billigklassen falt langt raskere enn den dyre. Selve gpt-4o ble priset nedover etter lansering, fra $5,00/$15,00 i mai 2024 til $2,50/$10,00 i dag, et enkelt tilfelle av samme modell som ble billigere uten å endre evnen i det hele tatt.
Antropisk, 2023 til 2026
Anthropics tidligste prisliste for utviklere vi kunne gjenopprette, en arkivert PDF fra juli 2023, priset Claude 2 – lansert samme måned – til $11,02 per million input tokens og $32,68 per million output tokens, og bemerket at Claude 1 forble tilgjengelig til den samme prisen. Claude Instant, den billige nivået på den tiden, var $1,63 input og $5,51 output. Tidlig i 2024, før Claude 3 ble sendt, viser et arkivert øyeblikksbilde Claude 2.0 og 2.1 kuttet til $8.00/$24.00 og øyeblikkelig kuttet til $0.80/$2.40 – beskjedne reduksjoner på den eksisterende lineupen. Claude 3, lansert i mars 2024, tilbakestilte bunnen av serien fullstendig: Haiku kom inn på $0,25/$1,25, godt under alt Anthropic hadde tilbudt før, mens Sonnet og Opus lanserte på $3,00/$15,00 og $15,00/$75,00. Claude 3.5 Sonnet, tre måneder senere, ble lansert til nøyaktig samme $3.00/$15.00 som Claude 3 Sonnet - et tilfelle av at prisen holdt seg jevn mens selve modellen ble forbedret.
| Modell | Inndata $/1M | Utgang $/1M | Priset pr | Kilde |
|---|---|---|---|---|
| Claude 1 / Claude 2 (samme pris) | $11,02 | $32,68 | juli 2023 | arkiverte priser PDF |
| Claude Instant | $1,63 | $5,51 | juli 2023 | arkiverte priser PDF |
| Claude 2.0 / 2.1 (etter priskutt) | $8,00 | $24,00 | februar 2024 | arkiverte priser PDF |
| Claude 3 Haiku (lansering) | $0,25 | $1,25 | mars 2024 | arkivert API-side |
| Claude 3 Sonnet (lansering) | $3,00 | $15,00 | mars 2024 | arkivert API-side |
| Claude 3 Opus (lansering) | $15,00 | $75,00 | mars 2024 | arkivert API-side |
| Claude 3.5 Sonnet (lansering) | $3,00 | $15,00 | juni 2024 | arkivert prisbilde |
| Haiku 4.5 (nåværende billigste) | $1,00 | $5,00 | nåværende | Claude priser |
| Sonnet 5 (nåværende) | $2,00 | $10,00 | nåværende | Claude priser |
| Fable 5.1 (nåværende flaggskip) | $10,00 | $50,00 | nåværende | Claude priser |
Her faller ikke kurven bare. Claude 3 Haiku lansert til $0,25 input i mars 2024; Anthropics nåværende billigste modell, Haiku 4.5, koster $1,00 - fire ganger dyrere per token enn billigklassen to år tidligere. Les alene ser det ut til at AI ble dyrere. Les ved siden av resten av denne artikkelen, det ser ut som noe annet: Anthropic holdt sin laveste nivås per-token-pris omtrent flat til svakt stigende samtidig som den gjorde det nivået langt mer kapabelt, og det la også til et nytt, dyrere flaggskipnivå (Fabel 5.1 til $10,00/$50,00) over det Opus pleide å være toppen av. Oppstillingen vokste flere nivåer i stedet for bare å bli jevnt billigere.
DeepSeek og resonnement-prissjokket
DeepSeek gikk inn i dette markedet allerede priset langt under sine to rivaler. I mai 2024 viser dens arkiverte prisside deepseek-chat, støttet av DeepSeek-V2, med en flat $0,14-inngang og $0,28-utgang - billigere enn noe OpenAI eller Anthropic tilbød på den tiden, før begge hadde sendt et token billigere enn $0,25. I desember 2024 hadde deepseek-chat blitt oppgradert på plass til DeepSeek-V3, og DeepSeek sin prisside introduserte en cache-hit/cache-miss-deling: et arkivert øyeblikksbilde viser standard (post-promotion) rate på $0,07 cache-hit input, $0,27 cache-miss input og $1,27 cache-miss input. Så, 20. januar 2025, lanserte DeepSeek R1, en resonneringsmodell, til $0,14 cache-hit input, $0,55 cache-miss input og $2,19 output - et arkivert øyeblikksbilde fra åtte dager senere bekrefter denne prisen, eksplisitt ekskludert fra enhver kampanjerabatt.
| Modell | Inndata $/1M (cache-treff / cache-miss) | Utgang $/1M | Priset pr | Kilde |
|---|---|---|---|---|
| DeepSeek-V2 (deepseek-chat) | flat $0,14 | $0,28 | mai 2024 | arkivert prisside |
| DeepSeek-V3 (deepseek-chat, standardpris) | $0,07 / $0,27 | $1,10 | desember 2024 | arkivert prisside |
| DeepSeek-R1 (deepseek-reasoner, lansering) | $0,14 / $0,55 | $2,19 | januar 2025 | arkivert prisside |
| deepseek-flash (gjeldende, off-peak) | $0,003 / $0,15 | $0,60 | nåværende | DeepSeek-prisdokumenter |
| deepseek-v4-pro (gjeldende, off-peak) | $0,022 / $0,66 | $1,98 | nåværende | DeepSeek-prisdokumenter |
R1s lansering er det skarpeste tallet i hele denne artikkelen: $2,19 output mot OpenAIs o1, en sammenlignbar resonneringsmodell, med $60,00 output - et 27x gap, begge tallene fra tabellene ovenfor. Den sammenligningen er akkurat det som gjorde R1 til en historie utover det vanlige utviklerpublikummet i januar 2025. Det er også verdt å legge merke til hva DeepSeeks egne tall sier om resonnement spesifikt: R1s utgangspris på $2,19 er omtrent det dobbelte av V3s $1,10, innenfor samme leverandør, på samme tidspunkt. Tankekjede-resonnement legger ikke bare til en kostnadsmultiplikator på API-nivå; DeepSeeks egen dokumentasjon bemerker at en resonneringsmodells utdatatoken inkluderer hvert token av resonnementsporet, ikke bare det endelige svaret, så en resonneringsspørring brenner langt flere output tokens enn en direkte, selv før prisen per token brukes. Og DeepSeeks nåværende prissetting legger til en mekanisme som ingen andre leverandører bruker: høytidspriser omtrent dobler lavkonjunkturpriser på samme modell, en form for etterspørselsbasert prissetting nærmere strømfakturering enn en fast prisliste.
Mønsteret de flate tallene skjuler
Plasser de tre leverandørenes billigste-tilgjengelige symbolfigurer på én tidslinje, og formen er ikke en jevn kurve. OpenAIs billige nivå falt fra $20,00 (november 2022) mot $0,10 i dag, hovedsakelig monotont. Anthropics billige nivå falt hardt en gang, fra $1,63 (2023, Claude Instant) til $0,25 (mars 2024, Claude 3 Haiku), og steg deretter tilbake til $1,00 (nåværende, Haiku 4,5) etter hvert som nivået ble mer kapabel. DeepSeek kom inn allerede billig og har bodd der, samtidig som de har lagt til priser for tid på dagen. Ingen av de tre leverandørenes kurver ser ut som hverandre, og ingen av dem ser ut som en enkel eksponentiell nedgang når du sporer et spesifikt nivå i stedet for "uansett hva den billigste modellen heter i år."
Produksjon koster mer enn innsats, og forholdet økte
Ved lanseringen av GPT-4 i mars 2023 kostet produksjonen nøyaktig to ganger inngang: $60,00 mot $30,00. Se på gjeldende flaggskip- og mellomlagsmodeller på tvers av alle tre leverandørene, og forholdet har utvidet seg: gpt-6-astra er 5x ($50,00 mot $10,00), Claude 3 Opus lansert på 5x ($75,00 mot $15,00) og ble der gjennom Haiku 4,5 (5x, $5,00-standardprisen), og De $ 5,00 er standardprisen. omtrent 4x ($1,10 mot $0,27 cache-miss). Den vanlige tekniske forklaringen er arkitektonisk snarere enn kommersiell: generering av utdatatoken skjer én om gangen, autoregressivt, mens en prompts inputtoken kan behandles parallelt i en enkelt foroverpassering, slik at en leverandørs faktiske beregningskostnad per utdatatoken er høyere enn per inputtoken, og prisene har drevet mot å reflektere den opprinnelige GPT-4-tiden mer nøyaktig enn den opprinnelige GPT-4-tiden.
Cache- og batchrabatter
Alle tre leverandørene gir nå rabatt på tokens som modellen faktisk allerede har sett. OpenAIs nåværende prisside viser gpt-6-astras hurtigbufrede inngang til $1,00 mot en standard inputrate på $10,00, en 10x rabatt for gjenbruk av et identisk spørsmålsprefiks, og separat oppgir at Batch API behandler forespørsler innen et 24-timers vindu til halvparten av standard synkronpris på tvers av kvalifiserte modeller. Anthropics nåværende priser viser Fable 5.1s prompt-caching-lesepris til $0,25 mot en $10,00 standard inngangshastighet - 40 ganger billigere - mens en cache-skriving koster $12,50, en premie over $10,00 standardprisen, siden det å skrive en ny cache-oppføring gjør ekstra arbeid første gang. DeepSeeks cache-hit/cache-miss-deling, beskrevet ovenfor, er innebygd i grunnprisene i stedet for å tilbys som en separat funksjon: R1s cache-treffrate på $0,14 mot cache-miss-raten på $0,55 er omtrent en 4x forskjell på hver enkelt samtale, ikke bare på forespørsler som melder seg på. For enhver arbeidsbelastning som gjentar et langvarig systemprosoppsett med definisjoner av anrop, eller en lang systemprospekt. pipeline som klassifiserer den ene logglinjen etter den andre mot de samme instruksjonene er et rent eksempel - disse rabattene endrer hvilken leverandør som er billigste, mer enn prisen per token overskrift gjør.
Jevons-paradokset: hvorfor billigere tokens økte det totale forbruket
I 1865 publiserte økonomen William Stanley Jevons The Coal Question, og hevdet at Storbritannias kullforbruk steg, ikke falt, etter at James Watts mer drivstoffeffektive dampmotor gjorde kulldrevet arbeid billigere. Som Wikipedias oppsummering av argumentet sier det, siterer Jevons direkte:
Det er en forvirring av ideer å anta at økonomisk bruk av drivstoff tilsvarer redusert forbruk. Det motsatte er sannheten.
William Stanley Jevons, 1865, as quoted in Wikipedia: Jevons paradox
Argumentet, siden det er generalisert langt utover kull, er at å gjøre en ressurs mer effektiv å bruke senker dens effektive pris, og en lavere pris øker mengden som etterspørres med mer enn effektivitetsgevinsten sparer - så det totale forbruket øker. I følge det samme Wikipedia-sammendraget ble dette eksakte argumentet mye påberopt tidlig i 2025 rundt DeepSeeks billige R1-modell, med kommentatorer, inkludert Microsofts administrerende direktør Satya Nadella og økonom Erik Brynjolfsson, som nevnte diskuterte hvorvidt radikalt billigere AI-slutninger ville krympe eller øke de totale ressursene brukt på AI. Vi stoler her på den sekundære oppsummeringen av navngitte kommentarer i stedet for en primær økonomisk studie som måler den samlede effekten, og påstanden om at industriomfattende AI-utgifter øker på grunn av billigere tokens – snarere enn til tross for en separat, urelatert etterspørselsboom – er en omdiskutert tolkning, ikke en avgjort statistikk. Hva pristabellene ovenfor støtter direkte er forutsetningen for argumentet: det samme spørringen som kostet titalls dollar i beregning i 2022 kan koste øre i dag, hos hver leverandør, som er akkurat den typen priskollaps som historisk sett har gått før forbruket har økt i stedet for å falle.
Hva dette betyr for å kjøre AI lokalt i stedet for i skyen
Hver pris i denne artikkelen er en målt kostnad per samtale som faktureres av et selskap som nødvendigvis mottar spørsmålet ditt om å svare på det - det er det et API-kall er. En modell som kjører helt på din egen enhet har ingen per-token-regning etter at du har betalt for den eller lastet den ned én gang, og den har ingenting å sende hvor som helst, fordi det ikke er noe eksternt endepunkt i forespørselsbanen i det hele tatt. Det er ikke en påstand om at modeller på enheten samsvarer med grensenivåene som er priset ovenfor; en modell som er liten nok til å kjøre komfortabelt på en bærbar datamaskin, kommer ikke til å overbevise Fable 5.1 eller gpt-6-astra. Det er en annen handel: en fast kostnad og en fast grense for personvern, i bytte mot den muligheten som passer inn i minnet du faktisk har.
Den avveiningen er ikke abstrakt; det er det samme som en liten, smalt spekter enhetsmodell lager inne i et stykke sikkerhetsprogramvare. FireAI, HisnLabs Mac-brannmur, sender en valgfri lokal modell hvis eneste jobb er å gjennomgå en tilkobling fra en app den ennå ikke har en regel for - en oppgave med et langt mindre omfang enn noe som er priset i tabellene ovenfor, og en der modellen kjører på selve Macen i stedet for å kalle noen av disse APIene. Poenget med å gå gjennom OpenAI, Anthropic og DeepSeeks prishistorie i så mye detalj er ikke å selge det designet; det er for å gjøre handelen konkret: sky-tokens kjøpte mye mer kapasitet for mye mindre penger mellom 2022 og 2026, og til hvert av disse prispunktene betydde bruken av dem fortsatt å sende dataene dine til en annens server for å få svar tilbake.
Hvor FireAI og HisnLabs kommer inn
None of this makes FireAI a cost story — it is a firewall, not a rented model — but the same bet sits underneath its own on-device reviewer: no per-token bill and nothing sent off the Mac, because the review happens locally instead of being shipped to a server.
FireAI er HisnLabs’ eget produkt: en KI-brannmur som kjører direkte på Macen. Den viser hver tilkobling appene dine gjør, i klart språk, og lar deg bestemme hva som forlater Macen din — KI-en kjører lokalt, så trafikken din sendes aldri til oss eller noen andre. HisnLabs’ sikkerhetsforskningsteam er de som holder disse vurderingene pålitelige: de katalogiserer hvilke domener som er vanlig telemetri og hvilke som er en ekte tjeneste, sporer landet og nettverket bak en tilkobling, og trener den lokale modellen (Autopilot-funksjonen) på ekte trafikkmønstre — uten at noe av det forlater Macen din.
Du kan lese om de tekniske valgene bak, eller prøve FireAI i 17 dager, på FireAI, fra HisnLabs.
