En token är ungefär tre fjärdedelar av ett engelskt ord, förklarade OpenAI:s egen prissättningssida redan 2022, direkt efter att ha noterat att en mening med 35 symboler kostar en bråkdel av en cent. Den inramningen överlever knappt kontakten med 2026: de minsta modellerna kostar nu en bråkdel av en bråkdel av en cent per token, den största kostar femtio dollar per miljon utmatade tokens, och tre leverantörer – OpenAI, Anthropic och DeepSeek – har var och en klippt, höjt, delat upp och delat upp sina priser flera gånger om. Varje siffra nedan kommer från en sida vi hämtade: antingen säljarens aktuella prissida eller en ögonblicksbild från Internet Archive av samma sida från det datum som visas. När vi beräknar ett förhållande, citeras båda talen som det är byggt från i samma stycke.
OpenAI, 2022 till 2026
I november 2022 listade OpenAI:s prissida fyra basmodeller, Ada, Babbage, Curie och Davinci, som var och en hade samma pris för varje token oavsett om det var prompt eller utmatning – det fanns ingen input/output uppdelning ännu. Davinci, den mest kapabla av de fyra, kostade $0,02 per 1 000 tokens. OpenAI:s nuvarande avskrivningssida bekräftar oberoende den exakta siffran, $20,00 per miljon tokens, som priset till vilket text-davinci-003 – den specifika modellen byggd på den nivån – fakturerades fram till dess avstängning 2024. Fyra månader senare lanserades GPT-4 till 0,03 $ per 1 000 prompt-tokens och 0,06 $ per 1 000 kompletteringstokens för sin 8K-kontextversion, vilket fördubblades till 0,06 $ och 0,12 $ för 32K-versionen - första gången OpenAI:s offentliga prissättning debiterar mer än utdata-tokens. gpt-3.5-turbo lanserades samma månad till 0,002 $ per 1 000 tokens, återigen utan någon in-/utgångsdelning.
| Modell | Ingång $/1M | Output $/1M | Prissatt från och med | Källa |
|---|---|---|---|---|
| text-davinci-003 | 20,00 USD | 20,00 USD | nov 2022 | arkiverad prissättningssida |
| gpt-3.5-turbo (lansering) | 2,00 USD | 2,00 USD | mars 2023 | arkiverad prissättningssida |
| GPT-4, 8K-kontext (lansering) | 30,00 USD | 60,00 USD | mars 2023 | arkiverad prissättningssida |
| gpt-4o-2024-05-13 (lansering) | 5,00 USD | 15,00 USD | maj 2024 | OpenAI prissättningsdokument |
| o1 (resonemang) | 15,00 USD | 60,00 USD | nuvarande notering | OpenAI prissättningsdokument |
| gpt-4o (aktuellt pris) | 2,50 USD | 10,00 USD | nuvarande | OpenAI prissättningsdokument |
| gpt-6-luna (billigaste ström) | 0,10 USD | 0,50 USD | nuvarande | OpenAI prissättningsdokument |
| gpt-6-astra (nuvarande flaggskepp) | 10,00 USD | 50,00 USD | nuvarande | OpenAI prissättningsdokument |
Två jämförelser, båda byggda endast från raderna ovan: text-davinci-003:s ingångspris på 20,00 USD mot gpt-6-lunas nuvarande 0,10 USD är en minskning på 200 gånger under ungefär fyra år, för OpenAI:s billigaste tillgängliga nivå vid varje tidpunkt. Men GPT-4:s ursprungliga ingångspris på $30,00 mot gpt-6-astras nuvarande $10,00 är bara en 3x minskning för en jämförelse mellan flaggskepp och flaggskepp - den billiga nivån föll mycket snabbare än den dyra. Själva gpt-4o prissattes nedåt efter lanseringen, från $5,00/$15,00 i maj 2024 till $2,50/$10,00 idag, ett enkelt fall av samma modell som blev billigare utan att ändra dess kapacitet alls.
Antropisk, 2023 till 2026
Anthropics tidigaste prislista för utvecklare som vi kunde återställa, en arkiverad PDF från juli 2023, prissatt Claude 2 – lanserad samma månad – till 11,02 USD per miljon input-tokens och 32,68 USD per miljon output-tokens, och noterade att Claude 1 förblev tillgänglig till samma pris. Claude Instant, den billigaste nivån på den tiden, var $1,63 ingång och $5,51 output. I början av 2024, innan Claude 3 skickades, visar en arkiverad ögonblicksbild Claude 2.0 och 2.1 sänkt till 8,00 $/24,00 $ och omedelbart sänkt till 0,80 $/2,40 $ - blygsamma minskningar på den befintliga lineupen. Claude 3, som lanserades i mars 2024, återställde botten av intervallet helt: Haiku kom in på $0,25/$1,25, långt under allt Anthropic hade erbjudit tidigare, medan Sonnet och Opus lanserades på $3,00/$15,00 och $15,00/$75,00. Claude 3.5 Sonnet, tre månader senare, lanserades för exakt samma $3.00/$15.00 som Claude 3 Sonnet — ett fall där priset förblir oförändrat medan själva modellen förbättrades.
| Modell | Ingång $/1M | Output $/1M | Prissatt från och med | Källa |
|---|---|---|---|---|
| Claude 1 / Claude 2 (samma pris) | 11,02 USD | 32,68 USD | juli 2023 | arkiverad prissättning PDF |
| Claude Instant | $1,63 | 5,51 USD | juli 2023 | arkiverad prissättning PDF |
| Claude 2.0 / 2.1 (efter prissänkning) | 8,00 USD | 24,00 USD | februari 2024 | arkiverad prissättning PDF |
| Claude 3 Haiku (lansering) | 0,25 USD | 1,25 USD | mars 2024 | arkiverad API-sida |
| Claude 3 Sonnet (lansering) | 3,00 USD | 15,00 USD | mars 2024 | arkiverad API-sida |
| Claude 3 Opus (lansering) | 15,00 USD | 75,00 USD | mars 2024 | arkiverad API-sida |
| Claude 3.5 Sonnet (lansering) | 3,00 USD | 15,00 USD | juni 2024 | arkiverad prisbild |
| Haiku 4.5 (för närvarande billigast) | 1,00 USD | 5,00 USD | nuvarande | Claude prissättning |
| Sonett 5 (aktuell) | 2,00 USD | 10,00 USD | nuvarande | Claude prissättning |
| Fable 5.1 (nuvarande flaggskepp) | 10,00 USD | 50,00 USD | nuvarande | Claude prissättning |
Här faller inte kurvan helt enkelt. Claude 3 Haiku lanserades för $0,25 ingång i mars 2024; Anthropics nuvarande billigaste modell, Haiku 4.5, kostar 1,00 $ - fyra gånger dyrare per token än den billigaste nivån två år tidigare. Läs ensam, det ser ut som att AI blev dyrare. Läs bredvid resten av den här artikeln, det ser ut som något annat: Anthropic höll sin lägsta nivås pris per token ungefär oförändrat till något stigande samtidigt som den gjorde den nivån mycket mer kapabel, och den lade också till en ny, dyrare flaggskeppsnivå (Fabel 5.1 för $10,00/$50,00) över vad Opus brukade vara toppen av. Uppställningen växte fler nivåer istället för att bara bli jämnt billigare.
DeepSeek och resonemang-prischocken
DeepSeek gick in på denna marknad redan prissatt långt under sina två konkurrenter. I maj 2024 visar dess arkiverade prissättningssida deepseek-chatt, uppbackad av DeepSeek-V2, med en oförändrad $0,14 ingång och $0,28 output - billigare än något OpenAI eller Anthropic erbjöd vid den tiden, innan någon av dem hade skickat en token billigare än $0,25. I december 2024 hade deepseek-chat uppgraderats till DeepSeek-V3, och DeepSeeks prissida introducerade en cache-hit/cache-miss-delning: en arkiverad ögonblicksbild visar standardhastigheten (efter marknadsföring) vid $0,07 cache-hit input, $0,27 cache-miss input och $1,10 input. Sedan, den 20 januari 2025, släppte DeepSeek R1, en resonemangsmodell, till $0,14 cache-hit input, $0,55 cache-miss input och $2,19 output - en arkiverad ögonblicksbild från åtta dagar senare bekräftar det priset, uttryckligen exkluderat från någon kampanjrabatt.
| Modell | Indata $/1M (cacheträff / cachemiss) | Output $/1M | Prissatt från och med | Källa |
|---|---|---|---|---|
| DeepSeek-V2 (deepseek-chatt) | platt $0,14 | 0,28 USD | maj 2024 | arkiverad prissättningssida |
| DeepSeek-V3 (deepseek-chatt, standardpris) | 0,07 USD / 0,27 USD | 1,10 USD | dec 2024 | arkiverad prissättningssida |
| DeepSeek-R1 (deepseek-reasoner, lansering) | 0,14 USD / 0,55 USD | 2,19 USD | jan 2025 | arkiverad prissättningssida |
| deepseek-flash (ström, lågtrafik) | 0,003 USD / 0,15 USD | 0,60 USD | nuvarande | DeepSeek prissättningsdokument |
| deepseek-v4-pro (aktuell, lågtrafik) | 0,022 USD / 0,66 USD | 1,98 USD | nuvarande | DeepSeek prissättningsdokument |
R1:s lansering är den enskilt skarpaste siffran i hela den här artikeln: $2,19 produktion mot OpenAI:s o1, en jämförbar resonemangsmodell, med $60,00 output - ett 27x gap, båda siffrorna från tabellerna ovan. Den jämförelsen är precis vad som gjorde R1 till en berättelse bortom den vanliga utvecklarpubliken i januari 2025. Det är också värt att lägga märke till vad DeepSeeks egna siffror säger om resonemang specifikt: R1:s 2,19 USD utpris är ungefär det dubbla V3:s 1,10 USD, inom samma leverantör, vid samma tidpunkt. Tankekedja lägger inte bara till en kostnadsmultiplikator på API-nivå; DeepSeeks egen dokumentation noterar att en resonemangsmodells utdatatoken inkluderar varje token av dess resonemangsspår, inte bara det slutliga svaret, så en resonemangsfråga bränner mycket fler outputtoken än en direkt, även innan priset per token tillämpas. Och DeepSeeks nuvarande prissättning lägger till en mekanism som ingen annan leverantör använder: högtidsavgifter ungefär fördubblar lågtrafikpriser på samma modell, en form av efterfrågebaserad prissättning närmare elfakturering än en fast prislista.
Mönstret de platta siffrorna döljer
Placera de tre leverantörernas billigaste-tillgängliga-token-figurer på en tidslinje och formen är inte en jämn kurva. OpenAI:s billiga nivå föll från $20,00 (november 2022) mot $0,10 idag, i huvudsak monotont. Anthropics billiga nivå föll hårt en gång, från $1,63 (2023, Claude Instant) till $0,25 (mars 2024, Claude 3 Haiku), och steg sedan tillbaka till $1,00 (nuvarande, Haiku 4,5) när den nivån blev mer kapabel. DeepSeek gick in redan billigt och har stannat där, samtidigt som priset för tid på dagen lagts till. Ingen av de tre leverantörernas kurvor ser ut som varandra, och ingen av dem ser ut som en enkel exponentiell nedgång när du spårar en specifik nivå snarare än "vad den billigaste modellen än heter i år."
Produktionen kostar mer än insatsen, och förhållandet ökade
Vid lanseringen av GPT-4 i mars 2023 kostade produktionen exakt två gånger inmatningen: 60,00 USD mot 30,00 USD. Titta på nuvarande flaggskepps- och mellanklassmodeller för alla tre leverantörerna och förhållandet har breddats: gpt-6-astra är 5x (50,00 USD mot 10,00 USD), Claude 3 Opus lanserades till 5x (75,00 USD mot 15,00 USD) och stannade där genom Haiku 4,5 (5x, 5,00 USD) mot standardpriset för 5,00 USD och 5,00 USD. ungefär 4x ($1,10 mot $0,27 cache-miss). Den vanliga tekniska förklaringen är arkitektonisk snarare än kommersiell: generering av utdatatoken sker en i taget, autoregressivt, medan en prompts inmatningstoken kan bearbetas parallellt i ett enda framåtpass, så en leverantörs faktiska beräkningskostnad per utmatningstoken är högre än per indatatoken, och prissättningen har glidit mot att återspegla den ursprungliga GPT-4-tiden mer exakt över den ursprungliga GPT-4-tiden.
Cache- och batchrabatter
Alla tre leverantörerna rabatterar nu tokens som modellen faktiskt redan har sett. OpenAI:s nuvarande prissättningssida listar gpt-6-astras cachade indata till 1,00 USD mot en standardinmatningshastighet på 10,00 USD, en 10x rabatt för återanvändning av ett identiskt promptprefix och anger separat att dess Batch API behandlar förfrågningar inom ett 24-timmarsfönster till hälften av standardpriset för synkrona modeller. Anthropics nuvarande prissättning visar Fable 5.1:s prompt-cache-läspris på 0,25 $ mot en standardinmatningshastighet på 10,00 $ - 40 gånger billigare - medan en cacheskrivning kostar 12,50 $, en premie över standardpriset på 10,00 $, eftersom att skriva en ny cachepost gör ett riktigt extra arbete första gången. DeepSeeks cache-hit/cache-miss-delning, som beskrivs ovan, är inbyggd i dess basprissättning snarare än erbjuds som en separat funktion: R1:s 0,14 $ cache-hit rate mot dess 0,55 $ cache-miss rate är ungefär en 4x skillnad på varje enskilt samtal, inte bara på förfrågningar som väljer att delta. pipeline att klassificera den ena loggraden efter den andra mot samma instruktioner är ett rent exempel - dessa rabatter ändrar vilken leverantör som är billigast mer än rubrikens pris per token gör.
Jevons paradox: varför billigare tokens ökade de totala utgifterna
År 1865 publicerade ekonomen William Stanley Jevons The Coal Question, med argumentet att Storbritanniens kolförbrukning ökade, inte sjönk, efter att James Watts mer bränsleeffektiva ångmaskin gjorde koldrivet arbete billigare. Som Wikipedias sammanfattning av argumentet uttrycker det, citerar Jevons direkt:
Det är en förvirring av idéer att anta att ekonomisk användning av bränsle är likvärdig med minskad förbrukning. Själva motsatsen är sanningen.
William Stanley Jevons, 1865, as quoted in Wikipedia: Jevons paradox
Argumentet, eftersom det har generaliserats långt bortom kol, är att att göra en resurs mer effektiv att använda sänker dess effektiva pris, och ett lägre pris ökar den efterfrågade kvantiteten med mer än effektivitetsvinsten sparar - så den totala konsumtionen ökar. Enligt samma Wikipedia-sammanfattning åberopades just detta argument brett i början av 2025 kring DeepSeeks billiga R1-modell, där kommentatorer inklusive Microsofts vd Satya Nadella och ekonomen Erik Brynjolfsson citerade diskutera huruvida radikalt billigare AI-inferens skulle krympa eller öka de totala resurserna som spenderas på AI. Vi förlitar oss här på den sekundära sammanfattningen av namngivna kommentarer snarare än en primär ekonomisk studie som mäter den aggregerade effekten, och påståendet att industriomfattande AI-utgifter ökar på grund av billigare tokens – snarare än trots en separat, orelaterade efterfrågeboom – är en omdiskuterad tolkning, inte en fastställd statistik. Vad pristabellerna ovan ger direkt stöd för är förutsättningen för argumentet: samma fråga som kostade tiotals dollar i beräkning 2022 kan kosta cent idag, hos varje leverantör, vilket är precis den typ av priskollaps som historiskt sett har föregått konsumtionen stigande snarare än fallande.
Vad detta betyder för att köra AI lokalt istället för i molnet
Varje pris i den här artikeln är en uppmätt kostnad per samtal som faktureras av ett företag som nödvändigtvis får din uppmaning att svara på det - det är vad ett API-anrop är. En modell som körs helt på din egen enhet har ingen per-token räkning efter att du har betalat för den eller laddat ner den en gång, och den har inget att skicka någonstans, eftersom det inte finns någon fjärrändpunkt i förfrågningsvägen alls. Det är inte ett påstående att modellerna på enheten matchar gränsnivåerna som är prissatta ovan; en modell som är tillräckligt liten för att köras bekvämt på en bärbar dator kommer inte att överträffa Fable 5.1 eller gpt-6-astra. Det är en annan handel: en fast kostnad och en fast integritetsgräns, i utbyte mot vilken förmåga som helst som passar i minnet du faktiskt har.
Den avvägningen är inte abstrakt; det är samma som en liten, snävt omfattning på enhetsmodell gör inuti en säkerhetsprogramvara. FireAI, HisnLabs Mac-brandvägg, levererar en valfri lokal modell vars enda jobb är att granska en anslutning från en app som den ännu inte har en regel för - en uppgift med en mycket mindre omfattning än något som är prissatt i tabellerna ovan, och en där modellen körs på själva Macen istället för att anropa någon av dessa API:er. Poängen med att gå igenom OpenAI, Anthropic och DeepSeeks prishistorik så här detaljerat är inte att sälja den designen; det är för att göra handeln konkret: molntokens köpte mycket mer kapacitet för mycket mindre pengar mellan 2022 och 2026, och till var och en av dessa prispunkter innebar användningen av dem fortfarande att skicka din data till någon annans server för att få ett svar tillbaka.
Var FireAI och HisnLabs kommer in
None of this makes FireAI a cost story — it is a firewall, not a rented model — but the same bet sits underneath its own on-device reviewer: no per-token bill and nothing sent off the Mac, because the review happens locally instead of being shipped to a server.
FireAI är HisnLabs eget verktyg: en AI-brandvägg som körs direkt på din Mac. Den visar varje anslutning dina appar gör, på klarspråk, och låter dig avgöra vad som lämnar din Mac — AI:n körs lokalt, så din trafik skickas aldrig till oss eller någon annan. HisnLabs säkerhetsforskningsteam är de som håller de bedömningarna tillförlitliga: de katalogiserar vilka domäner som är vanlig telemetri och vilka som är en riktig tjänst, spårar land och nätverk bakom en anslutning och tränar den lokala modellen (Autopilot-funktionen) på verkliga trafikmönster — utan att något av det lämnar din Mac.
Du kan läsa om de tekniska besluten bakom, eller prova FireAI i 17 dagar, på FireAI, från HisnLabs.
