Token to mniej więcej trzy czwarte angielskiego słowa, jak wyjaśniono na stronie OpenAI z cenami w 2022 r., zaraz po zauważeniu, że zdanie składające się z 35 tokenów kosztuje ułamek centa. Takie ramy ledwo wytrzymują kontakt z rokiem 2026: najmniejsze modele kosztują obecnie ułamek ułamka centa za token, największe kosztują pięćdziesiąt dolarów za milion tokenów wyjściowych, a trzej dostawcy – OpenAI, Anthropic i DeepSeek – każdy z nich kilkakrotnie obniżył, podniósł, podzielił i ponownie podzielił swoje ceny. Każda liczba poniżej pochodzi ze strony, którą pobraliśmy: albo aktualnej strony z cenami dostawcy, albo migawki z archiwum internetowego tej samej strony z pokazanej daty. Tam, gdzie obliczamy stosunek, obie liczby, z których jest zbudowany, są cytowane w tym samym akapicie.
OpenAI, 2022–2026
W listopadzie 2022 r. na stronie z cenami OpenAI wymieniono cztery modele podstawowe: Ada, Babbage, Curie i Davinci, każdy z nich wyceniony był tak samo dla każdego tokena, niezależnie od tego, czy był to token monitowy, czy wyjściowy – nie było jeszcze podziału wejścia/wyjścia. Davinci, najzdolniejszy z całej czwórki, kosztuje 0,02 dolara za 1000 tokenów. Strona dotycząca aktualnych wycofań OpenAI niezależnie potwierdza tę dokładną kwotę, 20,00 dolarów za milion tokenów, jako cenę, po której naliczano opłatę za Text-davinci-003 – konkretny model zbudowany na tym poziomie – aż do jego zamknięcia w 2024 roku. Cztery miesiące później GPT-4 wprowadzono na rynek w cenie 0,03 dolara za 1000 tokenów podpowiedzi i 0,06 dolara za 1000 tokenów ukończenia w wersji z kontekstem 8 tys., co podwoiło się do 0,06 dolara i 0,12 dolara za wersję 32 tys. — po raz pierwszy publiczna wycena OpenAI naliczała więcej tokenów wyjściowych niż tokenów wejściowych. gpt-3.5-turbo wystartowało w tym samym miesiącu po stałej cenie 0,002 dolara za 1000 tokenów, ponownie bez podziału wejścia/wyjścia.
| Model | Wejście $/1M | Wyjście $/1M | Ceny na dzień | Źródło |
|---|---|---|---|---|
| tekst-davinci-003 | 20,00 dolarów | 20,00 dolarów | listopad 2022 r | zarchiwizowana strona z cenami |
| gpt-3.5-turbo (uruchomienie) | 2,00 USD | 2,00 USD | marzec 2023 | zarchiwizowana strona z cenami |
| Kontekst GPT-4, 8K (uruchomienie) | 30,00 dolarów | 60,00 dolarów | marzec 2023 | zarchiwizowana strona z cenami |
| gpt-4o-2024-05-13 (uruchomienie) | 5,00 dolarów | 15,00 dolarów | Maj 2024 | Dokumentacja cenowa OpenAI |
| o1 (rozumowanie) | 15,00 dolarów | 60,00 dolarów | aktualne zestawienie | Dokumentacja cenowa OpenAI |
| gpt-4o (aktualna cena) | 2,50 dolara | 10,00 dolarów | aktualny | Dokumentacja cenowa OpenAI |
| gpt-6-luna (najtańszy prąd) | 0,10 USD | 0,50 dolara | aktualny | Dokumentacja cenowa OpenAI |
| gpt-6-astra (obecny okręt flagowy) | 10,00 dolarów | 50,00 dolarów | aktualny | Dokumentacja cenowa OpenAI |
Dwa porównania, oba sporządzone wyłącznie na podstawie powyższych wierszy: cena wejściowa Text-davinci-003 wynosząca 20,00 USD w porównaniu z obecną ceną 0,10 USD gpt-6-luna to 200-krotny spadek w ciągu około czterech lat w przypadku najtańszej dostępnej warstwy OpenAI w każdym momencie. Ale pierwotna cena wejściowa GPT-4 wynosząca 30,00 USD w porównaniu z obecną ceną 10,00 USD gpt-6-astra to tylko 3-krotny spadek w porównaniu między okrętami flagowymi — tani poziom spadł znacznie szybciej niż drogi. Sam gpt-4o został przeceniony w dół po wprowadzeniu na rynek, z 5,00 USD/15,00 USD w maju 2024 r. do 2,50 USD/10,00 USD obecnie, co jest prostym przypadkiem, w którym ten sam model staje się tańszy bez jakiejkolwiek zmiany jego możliwości.
Antropiczne, 2023–2026
Najwcześniejszy arkusz cenowy dla programistów Anthropic, jaki udało nam się odzyskać, zarchiwizowany plik PDF z lipca 2023 r., wycenił Claude 2 – wprowadzony na rynek w tym samym miesiącu – na 11,02 USD za milion tokenów wejściowych i 32,68 USD za milion tokenów wyjściowych oraz odnotowano, że Claude 1 pozostaje dostępny w tej samej cenie. Claude Instant, wówczas najtańszy poziom, miał 1,63 dolara na wejściu i 5,51 dolara na wyjściu. Na początku 2024 r., przed dostawą Claude 3, zarchiwizowany zrzut ekranu pokazuje obniżkę wersji Claude 2.0 i 2.1 do 8,00 USD/24,00 USD oraz Instant do 0,80 USD/2,40 USD — niewielkie obniżki w stosunku do istniejącej oferty. Claude 3, wprowadzony na rynek w marcu 2024 r., całkowicie zresetował dolną granicę przedziału: Haiku osiągnęło cenę 0,25 USD/1,25 USD, czyli znacznie poniżej wszystkiego, co oferowała wcześniej Anthropic, podczas gdy Sonnet i Opus wystartowały po cenie 3,00 USD/15,00 USD i 15,00 USD/75,00 USD. Claude 3.5 Sonnet trzy miesiące później został wprowadzony na rynek w dokładnie tych samych cenach 3,00/15,00 dolarów co Claude 3 Sonnet – przypadek utrzymania ceny na niezmienionym poziomie przy jednoczesnym ulepszeniu samego modelu.
| Model | Wejście $/1M | Wyjście $/1M | Ceny na dzień | Źródło |
|---|---|---|---|---|
| Claude 1 / Claude 2 (ta sama cena) | 11,02 dolarów | 32,68 dolarów | lipiec 2023 r | archiwalny cennik w formacie PDF |
| Klaudiusz Natychmiastowy | 1,63 dolara | 5,51 dolarów | lipiec 2023 r | archiwalny cennik w formacie PDF |
| Claude 2.0 / 2.1 (po obniżce ceny) | 8,00 dolarów | 24,00 dolarów | luty 2024 r | archiwalny cennik w formacie PDF |
| Claude 3 Haiku (premiera) | 0,25 dolara | 1,25 dolara | marzec 2024 | zarchiwizowana strona API |
| Claude 3 Sonnet (uruchomienie) | 3,00 dolarów | 15,00 dolarów | marzec 2024 | zarchiwizowana strona API |
| Claude 3 Opus (uruchomienie) | 15,00 dolarów | 75,00 dolarów | marzec 2024 | zarchiwizowana strona API |
| Claude 3.5 Sonnet (uruchomienie) | 3,00 dolarów | 15,00 dolarów | czerwiec 2024 r | archiwalna migawka cenowa |
| Haiku 4.5 (obecnie najtańszy) | 1,00 USD | 5,00 dolarów | aktualny | Ceny Claude’a |
| Sonet 5 (aktualny) | 2,00 USD | 10,00 dolarów | aktualny | Ceny Claude’a |
| Fable 5.1 (obecny okręt flagowy) | 10,00 dolarów | 50,00 dolarów | aktualny | Ceny Claude’a |
Tutaj krzywa nie tylko spada. Claude 3 Haiku wypuszczono na rynek w marcu 2024 r. za 0,25 dolara; Obecny najtańszy model Anthropic, Haiku 4.5, kosztuje 1,00 dolara, czyli jest cztery razy droższy za token niż tania wersja sprzed dwóch lat. Przeczytaj sam, wygląda na to, że sztuczna inteligencja stała się droższa. Czytaj dalej resztę tego artykułu, wygląda to na coś innego: Anthropic utrzymał cenę za token na najniższym poziomie mniej więcej na stałym poziomie lub lekko wzrosła, jednocześnie zwiększając jego możliwości, a także dodał nowy, droższy poziom flagowca (Fable 5.1 na poziomie 10,00/50,00 USD) powyżej poziomu, na którym Opus był kiedyś na szczycie. Oferta powiększyła się o więcej poziomów, zamiast po prostu być jednolicie tańsza.
DeepSeek i szok cenowy
DeepSeek wszedł na ten rynek już z ceną znacznie niższą od swoich dwóch rywali. W maju 2024 r. jego zarchiwizowana strona z cenami pokazuje czat deepseek, wspierany przez DeepSeek-V2, przy stałym wejściu 0,14 USD i wyjściu 0,28 USD – taniej niż cokolwiek oferowanego wówczas przez OpenAI lub Anthropic, zanim którekolwiek z nich dostarczyło token tańszy niż 0,25 USD. Do grudnia 2024 r. usługa deepseek-chat została zaktualizowana do wersji DeepSeek-V3, a na stronie z cenami DeepSeek wprowadzono podział na trafienia w pamięci podręcznej/pominięcia pamięci podręcznej: zarchiwizowany zrzut ekranu pokazuje standardową stawkę (po promocji) przy wartości wejściowej trafienia w pamięci podręcznej wynoszącej 0,07 USD, wejściowej utraconej pamięci podręcznej 0,27 USD i wyjściowej 1,10 USD. Następnie, 20 stycznia 2025 r., firma DeepSeek wypuściła R1, model rozumujący, z danymi wejściowymi dotyczącymi trafień w pamięci podręcznej wynoszącymi 0,14 USD, danymi wejściowymi dotyczącymi braku pamięci podręcznej wynoszącymi 0,55 USD i wynikami wynoszącymi 2,19 USD — zarchiwizowane zdjęcie z ośmiu dni później potwierdza tę cenę, wyraźnie wykluczoną z wszelkich rabatów promocyjnych.
| Model | Wprowadź $/1M (trafienie w pamięci podręcznej / brak pamięci podręcznej) | Wyjście $/1M | Ceny na dzień | Źródło |
|---|---|---|---|---|
| DeepSeek-V2 (czat typu deepseek) | mieszkanie 0,14 dolara | 0,28 USD | Maj 2024 | zarchiwizowana strona z cenami |
| DeepSeek-V3 (czat typu deepseek, stawka standardowa) | 0,07 USD / 0,27 USD | 1,10 dolara | Grudzień 2024 | zarchiwizowana strona z cenami |
| DeepSeek-R1 (głębokie szukanie, uruchomienie) | 0,14 USD / 0,55 USD | 2,19 USD | styczeń 2025 | zarchiwizowana strona z cenami |
| deepseek-flash (prąd, poza szczytem) | 0,003 USD / 0,15 USD | 0,60 USD | aktualny | Dokumentacja cenowa DeepSeek |
| deepseek-v4-pro (prąd, poza szczytem) | 0,022 USD / 0,66 USD | 1,98 USD | aktualny | Dokumentacja cenowa DeepSeek |
Premiera R1 to najostrzejsza liczba w całym artykule: 2,19 USD produkcji w porównaniu z o1 OpenAI, porównywalnym modelem rozumowania, przy 60,00 USD produkcji – 27-krotna różnica, obie wartości z powyższych tabel. To właśnie porównanie sprawiło, że w styczniu 2025 r. R1 stał się historią wykraczającą poza zwykłą publiczność programistów. Warto również zauważyć, co liczby DeepSeek mówią na temat konkretnego rozumowania: cena wyjściowa R1 wynosząca 2,19 USD jest mniej więcej dwukrotnie większa niż 1,10 USD V3 u tego samego dostawcy i w tym samym momencie. Rozumowanie oparte na łańcuchu myślowym nie polega jedynie na dodaniu mnożnika kosztów na poziomie interfejsu API; Z własnej dokumentacji DeepSeek wynika, że liczba tokenów wyjściowych modelu wnioskowującego obejmuje każdy token śladu wnioskowania, a nie tylko ostateczną odpowiedź, zatem zapytanie wnioskowujące zużywa znacznie więcej tokenów wyjściowych niż zapytanie bezpośrednie, nawet przed zastosowaniem ceny za token. Obecne ceny DeepSeek dodają mechanizm, z którego nie korzysta żaden inny dostawca: stawki w godzinach szczytu w przybliżeniu dwukrotnie podwajają stawki poza szczytem w tym samym modelu, co jest formą ustalania cen na podstawie zapotrzebowania, bliższą rozliczeniom za energię elektryczną niż stałemu cennikowi.
Wzór, jaki kryją numery mieszkań
Umieść najtańsze dostępne żetony trzech dostawców na jednej osi czasu, a kształt nie będzie gładką krzywą. Tani poziom OpenAI spadł z 20,00 USD (listopad 2022 r.) do 0,10 USD obecnie, zasadniczo monotonicznie. Tani poziom Anthropic spadł raz mocno, z 1,63 USD (2023, Claude Instant) do 0,25 USD (marzec 2024, Claude 3 Haiku), a następnie wzrósł z powrotem do 1,00 USD (obecnie, Haiku 4,5), gdy ten poziom stał się bardziej wydajny. DeepSeek wszedł już tanio i tam pozostał, dodając na górze ceny według pory dnia. Żadna z krzywych trzech dostawców nie jest do siebie podobna i żadna nie wygląda na prosty wykładniczy spadek po prześledzeniu określonego poziomu, a nie na „jakkolwiek nazywa się najtańszy model w tym roku”.
Produkcja kosztuje więcej niż nakład, a stosunek się zwiększył
W momencie premiery GPT-4 w marcu 2023 r. koszt produkcji wynosił dokładnie dwa razy więcej: 60,00 dolarów w porównaniu z 30,00 dolarów. Spójrz na obecne modele flagowe i średniej klasy wszystkich trzech dostawców, a stosunek się poszerzył: gpt-6-astra wynosi 5x (50,00 USD w porównaniu z 10,00 USD), Claude 3 Opus wypuszczony na rynek z ceną 5x (75,00 USD w porównaniu z 15,00 USD) i pozostał na tym poziomie przez Haiku 4.5 (5x, 5,00 USD w porównaniu z 1,00 USD), a standardowa stawka DeepSeek-V3 wynosi około 4x (1,10 USD w porównaniu z 0,27 USD za brak pamięci podręcznej). Typowe wyjaśnienie techniczne ma charakter architektoniczny, a nie komercyjny: generowanie tokenów wyjściowych odbywa się pojedynczo, w sposób autoregresyjny, podczas gdy tokeny wejściowe podpowiedzi mogą być przetwarzane równolegle w jednym przebiegu do przodu, więc rzeczywisty koszt obliczeniowy dostawcy na token wyjściowy jest wyższy niż na token wejściowy, a ceny z biegiem czasu dryfują w kierunku dokładniejszego odzwierciedlania tej luki niż oryginalny, zaokrąglony podział 2x GPT-4.
Rabaty na pamięć podręczną i partie
Wszyscy trzej dostawcy oferują teraz zniżki na tokeny, które model już widział. Aktualna strona cenowa OpenAI podaje buforowane dane wejściowe gpt-6-astra na poziomie 1,00 USD w porównaniu ze standardową stawką wejściową wynoszącą 10,00 USD, co stanowi 10-krotną zniżkę za ponowne użycie identycznego prefiksu podpowiedzi i osobno stwierdza, że interfejs API Batch przetwarza żądania w ciągu 24 godzin za połowę standardowej ceny synchronicznej dla kwalifikujących się modeli. Obecne ceny Anthropic pokazują, że cena odczytu z pamięci podręcznej Fable 5.1 wynosi 0,25 USD w porównaniu ze standardową stawką wejściową wynoszącą 10,00 USD — 40 razy taniej — podczas gdy zapis w pamięci podręcznej kosztuje 12,50 USD, czyli więcej w porównaniu ze standardową stawką wynoszącą 10,00 USD, ponieważ zapisanie nowego wpisu w pamięci podręcznej za pierwszym razem powoduje naprawdę dodatkową pracę. Opisany powyżej podział trafień w pamięci podręcznej/pominięć pamięci podręcznej DeepSeek jest wbudowany w cenę podstawową, a nie oferowany jako oddzielna funkcja: współczynnik trafień w pamięci podręcznej w przypadku R1 wynoszący 0,14 USD w porównaniu ze współczynnikiem utraty pamięci podręcznej wynoszącym 0,55 USD to mniej więcej czterokrotna różnica przy każdym pojedynczym wywołaniu, a nie tylko w przypadku żądań, które wyraziły na to zgodę. W przypadku każdego obciążenia wymagającego powtarzania długiego monitu systemowego lub stałego zestawu definicji narzędzi w wielu wywołaniach — potok klasyfikacji zabezpieczeń klasyfikujący kolejne wiersze dziennika wbrew tym samym instrukcjom jest to czysty przykład — rabaty te wpływają na to, który sprzedawca jest najtańszy, bardziej niż podstawowa cena za token.
Paradoks Jevonsa: dlaczego tańsze tokeny zwiększyły całkowite wydatki
W 1865 roku ekonomista William Stanley Jevons opublikował „Kwestię węglową”, w której argumentował, że zużycie węgla w Wielkiej Brytanii wzrosło, a nie spadło, po tym, jak bardziej oszczędny silnik parowy Jamesa Watta sprawił, że praca napędzana węglem stała się tańsza. Jak podaje podsumowanie argumentacji w Wikipedii, cytując bezpośrednio Jevonsa:
Zakładanie, że ekonomiczne wykorzystanie paliwa jest równoznaczne ze zmniejszonym zużyciem, jest pomieszaniem pojęć. Prawda jest zupełnie inna.
William Stanley Jevons, 1865, as quoted in Wikipedia: Jevons paradox
Argument, który wykracza daleko poza węgiel, jest taki, że zwiększenie efektywności wykorzystania zasobu obniża jego efektywną cenę, a niższa cena zwiększa ilość popytu o więcej, niż pozwala zaoszczędzić zysk w zakresie efektywności – a więc całkowite zużycie wzrasta. Według tego samego podsumowania Wikipedii dokładny argument był szeroko przywoływany na początku 2025 r. w związku z tanim modelem R1 firmy DeepSeek, a komentatorzy, w tym dyrektor generalny Microsoft Satya Nadella i ekonomista Erik Brynjolfsson, cytowali dyskusję na temat tego, czy radykalnie tańsze wnioskowanie AI zmniejszy, czy zwiększy całkowite zasoby wydawane na sztuczną inteligencję. Opieramy się tutaj na tym wtórnym podsumowaniu nazwanego komentarza, a nie na podstawowym badaniu ekonomicznym mierzącym łączny efekt, a twierdzenie, że wydatki na sztuczną inteligencję w całej branży rosną z powodu tańszych tokenów – a nie pomimo oddzielnego, niepowiązanego boomu popytu – jest przedmiotem dyskusji, a nie ustaloną statystyką. To, co powyższe tabele cen potwierdzają bezpośrednio, jest warunkiem wstępnym argumentu: to samo zapytanie, którego obliczenia kosztują dziesiątki dolarów w 2022 r., może dziś kosztować centy u każdego dostawcy, co jest dokładnie takim rodzajem załamania cen, które w przeszłości poprzedzało wzrost konsumpcji, a nie spadek.
Co to oznacza dla uruchamiania sztucznej inteligencji lokalnie, a nie w chmurze
Każda cena podana w tym artykule to odmierzony koszt połączenia naliczany przez firmę, która koniecznie otrzyma monit o udzielenie odpowiedzi — na tym polega wywołanie API. Model, który działa całkowicie na Twoim własnym urządzeniu, nie jest obciążony żadnym rachunkiem za token po zapłaceniu za niego lub jednokrotnym pobraniu i nie ma on nic do przesłania, ponieważ w ścieżce żądania nie ma żadnego zdalnego punktu końcowego. Nie jest to twierdzenie, że modele na urządzeniu odpowiadają wycenionym powyżej poziomom granicznym; model wystarczająco mały, aby wygodnie działać na laptopie, nie przebije Fable 5.1 ani gpt-6-astra. To inny handel: stały koszt i sztywna granica prywatności w zamian za wszelkie możliwości mieszczące się w faktycznie posiadanej pamięci.
That trade-off is not abstract; jest to ten sam, który mały model instalowany na urządzeniu o wąskim zakresie działania tworzy w oprogramowaniu zabezpieczającym. FireAI, zapora sieciowa HisnLabs dla komputerów Mac, dostarcza opcjonalny model lokalny, którego jedynym zadaniem jest sprawdzanie połączenia z aplikacji, dla której nie ma jeszcze reguły – zadanie o znacznie mniejszym zakresie niż cokolwiek wycenianego w powyższych tabelach i takie, w którym model działa na samym komputerze Mac, a nie wywołuje którykolwiek z tych interfejsów API. Celem tak szczegółowego prześledzenia historii cen OpenAI, Anthropic i DeepSeek nie jest sprzedaż tego projektu; ma to na celu ukonkretnienie handlu: tokeny w chmurze zapewniły znacznie większe możliwości za znacznie mniej pieniędzy w latach 2022–2026, a przy każdym z tych poziomów cenowych używanie ich nadal oznaczało wysyłanie danych na serwer innej osoby w celu uzyskania odpowiedzi.
Jaką rolę odgrywają FireAI i HisnLabs
None of this makes FireAI a cost story — it is a firewall, not a rented model — but the same bet sits underneath its own on-device reviewer: no per-token bill and nothing sent off the Mac, because the review happens locally instead of being shipped to a server.
FireAI to własny produkt HisnLabs: zapora sieciowa z AI działająca bezpośrednio na Macu. Pokazuje prostym językiem każde połączenie nawiązywane przez twoje aplikacje i pozwala ci decydować, co opuszcza twojego Maca — jej AI działa lokalnie, więc twój ruch nigdy nie jest wysyłany do nas ani do nikogo innego. Zespół badań nad bezpieczeństwem HisnLabs dba o to, by te decyzje pozostały trafne: kataloguje, które domeny to zwykła telemetria, a które prawdziwa usługa, śledzi kraj i sieć stojące za połączeniem oraz trenuje lokalny model (funkcję Autopilot) na rzeczywistych wzorcach ruchu — a nic z tego nie opuszcza twojego Maca.
Możesz przeczytać o decyzjach technicznych, które za tym stoją, albo wypróbować FireAI przez 17 dni na FireAI od HisnLabs.
