Токен — це приблизно три чверті англійського слова, пояснила власна сторінка цін OpenAI ще в 2022 році, відразу після того, як було зазначено, що речення з 35 токенами коштує частки цента. Цей фреймінг ледве переживає контакт із 2026 роком: найменші моделі зараз коштують частки цента за токен, найбільші коштують п’ятдесят доларів за мільйон вихідних токенів, а три постачальники — OpenAI, Anthropic і DeepSeek — кожен знизив, підняв, розділив і повторно розділив свої ціни в кілька разів. Усі цифри, наведені нижче, взяті зі сторінки, яку ми отримали: або сторінка поточної ціни постачальника, або знімок Інтернет-архіву тієї самої сторінки за вказану дату. Там, де ми обчислюємо співвідношення, обидва числа, з яких воно будується, цитуються в одному абзаці.
OpenAI, 2022-2026
У листопаді 2022 року на сторінці цін OpenAI було зазначено чотири базові моделі: Ada, Babbage, Curie і Davinci, кожна з яких мала однакову ціну за кожен токен, незалежно від того, був він швидким чи вихідним — ще не було розподілу введення/виведення. Davinci, найпотужніший із чотирьох, коштує 0,02 долара за 1000 токенів. Поточна сторінка припинення підтримки OpenAI незалежно підтверджує цю точну цифру, 20,00 доларів США за мільйон токенів, як ціну, за якою text-davinci-003 — конкретна модель, побудована на цьому рівні — виставлялася до її припинення роботи в 2024 році. Чотири місяці потому GPT-4 був запущений за ціною 0,03 долара за 1000 токенів підказок і 0,06 долара за 1000 токенів завершення для версії з 8K-контекстом, подвоївшись до 0,06 і 0,12 долара для версії 32K — це перший раз, коли публічне ціноутворення OpenAI стягувало вихідні токени більше, ніж вхідні токени. gpt-3.5-turbo було запущено того ж місяця за фіксованою ціною 0,002 дол. США за 1000 токенів, знову ж таки без розподілу вхідних/вихідних даних.
| Модель | Введіть $/1 млн | Вихід $/1 млн | Ціна станом на | Джерело |
|---|---|---|---|---|
| text-davinci-003 | 20,00 доларів США | 20,00 доларів США | Листопад 2022 | заархівована сторінка цін |
| gpt-3.5-turbo (запуск) | $2,00 | $2,00 | Березень 2023 р | заархівована сторінка цін |
| GPT-4, контекст 8K (запуск) | 30,00 доларів США | 60,00 доларів США | Березень 2023 р | заархівована сторінка цін |
| gpt-4o-2024-05-13 (запуск) | 5,00 доларів США | 15,00 доларів США | травень 2024 р | Документи щодо цін OpenAI |
| o1 (міркування) | 15,00 доларів США | 60,00 доларів США | поточний список | Документи щодо цін OpenAI |
| gpt-4o (поточна ціна) | 2,50 доларів США | 10,00 доларів США | поточний | Документи щодо цін OpenAI |
| gpt-6-luna (найдешевший струм) | 0,10 доларів США | 0,50 доларів США | поточний | Документи щодо цін OpenAI |
| gpt-6-astra (поточний флагман) | 10,00 доларів США | 50,00 доларів США | поточний | Документи щодо цін OpenAI |
Два порівняння, обидва побудовані лише на основі наведених вище рядків: вхідна ціна text-davinci-003 у розмірі 20,00 доларів проти поточних 0,10 доларів у gpt-6-luna є падінням у 200 разів за приблизно чотири роки для найдешевшого доступного рівня OpenAI у кожен момент часу. Але вихідна ціна GPT-4 у розмірі 30,00 доларів США проти поточних 10,00 доларів США для gpt-6-astra є лише втричі меншою для порівняння флагманів із флагманами — дешевий рівень падав набагато швидше, ніж дорогий. Сама gpt-4o була знижена після запуску з $5,00/$15,00 у травні 2024 року до $2,50/$10,00 сьогодні, тобто та сама модель подешевшала без жодних змін у своїх можливостях.
Антропік, 2023-2026
Найперша таблиця цін для розробників Anthropic, яку ми змогли відновити, архівний PDF-файл від липня 2023 року, вказує на ціну Claude 2, запущеного того ж місяця, у 11,02 доларів США за мільйон вхідних токенів і 32,68 доларів США за мільйон вихідних токенів, і зазначається, що Claude 1 залишається доступним за тією самою ціною. Claude Instant, дешевий рівень на той час, становив $1,63 на вхід і $5,51 на вихід. На початку 2024 року, до надходження Claude 3, заархівований знімок показує, що Claude 2.0 і 2.1 скоротили до $8,00/$24,00, а Instant — до $0,80/$2,40 — незначне зниження наявної лінійки. Claude 3, запущений у березні 2024 року, повністю скинув нижню частину діапазону: Haiku коштував $0,25/$1,25, що значно нижче, ніж раніше пропонував Anthropic, тоді як Sonnet і Opus були запущені за $3,00/$15,00 і $15,00/$75,00. Через три місяці Claude 3.5 Sonnet було запущено за ціною тих самих $3,00/$15,00, що й Claude 3 Sonnet — ціна залишилася незмінною, а сама модель покращилася.
| Модель | Введіть $/1 млн | Вихід $/1 млн | Ціна станом на | Джерело |
|---|---|---|---|---|
| Claude 1 / Claude 2 (та сама ціна) | 11,02 доларів США | 32,68 доларів США | липень 2023 р | заархівовані ціни у форматі PDF |
| Клод Інстант | 1,63 долара США | 5,51 долара США | липень 2023 р | заархівовані ціни у форматі PDF |
| Claude 2.0 / 2.1 (після зниження ціни) | 8,00 доларів США | $24,00 | лютий 2024 р | заархівовані ціни у форматі PDF |
| Claude 3 Haiku (запуск) | 0,25 долара США | 1,25 долара США | Березень 2024 р | заархівована сторінка API |
| Клод 3 Сонет (запуск) | 3,00 доларів США | 15,00 доларів США | Березень 2024 р | заархівована сторінка API |
| Claude 3 Opus (запуск) | 15,00 доларів США | 75,00 доларів США | Березень 2024 р | заархівована сторінка API |
| Клод 3.5 Сонет (запуск) | 3,00 доларів США | 15,00 доларів США | Червень 2024 р | заархівований знімок цін |
| Haiku 4.5 (найдешевший на даний момент) | $1,00 | 5,00 доларів США | поточний | Ціни Клода |
| Сонет 5 (сучасний) | $2,00 | 10,00 доларів США | поточний | Ціни Клода |
| Fable 5.1 (поточний флагман) | 10,00 доларів США | 50,00 доларів США | поточний | Ціни Клода |
Тут крива не просто падає. Claude 3 Haiku випущено за $0,25 у березні 2024 року; Поточна найдешевша модель Anthropic, Haiku 4.5, коштує 1,00 долар, що в чотири рази дорожче за токен, ніж дешевий рівень двох років тому. Читаючи лишень, схоже, що ШІ став дорожчим. Прочитайте поряд із рештою цієї статті, схоже на щось інше: Anthropic зберіг ціну за токен свого найнижчого рівня приблизно незмінною або трохи підвищившись, одночасно зробивши цей рівень набагато більш потужним, а також додав новий, дорожчий флагманський рівень (Fable 5.1 на $10,00/$50,00) вище, ніж Opus був найвищим. Модельний ряд збільшився на більше рівнів, а не просто став дешевшим.
DeepSeek і розумний ціновий шок
DeepSeek вийшов на цей ринок вже за ціною, значно нижчою за своїх двох конкурентів. У травні 2024 року на його архівній сторінці з цінами показано deepseek-чат, підтриманий DeepSeek-V2, з рівним входом 0,14 долара та виходом 0,28 долара — дешевше, ніж будь-що, пропоноване на той час OpenAI або Anthropic, до того, як будь-який з них відправив токен дешевше 0,25 долара. До грудня 2024 року deepseek-chat було оновлено до DeepSeek-V3, а на сторінці цін DeepSeek було введено розділення кеш-попадань/кеш-пропусків: заархівований знімок показує стандартну (після просування) ставку за 0,07 дол. США за кеш-попадання, 0,27 дол. США за кеш-промахи та 1,10 дол. Потім, 20 січня 2025 року, DeepSeek випустив R1, модель міркування, з 0,14 дол. США за введення в кеш-пам’ять, 0,55 дол. США за введення в кеші та вихід 2,19 дол.
| Модель | Введення $/1 млн. (звернення до кешу/пропуск кешу) | Вихід $/1 млн | Ціна станом на | Джерело |
|---|---|---|---|---|
| DeepSeek-V2 (deepseek-чат) | рівно 0,14 дол | 0,28 долара США | травень 2024 р | заархівована сторінка цін |
| DeepSeek-V3 (deepseek-чат, стандартна ставка) | 0,07 $ / 0,27 $ | $1,10 | грудень 2024 р | заархівована сторінка цін |
| DeepSeek-R1 (deepseek-reasoner, запуск) | 0,14 $ / 0,55 $ | 2,19 доларів США | Січень 2025 | заархівована сторінка цін |
| deepseek-flash (поточний, непіковий) | $0,003 / $0,15 | 0,60 доларів США | поточний | Документи щодо цін DeepSeek |
| deepseek-v4-pro (поточний, непіковий) | 0,022 $ / 0,66 $ | 1,98 доларів США | поточний | Документи щодо цін DeepSeek |
Запуск R1 є єдиним найяскравішим числом у всій цій статті: вихід $2,19 проти o1 OpenAI, порівнянної моделі міркувань, при випуску $60,00 — розрив у 27 разів, обидва показники з таблиці вище. Це порівняння саме те, що зробило R1 історією за межами звичайної аудиторії розробників у січні 2025 року. Варто також звернути увагу на те, що говорять власні цифри DeepSeek про міркування конкретно: вихідна ціна R1 у 2,19 долара США приблизно вдвічі перевищує 1,10 долара V3 у того самого постачальника в той самий момент часу. Аргументація за ланцюгом думок не просто додає мультиплікатор вартості на рівні API; У власній документації DeepSeek зазначається, що підрахунок вихідних токенів моделі аргументації включає кожен маркер її трасування міркувань, а не лише остаточну відповідь, тому запит на міркування спалює набагато більше вихідних маркерів, ніж прямий, навіть до застосування ціни за маркер. А поточне ціноутворення DeepSeek додає механізм, який не використовує жоден інший постачальник: ставки в годину пік приблизно вдвічі перевищують ставки в непіковий період для тієї самої моделі, форма ціноутворення на основі попиту ближче до виставлення рахунків за електроенергію, ніж до фіксованого прейскуранта.
Візерунок, який приховують квартири
Помістіть цифри трьох найдешевших доступних жетонів трьох постачальників на одну часову шкалу, і форма не буде гладкою кривою. Сьогодні дешевий рівень OpenAI знизився з 20,00 доларів (листопад 2022 року) до 0,10 доларів США, по суті, монотонно. Дешевий рівень Anthropic сильно впав одного разу, з $1,63 (2023, Claude Instant) до $0,25 (березень 2024, Claude 3 Haiku), а потім знову піднявся до $1,00 (поточний, Haiku 4.5), оскільки цей рівень став більш ефективним. DeepSeek увійшов уже дешево і залишився там, додавши зверху ціни за часом доби. Жодна з кривих трьох постачальників не схожа одна на одну, і жодна з них не схожа на просте експоненціальне падіння, коли ви відстежуєте певний рівень, а не «як би не називалася найдешевша модель цього року».
Вихід коштує більше, ніж вхідний, і співвідношення розширилося
Під час запуску GPT-4 у березні 2023 року вихідні дані коштували рівно удвічі, ніж вихідні: 60,00 доларів США проти 30,00 доларів США. Подивіться на поточні флагманські моделі та моделі середнього рівня в усіх трьох постачальників, і співвідношення розширилося: gpt-6-astra становить 5x (50,00 $ проти 10,00 $), Claude 3 Opus був запущений на 5-кратному рівні (75,00 $ проти 15,00 $) і залишився там до Haiku 4.5 (5x, 5,00 $ проти 1,00 $), і Стандартна ставка DeepSeek-V3 становить приблизно 4x ($1,10 проти $0,27 кеш-промаху). Звичайне технічне пояснення є радше архітектурним, ніж комерційним: вихідні маркери генеруються по одному, авторегресійно, тоді як вхідні маркери підказки можуть оброблятися паралельно в одному прямому проході, тому фактичні обчислювальні витрати постачальника на один вихідний маркер є вищими, ніж на один вхідний маркер, і ціноутворення з часом точніше відображає цей розрив, ніж оригінальний GPT-4, кругліше 2x розкол зробив.
Знижки на кеш і пакети
Усі три постачальники тепер дисконтують жетони, які модель фактично вже бачила. На поточній сторінці цін OpenAI кешований вхід gpt-6-astra становить 1,00 дол. США проти стандартної ставки введення в 10,00 дол. США, 10-кратна знижка за повторне використання ідентичного префікса підказки, а також окремо зазначено, що пакетний API обробляє запити протягом 24-годинного вікна за половиною стандартної синхронної ціни для відповідних моделей. Поточна ціна Anthropic показує, що ціна швидкого кешування Fable 5.1 на зчитування становить 0,25 доларів США проти стандартної швидкості введення в 10,00 доларів США — у 40 разів дешевше — тоді як запис у кеш коштує 12,50 доларів США, що є надбавкою за стандартну ставку в 10,00 доларів США, оскільки створення нового запису кешу виконує справжню додаткову роботу з першого разу. Розподіл кешу/пропуску кешу DeepSeek, описаний вище, вбудовано в його базову ціну, а не пропонується як окрема функція: коефіцієнт звернення до кешу R1 у розмірі 0,14 дол. США проти 0,55 дол. США — це приблизно 4-кратна різниця для кожного окремого виклику, а не лише для запитів, які підтримуються. Для будь-якого робочого навантаження, яке повторює довгу системну підказку або фіксований набір визначень інструментів у багатьох дзвінки — чітким прикладом є конвеєр сортування безпеки, який класифікує один рядок журналу за одним за однаковими інструкціями — ці знижки змінюють найдешевшого постачальника більше, ніж заголовна ціна за токен.
Парадокс Джевонса: чому дешевші токени підвищили загальні витрати
У 1865 році економіст Вільям Стенлі Джевонс опублікував The Coal Question, стверджуючи, що споживання вугілля у Великобританії зросло, а не впало після того, як більш економічний паровий двигун Джеймса Ватта здешевив працю, що працює на вугіллі. Як сказано у короткому викладі аргументу у Вікіпедії, прямо цитуючи Джевонса:
Припускати, що економне використання палива еквівалентно зменшеному споживанню, є плутаниною. Якраз навпаки.
William Stanley Jevons, 1865, as quoted in Wikipedia: Jevons paradox
Аргумент, узагальнений далеко за межі вугілля, полягає в тому, що підвищення ефективності використання ресурсу знижує його реальну ціну, а нижча ціна збільшує попит на кількість більше, ніж економить приріст ефективності, тому загальне споживання зростає. Згідно з тим самим підсумком у Вікіпедії, саме цей аргумент широко використовувався на початку 2025 року щодо дешевої моделі R1 від DeepSeek, і коментатори, зокрема генеральний директор Microsoft Сатья Наделла та економіст Ерік Бриньольфссон, цитували обговорення того, чи радикально дешевший висновок ШІ зменшить або збільшить загальні ресурси, витрачені на ШІ. Тут ми покладаємося на цей вторинний підсумок названого коментаря, а не на первинне економічне дослідження, яке вимірює сукупний ефект, і твердження про те, що витрати на штучний інтелект у всій галузі зростають через дешевші токени — а не всупереч окремому, непов’язаному буму попиту — є дискусійною інтерпретацією, а не усталеною статистикою. Те, що наведені вище таблиці цін безпосередньо підтверджують, є передумовою для аргументу: той самий запит, який коштував десятки доларів на обчислення у 2022 році, сьогодні може коштувати центи у кожного постачальника, що є саме таким обвалом цін, який історично передував зростанню споживання, а не падінню.
Що це означає для запуску ШІ локально, а не в хмарі
Кожна ціна в цій статті є виміряною ціною за дзвінок, виставленою компанією, яка обов’язково отримує ваш запит, щоб відповісти на нього — це те, що таке виклик API. Модель, яка повністю працює на вашому власному пристрої, не має рахунку за токен після того, як ви заплатили за неї або завантажили її один раз, і їй нема чого кудись надсилати, оскільки в шляху запиту взагалі немає віддаленої кінцевої точки. Це не твердження, що моделі на пристрої відповідають граничним рівням, зазначеним вище; модель, достатньо мала для комфортної роботи на ноутбуці, не перевершить Fable 5.1 або gpt-6-astra. Це інша торгівля: фіксована вартість і тверді межі конфіденційності в обмін на будь-яку можливість, яка вписується в пам’ять, яку ви фактично маєте.
Цей компроміс не є абстрактним; це те саме, що маленька, вузька модель на пристрої створює всередині частини програмного забезпечення безпеки. FireAI, брандмауер HisnLabs для Mac, постачає додаткову локальну модель, єдиним завданням якої є перевірка з’єднання з додатком, для якого ще немає правила — завдання з набагато меншим обсягом, ніж будь-яке, вказане в таблицях вище, і таке, де модель працює на самому Mac, а не викликає будь-який із цих API. Сенс так детально ознайомитися з історією цін OpenAI, Anthropic і DeepSeek полягає не в тому, щоб продати цей дизайн; це зробити торгівлю конкретною: хмарні токени придбали набагато більше можливостей за значно менші гроші в період між 2022 і 2026 роками, і за кожною з цих цінових категорій їх використання все ще означало надсилання ваших даних на чийсь сервер, щоб отримати відповідь.
Яке місце тут посідають FireAI та HisnLabs
None of this makes FireAI a cost story — it is a firewall, not a rented model — but the same bet sits underneath its own on-device reviewer: no per-token bill and nothing sent off the Mac, because the review happens locally instead of being shipped to a server.
FireAI — це власний продукт HisnLabs: ШІ-фаєрвол, який працює безпосередньо на вашому Mac. Він показує простою мовою кожне з’єднання, яке встановлюють ваші застосунки, і дає вам вирішувати, що покидає ваш Mac, — його ШІ працює локально, тож ваш трафік ніколи не надсилається ні нам, ні будь-кому іншому. Команда дослідників безпеки HisnLabs — саме вона підтримує точність цих рішень: каталогізує, які домени є звичайною телеметрією, а які — справжнім сервісом, відстежує країну та мережу за з’єднанням і навчає локальну модель (функцію Autopilot) на реальних шаблонах трафіку — і нічого з цього не покидає ваш Mac.
Ви можете почитати про технічні рішення, що лежать в його основі, або спробувати FireAI протягом 17 днів на сторінці FireAI від HisnLabs.
