Ein Token entspricht ungefähr drei Vierteln eines englischen Wortes, erklärte OpenAIs eigene Preisseite bereits 2022, gleich nachdem sie festhielt, dass ein Satz mit 35 Tokens einen Bruchteil eines Cents kostet. Diese Einordnung überlebt den Kontakt mit 2026 kaum: Die kleinsten Modelle kosten heute einen Bruchteil eines Bruchteils eines Cents pro Token, die größten kosten fünfzig Dollar pro Million Output-Tokens, und drei Anbieter — OpenAI, Anthropic und DeepSeek — haben ihre Preise jeweils mehrfach gesenkt, erhöht, aufgeteilt und neu aufgeteilt. Jede Zahl unten stammt von einer Seite, die wir selbst abgerufen haben: entweder der aktuellen Preisseite des Anbieters oder einem Internet-Archive-Schnappschuss derselben Seite vom angegebenen Datum. Wo wir ein Verhältnis berechnen, werden beide zugrunde liegenden Zahlen im selben Absatz genannt.
OpenAI, 2022 bis 2026
Im November 2022 listete OpenAIs Preisseite vier Basismodelle, Ada, Babbage, Curie und Davinci, jedes zum gleichen Preis pro Token, egal ob Prompt oder Output — eine Aufteilung zwischen Input und Output gab es noch nicht. Davinci, das leistungsfähigste der vier, kostete 0,02 $ pro 1.000 Tokens. OpenAIs aktuelle Seite zu abgekündigten Modellen bestätigt unabhängig genau diese Zahl, 20,00 $ pro Million Tokens, als den Preis, zu dem text-davinci-003 — das konkrete, auf dieser Stufe aufgebaute Modell — bis zu seiner Abschaltung 2024 abgerechnet wurde. Vier Monate später startete GPT-4 mit 0,03 $ pro 1.000 Prompt-Tokens und 0,06 $ pro 1.000 Completion-Tokens für seine 8K-Kontext-Version, verdoppelt auf 0,06 $ und 0,12 $ für die 32K-Version — das erste Mal, dass OpenAIs öffentliche Preise Output-Tokens teurer machten als Input-Tokens. gpt-3.5-turbo startete im selben Monat zu einem einheitlichen Preis von 0,002 $ pro 1.000 Tokens, wiederum ohne Aufteilung zwischen Input und Output.
| Modell | Input $/1 Mio. | Output $/1 Mio. | Preisstand | Quelle |
|---|---|---|---|---|
| text-davinci-003 | $20.00 | $20.00 | Nov. 2022 | archivierte Preisseite |
| gpt-3.5-turbo (Start) | $2.00 | $2.00 | März 2023 | archivierte Preisseite |
| GPT-4, 8K-Kontext (Start) | $30.00 | $60.00 | März 2023 | archivierte Preisseite |
| gpt-4o-2024-05-13 (Start) | $5.00 | $15.00 | Mai 2024 | OpenAI-Preisdokumentation |
| o1 (Reasoning) | $15.00 | $60.00 | aktuelle Angabe | OpenAI-Preisdokumentation |
| gpt-4o (aktueller Preis) | $2.50 | $10.00 | aktuell | OpenAI-Preisdokumentation |
| gpt-6-luna (aktuell günstigste) | $0.10 | $0.50 | aktuell | OpenAI-Preisdokumentation |
| gpt-6-astra (aktuelles Flaggschiff) | $10.00 | $50.00 | aktuell | OpenAI-Preisdokumentation |
Zwei Vergleiche, beide ausschließlich aus den obigen Zeilen gebildet: Der Input-Preis von text-davinci-003 mit 20,00 $ gegenüber dem aktuellen Preis von gpt-6-luna mit 0,10 $ ist ein Rückgang um das 200-Fache über rund vier Jahre, jeweils für die günstigste verfügbare Stufe von OpenAI zum jeweiligen Zeitpunkt. Aber GPT-4s ursprünglicher Input-Preis von 30,00 $ gegenüber dem aktuellen Preis von gpt-6-astra mit 10,00 $ ist im Flaggschiff-zu-Flaggschiff-Vergleich nur ein Rückgang um das Dreifache — die günstige Stufe fiel weit schneller als die teure. gpt-4o selbst wurde nach dem Start nach unten korrigiert, von 5,00 $/15,00 $ im Mai 2024 auf heute 2,50 $/10,00 $ — ein einfacher Fall, in dem dasselbe Modell günstiger wurde, ohne seine Fähigkeiten überhaupt zu verändern.
Anthropic, 2023 bis 2026
Das früheste Preisblatt für Entwickler von Anthropic, das wir auffinden konnten, ein archiviertes PDF vom Juli 2023, bepreiste Claude 2 — im selben Monat gestartet — mit 11,02 $ pro Million Input-Tokens und 32,68 $ pro Million Output-Tokens, und vermerkte, dass Claude 1 zum identischen Preis weiter verfügbar blieb. Claude Instant, damals die günstige Stufe, lag bei 1,63 $ Input und 5,51 $ Output. Anfang 2024, vor dem Start von Claude 3, zeigt ein archivierter Schnappschuss Claude 2.0 und 2.1 gesenkt auf 8,00 $/24,00 $ und Instant gesenkt auf 0,80 $/2,40 $ — moderate Senkungen am bestehenden Angebot. Claude 3, gestartet im März 2024, setzte das untere Ende der Preisspanne völlig neu: Haiku kam bei 0,25 $/1,25 $ an, deutlich unter allem, was Anthropic zuvor angeboten hatte, während Sonnet und Opus mit 3,00 $/15,00 $ und 15,00 $/75,00 $ starteten. Claude 3.5 Sonnet, drei Monate später, startete zu genau denselben 3,00 $/15,00 $ wie Claude 3 Sonnet — ein Fall, in dem der Preis gleich blieb, während sich das Modell selbst verbesserte.
| Modell | Input $/1 Mio. | Output $/1 Mio. | Preisstand | Quelle |
|---|---|---|---|---|
| Claude 1 / Claude 2 (gleicher Preis) | $11.02 | $32.68 | Jul. 2023 | archiviertes Preis-PDF |
| Claude Instant | $1.63 | $5.51 | Jul. 2023 | archiviertes Preis-PDF |
| Claude 2.0 / 2.1 (nach Preissenkung) | $8.00 | $24.00 | Feb. 2024 | archiviertes Preis-PDF |
| Claude 3 Haiku (Start) | $0.25 | $1.25 | März 2024 | archivierte API-Seite |
| Claude 3 Sonnet (Start) | $3.00 | $15.00 | März 2024 | archivierte API-Seite |
| Claude 3 Opus (Start) | $15.00 | $75.00 | März 2024 | archivierte API-Seite |
| Claude 3.5 Sonnet (Start) | $3.00 | $15.00 | Jun. 2024 | archivierter Preis-Schnappschuss |
| Haiku 4.5 (aktuell günstigstes) | $1.00 | $5.00 | aktuell | Claude-Preise |
| Sonnet 5 (aktuell) | $2.00 | $10.00 | aktuell | Claude-Preise |
| Fable 5.1 (aktuelles Flaggschiff) | $10.00 | $50.00 | aktuell | Claude-Preise |
Hier fällt die Kurve nicht einfach nur. Claude 3 Haiku startete im März 2024 bei 0,25 $ Input; Anthropics aktuell günstigstes Modell, Haiku 4.5, listet bei 1,00 $ — pro Token viermal teurer als die günstige Stufe zwei Jahre zuvor. Für sich betrachtet sieht das so aus, als sei KI teurer geworden. Im Zusammenhang mit dem Rest dieses Artikels sieht es anders aus: Anthropic hielt den Preis pro Token seiner untersten Stufe ungefähr gleich bis leicht steigend, während es diese Stufe deutlich leistungsfähiger machte, und fügte außerdem eine neue, teurere Flaggschiff-Stufe hinzu (Fable 5.1 zu 10,00 $/50,00 $) oberhalb dessen, was früher die Spitze mit Opus war. Das Angebot wuchs um weitere Stufen, statt sich einfach gleichmäßig zu verbilligen.
DeepSeek und der Preisschock beim Reasoning
DeepSeek trat in diesen Markt bereits mit Preisen weit unter denen seiner beiden Rivalen ein. Im Mai 2024 zeigt die archivierte Preisseite deepseek-chat, gestützt auf DeepSeek-V2, zu einheitlich 0,14 $ Input und 0,28 $ Output — günstiger als alles, was OpenAI oder Anthropic zu dem Zeitpunkt anboten, bevor eines der beiden einen Token unter 0,25 $ ausgeliefert hatte. Bis Dezember 2024 war deepseek-chat an Ort und Stelle auf DeepSeek-V3 hochgestuft worden, und DeepSeeks Preisseite führte eine Aufteilung in Cache-Hit und Cache-Miss ein: Ein archivierter Schnappschuss zeigt den Standardsatz (nach Ablauf der Aktion) bei 0,07 $ Cache-Hit-Input, 0,27 $ Cache-Miss-Input und 1,10 $ Output. Dann veröffentlichte DeepSeek am 20. Januar 2025 R1, ein Reasoning-Modell, zu 0,14 $ Cache-Hit-Input, 0,55 $ Cache-Miss-Input und 2,19 $ Output — ein archivierter Schnappschuss von acht Tage später bestätigt diesen Preis, ausdrücklich von jedem Aktionsrabatt ausgenommen.
| Modell | Input $/1 Mio. (Cache-Hit / Cache-Miss) | Output $/1 Mio. | Preisstand | Quelle |
|---|---|---|---|---|
| DeepSeek-V2 (deepseek-chat) | einheitlich $0.14 | $0.28 | Mai 2024 | archivierte Preisseite |
| DeepSeek-V3 (deepseek-chat, Standardsatz) | $0.07 / $0.27 | $1.10 | Dez. 2024 | archivierte Preisseite |
| DeepSeek-R1 (deepseek-reasoner, Start) | $0.14 / $0.55 | $2.19 | Jan. 2025 | archivierte Preisseite |
| deepseek-flash (aktuell, Nebenzeit) | $0.003 / $0.15 | $0.60 | aktuell | DeepSeek-Preisdokumentation |
| deepseek-v4-pro (aktuell, Nebenzeit) | $0.022 / $0.66 | $1.98 | aktuell | DeepSeek-Preisdokumentation |
Der Start von R1 ist die schärfste Einzelzahl in diesem ganzen Artikel: 2,19 $ Output gegenüber OpenAIs o1, einem vergleichbaren Reasoning-Modell, bei 60,00 $ Output — eine Lücke um das 27-Fache, beide Zahlen aus den obigen Tabellen. Genau dieser Vergleich machte R1 im Januar 2025 zu einer Geschichte, die über das übliche Entwicklerpublikum hinausging. Es lohnt sich auch, festzuhalten, was DeepSeeks eigene Zahlen speziell über Reasoning aussagen: R1s Output-Preis von 2,19 $ ist ungefähr doppelt so hoch wie V3s 1,10 $, innerhalb desselben Anbieters, zum selben Zeitpunkt. Chain-of-Thought-Reasoning fügt nicht nur einen Kostenfaktor auf API-Ebene hinzu; DeepSeeks eigene Dokumentation merkt an, dass die Output-Token-Zahl eines Reasoning-Modells jeden Token seiner Denkspur umfasst, nicht nur die endgültige Antwort, sodass eine Reasoning-Anfrage weit mehr Output-Tokens verbraucht als eine direkte — schon bevor der Preis pro Token angewendet wird. Und DeepSeeks aktuelle Preisgestaltung fügt einen Mechanismus hinzu, den kein anderer Anbieter nutzt: Spitzenzeit-Sätze liegen bei demselben Modell ungefähr doppelt so hoch wie Nebenzeit-Sätze — eine Form nachfragebasierter Preisgestaltung, die eher an eine Stromrechnung erinnert als an eine feste Preisliste.
Das Muster, das die nackten Zahlen verbergen
Trägt man die Zahlen der jeweils günstigsten verfügbaren Tokens aller drei Anbieter auf einer Zeitachse auf, ist die Form keine glatte Kurve. OpenAIs günstige Stufe fiel von 20,00 $ (Nov. 2022) auf heute rund 0,10 $, im Wesentlichen durchgängig fallend. Anthropics günstige Stufe fiel einmal stark, von 1,63 $ (2023, Claude Instant) auf 0,25 $ (März 2024, Claude 3 Haiku), stieg dann wieder auf 1,00 $ (aktuell, Haiku 4.5), während diese Stufe leistungsfähiger wurde. DeepSeek stieg bereits günstig ein und ist dort geblieben, fügte aber zusätzlich eine Preisgestaltung nach Tageszeit hinzu. Keine der drei Anbieterkurven ähnelt der anderen, und keine sieht aus wie ein einfacher exponentieller Rückgang, sobald man eine konkrete Stufe verfolgt, statt „wie auch immer das günstigste Modell dieses Jahr heißt“.
Output kostet mehr als Input — und das Verhältnis wurde größer
Beim Start von GPT-4 im März 2023 kostete Output genau doppelt so viel wie Input: 60,00 $ gegenüber 30,00 $. Betrachtet man aktuelle Flaggschiff- und Mittelklasse-Modelle aller drei Anbieter, hat sich das Verhältnis vergrößert: gpt-6-astra liegt beim Fünffachen (50,00 $ gegenüber 10,00 $), Claude 3 Opus startete beim Fünffachen (75,00 $ gegenüber 15,00 $) und blieb dort bis Haiku 4.5 (Fünffaches, 5,00 $ gegenüber 1,00 $), und DeepSeek-V3s Standardsatz liegt bei ungefähr dem Vierfachen (1,10 $ gegenüber 0,27 $ Cache-Miss). Die übliche technische Erklärung ist eher architektonisch als kommerziell: Output-Tokens entstehen einer nach dem anderen, autoregressiv, während die Input-Tokens eines Prompts in einem einzigen Vorwärtsdurchlauf parallel verarbeitet werden können, sodass die tatsächlichen Rechenkosten eines Anbieters pro Output-Token höher liegen als pro Input-Token — und die Preisgestaltung hat sich im Lauf der Zeit stärker an diese Lücke angenähert, als es GPT-4s ursprüngliche, rundere Aufteilung im Verhältnis zwei zu eins tat.
Rabatte für Cache und Batch
Alle drei Anbieter rabattieren inzwischen Tokens, die das Modell im Grunde bereits gesehen hat. OpenAIs aktuelle Preisseite listet den gecachten Input von gpt-6-astra bei 1,00 $ gegenüber einem Standard-Input-Satz von 10,00 $ — ein Rabatt um das Zehnfache für die Wiederverwendung eines identischen Prompt-Präfixes —, und hält separat fest, dass die Batch-API Anfragen innerhalb eines 24-Stunden-Fensters bei allen berechtigten Modellen zum halben Standard-Synchronpreis verarbeitet. Anthropics aktuelle Preise zeigen den Lesepreis für Prompt-Caching bei Fable 5.1 mit 0,25 $ gegenüber einem Standard-Input-Satz von 10,00 $ — 40-mal günstiger —, während ein Cache-Schreibvorgang 12,50 $ kostet, ein Aufschlag gegenüber dem Standardsatz von 10,00 $, da das Anlegen eines neuen Cache-Eintrags beim ersten Mal echten Zusatzaufwand bedeutet. DeepSeeks Aufteilung in Cache-Hit und Cache-Miss, oben beschrieben, ist fest in die Basispreise eingebaut, statt als separates Feature angeboten zu werden: R1s Cache-Hit-Satz von 0,14 $ gegenüber seinem Cache-Miss-Satz von 0,55 $ ist bei jedem einzelnen Aufruf ein Unterschied um ungefähr das Vierfache, nicht nur bei Anfragen, die das aktiv wählen. Für jede Arbeitslast, die über viele Aufrufe hinweg einen langen System-Prompt oder eine feste Menge von Werkzeugdefinitionen wiederholt — eine Sicherheits-Triage-Pipeline, die eine Logzeile nach der anderen gegen dieselben Anweisungen klassifiziert, ist ein klares Beispiel —, verändern diese Rabatte, welcher Anbieter am günstigsten ist, stärker als der beworbene Preis pro Token.
Das Jevons-Paradoxon: warum billigere Tokens die Gesamtausgaben erhöhten
1865 veröffentlichte der Ökonom William Stanley Jevons The Coal Question und argumentierte, dass Großbritanniens Kohleverbrauch stieg, nicht sank, nachdem James Watts effizientere Dampfmaschine kohlebetriebene Arbeit günstiger gemacht hatte. Wie Wikipedias Zusammenfassung des Arguments es ausdrückt, unter direktem Zitat von Jevons:
Es ist eine Begriffsverwirrung anzunehmen, der sparsame Gebrauch von Brennstoff sei gleichbedeutend mit vermindertem Verbrauch. Das genaue Gegenteil ist die Wahrheit.
William Stanley Jevons, 1865, zitiert in Wikipedia: Jevons-Paradoxon
Das seither weit über Kohle hinaus verallgemeinerte Argument lautet: Macht man die Nutzung einer Ressource effizienter, sinkt ihr effektiver Preis, und ein niedrigerer Preis erhöht die nachgefragte Menge um mehr, als die Effizienzsteigerung einspart — sodass der Gesamtverbrauch steigt. Laut derselben Wikipedia-Zusammenfassung wurde genau dieses Argument Anfang 2025 rund um DeepSeeks günstiges Modell R1 vielfach angeführt, unter anderem mit Kommentatoren wie Microsoft-CEO Satya Nadella und dem Ökonomen Erik Brynjolfsson, die zitiert wurden, während sie diskutierten, ob radikal billigere KI-Inferenz die insgesamt für KI aufgewendeten Ressourcen schrumpfen oder wachsen lassen würde. Wir stützen uns hier auf diese sekundäre Zusammenfassung benannter Kommentare, nicht auf eine primäre ökonomische Studie, die den Gesamteffekt misst, und die Behauptung, branchenweite KI-Ausgaben stiegen wegen billigerer Tokens — statt trotz eines separaten, unabhängigen Nachfrageschubs —, ist eine umstrittene Deutung, keine gesicherte Statistik. Was die Preistabellen oben direkt stützen, ist die Voraussetzung für das Argument: dieselbe Anfrage, die 2022 zig Dollar an Rechenkosten kostete, kann heute bei jedem Anbieter Cent-Beträge kosten — genau die Art von Preisverfall, die historisch eher steigendem als fallendem Verbrauch vorausging.
Was das für den lokalen Betrieb von KI statt in der Cloud bedeutet
Jeder Preis in diesem Artikel ist eine gemessene Kosten pro Aufruf, abgerechnet von einem Unternehmen, das Ihren Prompt zwangsläufig erhält, um ihn zu beantworten — genau das ist ein API-Aufruf. Ein Modell, das vollständig auf Ihrem eigenen Gerät läuft, hat keine Abrechnung pro Token, nachdem Sie es einmal bezahlt oder heruntergeladen haben, und es hat nichts, was es irgendwohin senden müsste, weil im gesamten Anfrageweg gar kein entfernter Endpunkt vorkommt. Das ist keine Behauptung, dass On-Device-Modelle mit den oben bepreisten Spitzenstufen mithalten — ein Modell, das klein genug ist, um bequem auf einem Laptop zu laufen, wird Fable 5.1 oder gpt-6-astra beim Schlussfolgern nicht übertreffen. Es ist ein anderer Kompromiss: feste Kosten und eine feste Datenschutzgrenze, im Austausch für die Fähigkeiten, die in den Speicher passen, den Sie tatsächlich haben.
Dieser Kompromiss ist nicht abstrakt; es ist derselbe, den ein kleines, eng begrenztes On-Device-Modell innerhalb eines Stücks Sicherheitssoftware eingeht. FireAI, die Mac-Firewall von HisnLabs, liefert ein optionales lokales Modell aus, dessen einzige Aufgabe es ist, eine Verbindung von einer App zu prüfen, für die noch keine Regel besteht — eine Aufgabe mit einem weit engeren Umfang als alles, was in den obigen Tabellen bepreist ist, und eine, bei der das Modell auf dem Mac selbst läuft, statt eine dieser APIs aufzurufen. Der Sinn, die Preisgeschichte von OpenAI, Anthropic und DeepSeek in diesem Detailgrad durchzugehen, ist nicht, dieses Design zu verkaufen; er ist, den Kompromiss konkret zu machen: Cloud-Tokens haben zwischen 2022 und 2026 für weit weniger Geld weit mehr Leistung gekauft, und bei jedem einzelnen dieser Preispunkte bedeutete ihre Nutzung trotzdem, die eigenen Daten an den Server von jemand anderem zu senden, um eine Antwort zurückzubekommen.
Wo FireAI und HisnLabs ins Spiel kommen
None of this makes FireAI a cost story — it is a firewall, not a rented model — but the same bet sits underneath its own on-device reviewer: no per-token bill and nothing sent off the Mac, because the review happens locally instead of being shipped to a server.
FireAI ist das eigene Produkt von HisnLabs: eine KI-Firewall für den Mac, die direkt auf dem Gerät läuft. Sie zeigt jede Verbindung Ihrer Apps in verständlicher Sprache und lässt Sie entscheiden, was Ihren Mac verlässt — die KI arbeitet lokal, Ihr Datenverkehr wird also nie an uns oder irgendjemand anderen gesendet. Das Sicherheitsforschungsteam von HisnLabs sorgt dafür, dass diese Entscheidungen verlässlich bleiben: Es katalogisiert, welche Domains gewöhnliche Telemetrie und welche ein echter Dienst sind, verfolgt Land und Netzwerk hinter einer Verbindung und trainiert das lokale Modell (die Autopilot-Funktion) mit echten Verkehrsmustern — ohne dass irgendetwas davon Ihren Mac verlässt.
Die technischen Entscheidungen dahinter können Sie nachlesen — oder FireAI 17 Tage lang ausprobieren — unter FireAI, von HisnLabs.
