Fünf Kurven auf einem Bild, alle fallen. Strom, Lithium-Akkus, Rechenleistung, DNA-Sequenzierung, und dann eine fünfte, die fast senkrecht nach unten geht: der Preis für künstliches Denken. Die Grafik stammt aus einem Bericht des Forschungsinstituts Epoch AI vom 22. September 2026 und wird in sozialen Netzwerken mit Hochrechnungen weitergereicht, die bis zu „eine Billion Mal günstiger in drei Jahren“ reichen. Wir haben den Bericht gelesen, die Zahlen in eigene Grafiken übersetzt und die Frage gestellt, die in fast jedem Erstgespräch fällt: Lohnt es sich, jetzt Geld für KI auszugeben, oder wird es sowieso billiger?
Was misst die Kurve wirklich?
Nicht den Preis der besten KI, sondern den Preis für eine feste Leistung. Die Forscher legen eine Punktzahl auf einem Prüfset fest, etwa drei Viertel richtige Antworten auf Fragen auf Doktorandenniveau, und suchen zu jedem Zeitpunkt das günstigste Modell, das diese Punktzahl schafft. Der Preis dieses Modells je Frage ist der Messwert. Über fünf Prüfsets und drei Jahre fällt er im Mittel um 47 Prozent je Quartal, das ist 13-fach je Jahr.
Ein Beispiel aus dem Bericht: Ein Spitzenmodell vom Januar 2025 brauchte rund 30 Cent je Frage für diese Punktzahl. Ein Modell vom Juli 2026 schafft dieselbe Punktzahl für vier Hundertstel Cent. Faktor 725 in unter 18 Monaten.
Werte als Tabelle
| Technologie | Zeitraum | günstiger je Jahr | gesamt (idealisiert) |
|---|---|---|---|
| Strom | 1892 bis 1973 | 1,05-fach | 52 |
| Lithium-Akkus | 1991 bis 2024 | 1,16-fach | 134 |
| Rechenleistung | 1940 bis 2001 | 1,51-fach | 83 Mrd. |
| DNA-Sequenzierung | 2001 bis 2025 | 1,84-fach | 2,3 Mio. |
| KI-Inferenz | 2021 bis 2026 | 13,00-fach | 371.293 |
Zum Vergleich hat der Bericht historische Preisreihen herangezogen. Der Strompreis für Haushalte fiel über acht Jahrzehnte um etwa fünf Prozent je Jahr, Rechenleistung wurde über sechs Jahrzehnte jedes Jahr etwa anderthalbmal günstiger. KI-Inferenz fällt viermal schneller als DNA-Sequenzierung, sechsmal schneller als Rechenleistung und 54-mal schneller als Strom. Zwei unabhängige Beobachtungen stützen die Größenordnung: Der Stanford AI Index maß für die Leistung eines Chatmodells von Ende 2022 einen Preisrückgang um den Faktor 280 in zwei Jahren. Eine Wagniskapitalgesellschaft schätzte Ende 2024 grob zehnfach je Jahr.
Was die Kurve nicht sagt
Drei Dinge halten die Autoren selbst fest, und in den Kurzvideos fehlen sie.
Die Spitze wird nicht billiger. Gemessen wird der Preis für die Leistung von gestern. Das jeweils beste Modell des Jahres liegt in den öffentlichen Preislisten seit 2023 in derselben Preisklasse. Wer immer das Beste will, zahlt immer den vollen Preis. Was fällt, ist der Preis für das, was vor einem Jahr das Beste war.
Werte als Tabelle
| Leistungsniveau | heute | in einem Jahr | in zwei Jahren |
|---|---|---|---|
| Spitzenleistung von heute | 100 % | 7,7 % | 0,6 % |
| Spitzenleistung in einem Jahr | noch nicht verfügbar | 100 % | 7,7 % |
| Spitzenleistung in zwei Jahren | noch nicht verfügbar | noch nicht verfügbar | 100 % |
Prüfsets sind nicht Ihre Arbeit. Eine Mathematikaufgabe mit eindeutiger Lösung lässt sich messen, das Beantworten einer Kundenmail mit drei Anhängen nicht. Die Autoren schreiben selbst, dass ihre Messgröße ein unvollkommener Stellvertreter für nützliche Arbeit ist. Und praktisch niemand wechselt jeden Monat zum günstigsten Modell, das gerade noch reicht. Der volle Preisvorteil aus der Kurve kommt deshalb bei kaum einem Betrieb an.
Drei Jahre Daten tragen keine Hochrechnung über drei weitere. Die Kurve zeigt eine Steigung, keine Zukunft. Ob sie sich abflacht oder steil bleibt, sagt der Bericht ausdrücklich nicht. „Eine Billion Mal günstiger in drei Jahren“ ist eine Multiplikation, kein Messwert. Für die Planung eines Betriebs genügt eine schwächere und belastbarere Aussage: Was heute knapp zu teuer ist, ist in einem Jahr sehr wahrscheinlich bezahlbar.
Warum Ihre Rechnung trotzdem steigt
Fallende Preise je Aufgabe und steigende Gesamtausgaben widersprechen sich nicht. Die Marktforscher von Gartner erwarten für 2026 weltweit fast 50 Prozent mehr Ausgaben für KI als im Vorjahr, für generative Modelle mehr als eine Verdopplung. Eine Recherche des australischen Rundfunks vom August 2026 beschreibt den Mechanismus: Der Token-Preis fiel innerhalb von gut einem Jahr auf etwa ein Hundertstel, die Rechnungen der Unternehmen stiegen. Weil mehr Aufgaben automatisiert werden, weil die Aufgaben komplexer werden und weil für Spezialarbeit das Spitzenmodell gewählt wird.
Der Preis je Aufgabe ist die einzige der drei Stellschrauben, die sich von allein in Ihre Richtung dreht. Die anderen beiden stellen Sie.
Drei Regeln, nach denen wir planen
Wir betreiben KI im eigenen Haus, bei europäischen Anbietern und über Spitzenmodelle, und wir bauen sie für Kunden. Aus dem Preisverfall haben wir drei Regeln abgeleitet, die in jeder Planung stehen.
Regel 1: Rechnen Sie mit der Aufgabe, nicht mit dem Preis. Eine Aufgabenliste mit drei Spalten: heute wirtschaftlich, in einem Jahr, in zwei Jahren. Jede Aufgabe bekommt die Spalte, in der sie sich zum erwarteten Preis rechnet. Bei uns stehen in der ersten Spalte Prüfläufe, die jede Nacht über Produktdaten laufen und zum Preisniveau von 2024 nicht bezahlbar gewesen wären. In der dritten Spalte steht, was heute noch das Spitzenmodell braucht und deshalb wartet. Die Liste wird einmal im Jahr nach links verschoben, nicht neu erfunden.
Regel 2: Kaufen Sie Rechenleistung nicht auf Vorrat. Ein Server wird über drei bis fünf Jahre abgeschrieben. Der Preis für dieselbe Leistung aus dem Netz fällt in dieser Zeit um mehrere Größenordnungen. Eigene Hardware gewinnt deshalb nur dort, wo der Preis nicht das Argument ist: bei Daten, die das Haus nicht verlassen dürfen, bei Sprache-zu-Text und bei gleichmäßiger Dauerlast. Wie wir das aufteilen, steht im Beitrag über lokale KI im Betrieb. Alles andere wird je Anfrage abgerechnet, damit der Preisverfall bei Ihnen ankommt und nicht beim Abschreibungsplan.
Regel 3: Steuern Sie über die Modellklasse, nicht über den Token-Preis. Die Preisliste eines Anbieters spannt zwischen kleinstem und größtem Modell etwa den Faktor zehn. Deshalb bekommt bei uns jede Aufgabenklasse eine Modellklasse: Das teuerste Modell prüft Ergebnisse, bei denen ein Fehler teuer wäre, die Fleißarbeit erledigen mittlere und kleine Modelle. Ein Budgetdeckel je Aufgabe verhindert, dass ein Agent in einer Schleife die Monatsrechnung eines Menschen verbraucht. Nach jeder neuen Modellgeneration wird die Zuordnung neu gemessen, weil das Modell von gestern morgen in die günstigere Klasse rutscht.
Für Sie heißt das
Für Sie heißt das: Die Frage „jetzt oder später“ ist falsch gestellt. Was Sie heute lernen, gilt nächstes Jahr für ein Vielfaches der Aufgabenmenge zum gleichen Geld. Wer wartet, bis es billiger ist, wartet auf eine Leistung, die dann schon wieder Vorjahresstand ist. Fangen Sie mit den Aufgaben an, die sich heute rechnen, und schreiben Sie die anderen in die zweite und dritte Spalte.
Der nächste Schritt ist eine Stunde mit Ihrer Aufgabenliste: Welche Aufgaben laufen bereits, welche warten auf den Preis, welche auf die Vertraulichkeitsregel. Danach ist die KI-Rechnung eine Planung und keine Überraschung.
Quellen
- Epoch AI: Luke Emberson und David Roodman, „The plunging price of thought“, 22. September 2026, Lizenz CC BY 4.0: epoch.ai/publications/the-plunging-price-of-thought
- Stanford HAI, AI Index Report 2025, Kapitel Research and Development: hai.stanford.edu/ai-index/2025-ai-index-report
- Andreessen Horowitz, „Welcome to LLMflation“, 12. November 2024: a16z.com/llmflation-llm-inference-cost
- Gartner, Pressemitteilung vom 16. September 2026 zu den weltweiten KI-Ausgaben 2026: gartner.com/en/newsroom
- ABC News (Australien), „AI costs are rising for Australian businesses even as tokens get cheaper“, 24. August 2026: abc.net.au/news
Veröffentlicht am 25. September 2026.