Wie berechnen sich KI-Token und API-Kosten?
Große Sprachmodelle (LLMs) rechnen nicht nach Zeichen oder Wörtern ab, sondern in Tokens. Als Faustregel gilt für deutsche und englische Texte: 1 Wort entspricht ungefähr 1,33 Tokens (oder 1.000 Tokens ≈ 750 Wörter).
Input vs. Output Tokens
Generierter Text (Output) ist bei fast allen API-Providern 3- bis 4-mal teurer als der eingehende Prompt-Text (Input).
Small vs. Flagship LLMs
Modelle wie GPT-4o-mini oder Gemini Flash kosten bis zu 95 % weniger als Flagship-Modelle bei oft vergleichbarer Qualität für Standard-Tasks.
Prompt-Caching & RAG
Wiederkehrende System-Prompts oder Dokumentenkontexte können bei modernen APIs durch Caching mit bis zu 50–90 % Rabatt verarbeitet werden.
Modell-Preise & Kostengefüge im Vergleich
Typische Richtpreise der führenden Sprachmodell-Familien pro 1 Million Tokens:
| Modell | Input-Preis (1M Tokens) | Output-Preis (1M Tokens) |
|---|---|---|
| GPT-4o-mini | ca. 0,15 $ | ca. 0,60 $ |
| Gemini 1.5 Flash | ca. 0,075 $ | ca. 0,30 $ |
| Claude 3.5 Sonnet | ca. 3,00 $ | ca. 15,00 $ |
| GPT-4o | ca. 2,50 $ | ca. 10,00 $ |
Architektur-Empfehlung für Produktionsanwendungen
Für kosteneffiziente KI-Pipelines empfiehlt sich ein Zweistufen-Routing: Vorverarbeitung, Klassifizierung und Datenextraktion laufen über günstige Mini-Modelle (z. B. GPT-4o-mini), während anspruchsvolle Analysen oder finale Synthesen an Claude 3.5 Sonnet oder GPT-4o übergeben werden.