KALKULERO.
Alle Tools
← Alle RechnerTech & Dev

KI-Prompt-Token & API-Kosten Rechner

Kalkuliere deinen exakten Token-Verbrauch für Input/Output und vergleiche die monatlichen API-Kosten führender Sprachmodelle.

Wörter

≈ 532 Input-Tokens / Request

Wörter

≈ 399 Output-Tokens / Request

Calls

Monatliches Anfrage-Volumen

RAG-Kontext oder System-Prompt inkludieren?+ 500 Wörter statischer Kontext pro Anfrage
LLM ModellProviderInput / Output ($/1M)Kosten / 1k CallsMonatliche Gesamtkosten
GPT-4o-mini Tipp: Budget OpenAI $0.15 / $0.60,29 €7,34 €
Gemini 1.5 Flash Tipp: Budget Google Cloud $0.075 / $0.30,15 €3,67 €
Claude 3.5 Sonnet Anthropic $3 / $156,97 €174,36 €
GPT-4o (Flagship) OpenAI $2.5 / $104,89 €122,36 €
Llama 3.1 70B (DeepInfra / Groq) Open Source API $0.5 / $0.750,52 €13,00 €
Monatlicher Token-Durchsatz

23,28 Mio. Tokens / Monat

(13.3 Mio. Input + 9.98 Mio. Output)

💡 Sparpotenzial: Small-Modelle wie GPT-4o-mini oder Flash
senken die monatlichen API-Kosten um bis zu 95 % gegenüber Flagship-Modellen.

Wie berechnen sich KI-Token und API-Kosten?

Große Sprachmodelle (LLMs) rechnen nicht nach Zeichen oder Wörtern ab, sondern in Tokens. Als Faustregel gilt für deutsche und englische Texte: 1 Wort entspricht ungefähr 1,33 Tokens (oder 1.000 Tokens ≈ 750 Wörter).

Input vs. Output Tokens

Generierter Text (Output) ist bei fast allen API-Providern 3- bis 4-mal teurer als der eingehende Prompt-Text (Input).

Small vs. Flagship LLMs

Modelle wie GPT-4o-mini oder Gemini Flash kosten bis zu 95 % weniger als Flagship-Modelle bei oft vergleichbarer Qualität für Standard-Tasks.

Prompt-Caching & RAG

Wiederkehrende System-Prompts oder Dokumentenkontexte können bei modernen APIs durch Caching mit bis zu 50–90 % Rabatt verarbeitet werden.

Modell-Preise & Kostengefüge im Vergleich

Typische Richtpreise der führenden Sprachmodell-Familien pro 1 Million Tokens:

ModellInput-Preis (1M Tokens)Output-Preis (1M Tokens)
GPT-4o-minica. 0,15 $ca. 0,60 $
Gemini 1.5 Flashca. 0,075 $ca. 0,30 $
Claude 3.5 Sonnetca. 3,00 $ca. 15,00 $
GPT-4oca. 2,50 $ca. 10,00 $

Architektur-Empfehlung für Produktionsanwendungen

Für kosteneffiziente KI-Pipelines empfiehlt sich ein Zweistufen-Routing: Vorverarbeitung, Klassifizierung und Datenextraktion laufen über günstige Mini-Modelle (z. B. GPT-4o-mini), während anspruchsvolle Analysen oder finale Synthesen an Claude 3.5 Sonnet oder GPT-4o übergeben werden.

Häufig gestellte Fragen (FAQ)

Wie viele Wörter oder Zeichen entsprechen 1.000 Tokens?

Als Faustregel gilt im Englischen: 1.000 Tokens entsprechen rund 750 Wörtern (ca. 4.000 Zeichen). In der deutschen Sprache liegt der Token-Verbrauch durch längere Komposita und Umlaute geringfügig höher, meist bei etwa 600 bis 700 Wörtern pro 1.000 Tokens.

Warum sind Output-Tokens teurer als Input-Tokens?

Input-Tokens (Prompts) können von den LLM-Clustern parallel und hochgradig optimiert verarbeitet werden. Die Textgenerierung (Output) erfolgt hingegen sequenziell Token für Token (Autoregressive Generierung), was pro Token deutlich mehr GPU-Rechenzeit und VRAM-Bandbreite bindet.

Was ist Prompt-Caching und wie viel spart man damit?

Beim Prompt-Caching speichern API-Anbieter (wie OpenAI oder Anthropic) statische Prompt-Teile (z. B. lange System-Prompts oder RAG-Kontexte) im GPU-Cache. Werden diese Prompts wiederholt aufgerufen, sinken die Input-Kosten für gecachte Abschnitte typischerweise um 50 % bis 90 % bei drastisch reduzierter Latenz.

Wann lohnt sich der Einsatz von Mini-Modellen (z. B. GPT-4o-mini)?

Mini- und Flash-Modelle kosten meist nur 5 % bis 10 % der Flagship-Modelle und sind ideal für Klassifizierungen, JSON-Extraktionen, Textzusammenfassungen, Sentiment-Analysen oder vorgelagerte Filter-Pipelines.

Passende Rechner für IT, Hosting & Cloud