Einführung
Was beim Senden wirklich passiert und welche drei Sorten Token dabei anfallen

Ein Chat sieht aus wie ein Gespräch. Du schreibst etwas, es antwortet, du schreibst zurück. Technisch passiert etwas anderes. Ein Sprachmodell hat zwischen zwei Aufrufen keinen Zustand. Es erinnert sich an nichts.
Was wie Gedächtnis aussieht, baut die Anwendung bei jedem Senden neu zusammen. Sie nimmt die Systemanweisungen, alle hochgeladenen Dateien, die Beschreibungen der verfügbaren Werkzeuge und den kompletten bisherigen Verlauf, hängt deine neue Nachricht hinten an und schickt das Ganze als einen einzigen Text los. Bei jeder Nachricht. Von vorn.
Drei Sorten Token
Abgerechnet wird in Token, also in Textstücken von etwa vier Zeichen. Getrennt nach drei Sorten. Der Unterschied zwischen ihnen ist der Grund, warum dieselbe Arbeit sich im Preis um ein Vielfaches unterscheiden kann.
| Sorte | Was dazuzählt | Preislage |
|---|---|---|
| Input | Systemanweisungen, Dateien, Werkzeugbeschreibungen, der gesamte bisherige Verlauf, deine neue Nachricht | Basis |
| Output, einschließlich Reasoning | Die sichtbare Antwort, plus die unsichtbaren Denkschritte davor | Ein Mehrfaches vom Input |
| Wiederverwendeter Input | Der Teil des Inputs, der unverändert geblieben ist und aus dem Zwischenspeicher kommt | Etwa ein Zehntel vom Input |
Die absoluten Preise fallen seit Jahren. Die Verhältnisse zwischen den drei Sorten sind stabil geblieben. Mit ihnen lässt sich rechnen, ohne dass die Rechnung nächsten Monat falsch ist.
Auch mit Flatrate
Die meisten zahlen keine Rechnung pro Token, sondern ein Abo. Der Mechanismus gilt trotzdem, er wird nur in einer anderen Währung sichtbar: in Nutzungslimits, die früher greifen, und in Wartezeit, weil ein langer Verlauf vor jeder Antwort erst verarbeitet werden muss.
Dazu kommt der Teil, der von jedem Preismodell unabhängig ist. Ein überladener Kontext ist nicht nur teurer, er senkt auch die Trefferquote des Modells. Was Geld spart, spart hier also auch Aufmerksamkeit. Warum das so ist, steht in Schritt 4.
Was du nach dieser Lesson kannst
- Ausrechnen, wie oft du den Inhalt einer laufenden Session bereits bezahlt hast
- Einen Prompt so anordnen, dass der wiederholte Teil billig bleibt
- Die fünf Handlungen erkennen, die den Zwischenspeicher wegwerfen
- Eine Session gezielt beenden und den Stand ohne Verlust übergeben
- Entscheiden, wann eine höhere Denkstufe etwas bringt und wann sie nur dauert






