ASAnja SchiffersMathematik · KI · Wissen Zur Übersicht

Token sparen – ohne an Qualität zu verlieren

Kurze Prompts sind nicht automatisch gute Prompts. Entscheidend ist, unnötigen Ballast wegzulassen und den Kontext zu behalten, den eine KI für eine verlässliche Antwort wirklich braucht.

KI-Modelle verarbeiten Text in kleinen Einheiten, den sogenannten Tokens. Dazu gehören deine aktuelle Nachricht, je nach Dienst Teile des bisherigen Gesprächs und die erzeugte Antwort. Wie genau abgerechnet oder technisch verarbeitet wird, unterscheidet sich jedoch nach Modell, Anbieter und Tarif. Deshalb sind pauschale Prozentversprechen selten seriös.

Die Kurzfassung

Fünf Hebel für einen schlanken KI-Dialog

Weniger Ballast, klare Erwartungen und genug Zusammenhang für eine gute Antwort.

Was bei einer neuen Anfrage eine Rolle spielen kann

aktuelle Frage + mitgesendeter Verlauf + Antwort

Nicht jedes Produkt verarbeitet oder berechnet den Verlauf gleich.
01
Kontext gezielt halten

Unabhängige Aufgaben trennen

Beginne für ein neues Thema einen neuen Chat. Bei fortlaufenden Projekten darf der Zusammenhang bleiben – dann ist er oft wertvoller als die mögliche Ersparnis.

02
Ausgabe passend planen

Länge und Form vorgeben

Bitte zum Beispiel um fünf Stichpunkte, eine Tabelle oder höchstens 150 Wörter. So steuerst du die Ausgabe, ohne wichtige Anforderungen wegzukürzen.

03
So wenig wie möglich

Nur Relevantes auswählen

Füge die benötigten Abschnitte eines Dokuments ein. Bei Code gehören zum geänderten Ausschnitt auch die Funktionen, Typen oder Fehlermeldungen, die zum Verständnis nötig sind.

04
So vollständig wie nötig

Struktur eindeutig erhalten

CSV kann bei einfachen Tabellen kompakt sein. Für verschachtelte Daten ist JSON oft klarer. Entscheidend ist nicht das kürzeste, sondern das kleinste noch eindeutige Format.

05
Gesamtaufwand statt Rekord

Am Ergebnis messen

Vergleiche nicht nur Token pro Anfrage. Rückfragen, Korrekturen und neue Anläufe zählen mit. Die beste Variante führt mit wenig Aufwand zu einer brauchbaren Antwort.

So kurz wie möglich, aber so vollständig wie nötig.

Warum lange Chats mehr kosten können

In vielen Chat-Systemen wird bei einer neuen Anfrage ein Teil des bisherigen Gesprächs erneut als Kontext verarbeitet. Wächst dieser mit jeder Nachricht, kann auch die nächste Anfrage mehr Input-Tokens benötigen. Das ist eine Tendenz, kein Naturgesetz: Manche Dienste kürzen ältere Inhalte, fassen sie zusammen oder verwenden technische Verfahren wie Prompt-Caching. Diese Details können sich zudem ändern.

Auch Input und Output haben nicht bei jedem Modell denselben Preis. Häufig ist erzeugter Text teurer als eingegebener Text, aber das lässt sich nur anhand der aktuellen Angaben des verwendeten Dienstes beurteilen. Wer keine API-Abrechnung nutzt, profitiert von kürzeren Dialogen eher durch Übersicht und Geschwindigkeit als durch eine direkt sichtbare Ersparnis.

1. Neuer Chat – aber nicht um jeden Preis

Für eine abgeschlossene Aufgabe ist ein frischer Chat meist sinnvoll. Eine Urlaubsplanung gehört nicht in denselben Verlauf wie die Überarbeitung eines Arbeitsblatts. Bei einem fortlaufenden Projekt kann der vorhandene Kontext dagegen Rückfragen vermeiden und Entscheidungen nachvollziehbar halten. Wer zu früh trennt, muss wichtige Informationen erneut erklären oder hochladen.

2. Die gewünschte Antwort begrenzen

Formulierungen wie „in fünf Stichpunkten“, „höchstens 150 Wörter“ oder „nur die drei wichtigsten Unterschiede“ geben der Antwort eine klare Größe. Das ist meist wirksamer als ein allgemeines „Sei kurz“. Die Grenze muss aber zur Aufgabe passen: Eine sorgfältige Fehleranalyse braucht mehr Raum als eine Überschrift.

Beispiel

Erkläre den Unterschied in höchstens fünf Sätzen. Nenne danach ein kurzes Beispiel. Lass Einleitung und Wiederholung meiner Frage weg.

3. Dokumente und Code gezielt auswählen

Bei langen Dokumenten reichen häufig Inhaltsverzeichnis, relevante Passage und konkrete Frage. Kommentare, Exportreste oder doppelte Abschnitte können entfallen. Leerzeilen und Formatierung solltest du jedoch nicht blind löschen: Gute Gliederung hilft dem Modell, Zusammenhänge zu erkennen.

Für Code gilt dasselbe Prinzip. Ein Diff ist kompakt, aber allein oft unverständlich. Liefere den veränderten Abschnitt zusammen mit der notwendigen Umgebung: verwendete Typen, aufgerufene Funktionen, Fehlermeldung und erwartetes Verhalten.

4. Das passende Datenformat wählen

CSV eignet sich für gleichförmige Tabellen und ist oft kompakter als JSON oder XML. Sobald Daten verschachtelt sind, optionale Felder besitzen oder Einheiten erklärt werden müssen, kann JSON trotz zusätzlicher Zeichen die sicherere Wahl sein. Entferne Metadaten nur, wenn sie für die Aufgabe wirklich keine Bedeutung haben.

5. Die gesamte Aufgabe betrachten

Ein sehr knapper Prompt kann eine unpassende Antwort erzeugen. Dann kosten Rückfragen, Korrekturen und erneute Ausgaben mehr als ein klarer erster Auftrag. Vergleiche deshalb Varianten anhand des gesamten Wegs bis zu einem brauchbaren Ergebnis: Wie viele Anläufe waren nötig? Musste etwas neu erklärt werden? War die Antwort vollständig und korrekt?

Drei hilfreiche Bausteine

Die folgenden Texte sind normale Anweisungen für einen Chat. Sie werden nicht automatisch zu technischen System-Prompts und löschen auch keinen bereits vorhandenen Verlauf.

Antwort fokussieren

Antworte vollständig, aber knapp. Nenne zuerst das Ergebnis und danach nur die Begründung, die ich zum Prüfen brauche. Verzichte auf Einleitung und Wiederholungen.

Übergabe vorbereiten

Fasse den bisherigen Stand für einen neuen Chat zusammen: Ziel, wichtige Entscheidungen, offene Fragen und die Informationen, die zum Fortsetzen benötigt werden. Höchstens 200 Wörter.

Fehlenden Kontext erkennen

Prüfe vor der Antwort, ob wesentliche Informationen fehlen. Stelle dann höchstens zwei konkrete Rückfragen, statt Annahmen zu erfinden.

Eine kurze Checkliste vor dem Absenden

Die wichtigste Regel: Optimiere nicht auf möglichst wenige Tokens pro Nachricht, sondern auf einen klaren Weg zu einer guten, überprüfbaren Antwort.

Kleine Idee für heute

Wähle einen Gedanken aus diesem Beitrag und probiere ihn direkt bei der nächsten passenden Gelegenheit aus.