KI-Modelle verarbeiten Text in kleinen Einheiten, den sogenannten Tokens. Dazu gehören deine aktuelle Nachricht, je nach Dienst Teile des bisherigen Gesprächs und die erzeugte Antwort. Wie genau abgerechnet oder technisch verarbeitet wird, unterscheidet sich jedoch nach Modell, Anbieter und Tarif. Deshalb sind pauschale Prozentversprechen selten seriös.
Die Kurzfassung
Fünf Hebel für einen schlanken KI-Dialog
Weniger Ballast, klare Erwartungen und genug Zusammenhang für eine gute Antwort.
aktuelle Frage + mitgesendeter Verlauf + Antwort
Unabhängige Aufgaben trennen
Beginne für ein neues Thema einen neuen Chat. Bei fortlaufenden Projekten darf der Zusammenhang bleiben – dann ist er oft wertvoller als die mögliche Ersparnis.
Länge und Form vorgeben
Bitte zum Beispiel um fünf Stichpunkte, eine Tabelle oder höchstens 150 Wörter. So steuerst du die Ausgabe, ohne wichtige Anforderungen wegzukürzen.
Nur Relevantes auswählen
Füge die benötigten Abschnitte eines Dokuments ein. Bei Code gehören zum geänderten Ausschnitt auch die Funktionen, Typen oder Fehlermeldungen, die zum Verständnis nötig sind.
Struktur eindeutig erhalten
CSV kann bei einfachen Tabellen kompakt sein. Für verschachtelte Daten ist JSON oft klarer. Entscheidend ist nicht das kürzeste, sondern das kleinste noch eindeutige Format.
Am Ergebnis messen
Vergleiche nicht nur Token pro Anfrage. Rückfragen, Korrekturen und neue Anläufe zählen mit. Die beste Variante führt mit wenig Aufwand zu einer brauchbaren Antwort.
So kurz wie möglich, aber so vollständig wie nötig.
Warum lange Chats mehr kosten können
In vielen Chat-Systemen wird bei einer neuen Anfrage ein Teil des bisherigen Gesprächs erneut als Kontext verarbeitet. Wächst dieser mit jeder Nachricht, kann auch die nächste Anfrage mehr Input-Tokens benötigen. Das ist eine Tendenz, kein Naturgesetz: Manche Dienste kürzen ältere Inhalte, fassen sie zusammen oder verwenden technische Verfahren wie Prompt-Caching. Diese Details können sich zudem ändern.
Auch Input und Output haben nicht bei jedem Modell denselben Preis. Häufig ist erzeugter Text teurer als eingegebener Text, aber das lässt sich nur anhand der aktuellen Angaben des verwendeten Dienstes beurteilen. Wer keine API-Abrechnung nutzt, profitiert von kürzeren Dialogen eher durch Übersicht und Geschwindigkeit als durch eine direkt sichtbare Ersparnis.
1. Neuer Chat – aber nicht um jeden Preis
Für eine abgeschlossene Aufgabe ist ein frischer Chat meist sinnvoll. Eine Urlaubsplanung gehört nicht in denselben Verlauf wie die Überarbeitung eines Arbeitsblatts. Bei einem fortlaufenden Projekt kann der vorhandene Kontext dagegen Rückfragen vermeiden und Entscheidungen nachvollziehbar halten. Wer zu früh trennt, muss wichtige Informationen erneut erklären oder hochladen.
2. Die gewünschte Antwort begrenzen
Formulierungen wie „in fünf Stichpunkten“, „höchstens 150 Wörter“ oder „nur die drei wichtigsten Unterschiede“ geben der Antwort eine klare Größe. Das ist meist wirksamer als ein allgemeines „Sei kurz“. Die Grenze muss aber zur Aufgabe passen: Eine sorgfältige Fehleranalyse braucht mehr Raum als eine Überschrift.
Erkläre den Unterschied in höchstens fünf Sätzen. Nenne danach ein kurzes Beispiel. Lass Einleitung und Wiederholung meiner Frage weg.
3. Dokumente und Code gezielt auswählen
Bei langen Dokumenten reichen häufig Inhaltsverzeichnis, relevante Passage und konkrete Frage. Kommentare, Exportreste oder doppelte Abschnitte können entfallen. Leerzeilen und Formatierung solltest du jedoch nicht blind löschen: Gute Gliederung hilft dem Modell, Zusammenhänge zu erkennen.
Für Code gilt dasselbe Prinzip. Ein Diff ist kompakt, aber allein oft unverständlich. Liefere den veränderten Abschnitt zusammen mit der notwendigen Umgebung: verwendete Typen, aufgerufene Funktionen, Fehlermeldung und erwartetes Verhalten.
4. Das passende Datenformat wählen
CSV eignet sich für gleichförmige Tabellen und ist oft kompakter als JSON oder XML. Sobald Daten verschachtelt sind, optionale Felder besitzen oder Einheiten erklärt werden müssen, kann JSON trotz zusätzlicher Zeichen die sicherere Wahl sein. Entferne Metadaten nur, wenn sie für die Aufgabe wirklich keine Bedeutung haben.
5. Die gesamte Aufgabe betrachten
Ein sehr knapper Prompt kann eine unpassende Antwort erzeugen. Dann kosten Rückfragen, Korrekturen und erneute Ausgaben mehr als ein klarer erster Auftrag. Vergleiche deshalb Varianten anhand des gesamten Wegs bis zu einem brauchbaren Ergebnis: Wie viele Anläufe waren nötig? Musste etwas neu erklärt werden? War die Antwort vollständig und korrekt?
Drei hilfreiche Bausteine
Die folgenden Texte sind normale Anweisungen für einen Chat. Sie werden nicht automatisch zu technischen System-Prompts und löschen auch keinen bereits vorhandenen Verlauf.
Antworte vollständig, aber knapp. Nenne zuerst das Ergebnis und danach nur die Begründung, die ich zum Prüfen brauche. Verzichte auf Einleitung und Wiederholungen.
Fasse den bisherigen Stand für einen neuen Chat zusammen: Ziel, wichtige Entscheidungen, offene Fragen und die Informationen, die zum Fortsetzen benötigt werden. Höchstens 200 Wörter.
Prüfe vor der Antwort, ob wesentliche Informationen fehlen. Stelle dann höchstens zwei konkrete Rückfragen, statt Annahmen zu erfinden.
Eine kurze Checkliste vor dem Absenden
- Gehört die Aufgabe noch in diesen Chat?
- Ist das gewünschte Ergebnis klar beschrieben?
- Habe ich nur relevante Daten eingefügt?
- Bleibt trotzdem genug Kontext zum Verstehen?
- Passt die gewünschte Antwortlänge zur Aufgabe?
Die wichtigste Regel: Optimiere nicht auf möglichst wenige Tokens pro Nachricht, sondern auf einen klaren Weg zu einer guten, überprüfbaren Antwort.
Wähle einen Gedanken aus diesem Beitrag und probiere ihn direkt bei der nächsten passenden Gelegenheit aus.