Prüfen Sie nach dem Kürzen eines Prompts die Einsparungen anhand von usage jeder Antwort und der Kosten der gesamten Aufgabe. Eine kurze Antwort kann mit erheblichem Aufwand für Reasoning einhergehen, und bei der Fortsetzung eines Gesprächs kann der Verlauf erneut erfasst werden. Um das Budget zu überwachen, sollten Sie Tokenvolumen, Tarifkategorien und die Anzahl der für das Ergebnis erforderlichen Aufrufe getrennt betrachten.

Vier Zähler und ihre Verschachtelung
Im Beispiel für das usage-Objekt zeigt OpenAI die Eingabe, die Ausgabe und die Aufschlüsselung beider Zähler. Lesen Sie sie folgendermaßen:
input_tokens– Gesamtzahl der Eingabe-Tokens dieses Aufrufs, einschließlich des Kontexts, der für die Fortsetzung des Gesprächs verwendet wird.input_tokens_details.cached_tokens– Teil der Eingabe, der aus dem Cache bereitgestellt wurde. Er ist bereits ininput_tokensenthalten.output_tokens– Gesamtzahl der generierten Tokens, einschließlich des Reasonings.output_tokens_details.reasoning_tokens– Teil der Ausgabe, der für Reasoning aufgewendet wurde.
Reasoning-Tokens sind bereits in output_tokens enthalten; addieren Sie sie nicht ein zweites Mal zur Ausgabe. OpenAI berechnet sie zum Tarif für Ausgabe-Tokens. Ebenso würde das erneute Addieren von cached_tokens zur Eingabe denselben Teil der Anfrage doppelt erfassen. Für das Gesamtvolumen verwenden Sie total_tokens oder die Summe aus input_tokens + output_tokens.
Kosten: Die Eingabe nach Kategorien aufschlüsseln
Auf der aktuellen Preisseite werden normale Eingabe, Cache-Eingabe, Cache-Schreibvorgänge und Ausgabe separat aufgeführt. Wählen Sie die Tarife für das tatsächlich verwendete Modell, den Verarbeitungsmodus und die geltende Kontextlänge. Bewahren Sie die genauen Werte in einer versionierten Berechnungskonfiguration auf.
Ein wichtiger Punkt in der aktuellen Dokumentation zum Prompt-Caching: Bei GPT-5.6 und neueren Modellen wird input_tokens_details.cache_write_tokens erfasst. Wenn Ihr Schema das Schreiben in den Cache separat berechnet, ziehen Sie diese Kategorie von der normalen Eingabe ab und wenden Sie ihren Tarif an.
I = input_tokens
C = input_tokens_details.cached_tokens
W = input_tokens_details.cache_write_tokens
O = output_tokens
ordinary_input = I - C - W
cost = ((I - C - W) * P_input
+ C * P_cached
+ W * P_write
+ O * P_output) / 1_000_000
Hier sind die Preise pro Million Tokens angegeben; für ein Schema ohne separate Kategorie für Schreibvorgänge verwenden Sie W = 0. Die Formel deckt die aufgeführten Tokenkategorien ab. Fügen Sie kostenpflichtige Tools als separate Positionen gemäß ihren Abrechnungsbedingungen hinzu.
Beispiel: Eingabe – 4000, Cache-Eingabe – 3000, Cache-Schreibvorgänge – 500, Ausgabe – 1000, davon 600 Reasoning-Tokens. Das ergibt 500 normale Eingabe-Tokens und insgesamt 5000 Tokens. Die Ausgabe wird mit 1000 Tokens berechnet; der Wert 600 bleibt für Diagnosezwecke erhalten.
Bei der Fortsetzung eines Gesprächs wird die Eingabe erneut berechnet
Wenn die Anwendung den Gesprächsverlauf manuell verwaltet, übermittelt sie die vorherigen Nachrichten zusammen mit der neuen Eingabe. Nachrichten, die in die nächste Anfrage aufgenommen werden, zählen erneut als Eingabekontext. Wer nur die letzte Nutzernachricht misst, lässt daher die Kosten des Verlaufs außer Acht.
Mit previous_response_id übermittelt die Anwendung einen Verweis auf die vorherige Antwort, und die API verknüpft den Kontext. Laut den Abrechnungsregeln für Fortsetzungen werden vorherige Eingabe-Tokens der Kette erneut als Eingabe berechnet. Der Cache kann die Tarifkategorie eines Teils dieser Eingabe verändern; prüfen Sie den tatsächlichen Cache-Treffer in cached_tokens jeder Antwort.
So überprüfen Sie das Optimierungsergebnis
- Erfassen Sie eine Ausgangsstichprobe. Vergleichen Sie dieselben Aufgaben, dasselbe Modell, dieselben Erfolgskriterien und ähnlich lange Dialoge.
- Protokollieren Sie jeden Aufruf. Erfassen Sie Antwort- und Aufgaben-IDs, Modell, Reasoning-Einstellungen, Status, Latenz und das vollständige
usage. Bewahren Sie die Version des Prompts und der Tarifkonfiguration auf. - Summieren Sie die Kosten pro Aufgabe. Berücksichtigen Sie alle zugehörigen Aufrufe und die Antworten auf Wiederholungsversuche. Die wichtigste Kennzahl sind die Kosten einer erfolgreich abgeschlossenen Aufgabe.
- Trennen Sie die Ursachen für Veränderungen. Beobachten Sie normale Eingabe, Cache-Lese- und Schreibvorgänge, Ausgabe und den Anteil des Reasonings. Für den aggregierten Cache-Anteil teilen Sie die Summe von
Cdurch die Summe vonI. - Prüfen Sie Qualität und Verteilungsschwanz. Vergleichen Sie neben den durchschnittlichen Kosten auch p95, die Anzahl der Versuche und den Prozentsatz erfolgreicher Aufgaben.
Der Parameter max_output_tokens begrenzt die Generierung einschließlich Reasoning. Wird das Limit ausgeschöpft, kann die Antwort den Status incomplete erhalten – auch ohne sichtbaren Text, aber mit Tokenverbrauch. Berücksichtigen Sie solche Antworten bei der Prüfung der Einsparungen: Die Optimierung ist erfolgreich, wenn vergleichbare Aufgaben mit geringeren Gesamtkosten abgeschlossen werden.