jsonscraper

Tokenverbrauch der Responses API berechnen: Eingabe, Ausgabe, Cache und Reasoning

Praktische Erfassung der Nutzung: So prüfen Sie Einsparungen nach der Optimierung von Prompt, Verlauf und Reasoning.

Prüfen Sie nach dem Kürzen eines Prompts die Einsparungen anhand von usage jeder Antwort und der Kosten der gesamten Aufgabe. Eine kurze Antwort kann mit erheblichem Aufwand für Reasoning einhergehen, und bei der Fortsetzung eines Gesprächs kann der Verlauf erneut erfasst werden. Um das Budget zu überwachen, sollten Sie Tokenvolumen, Tarifkategorien und die Anzahl der für das Ergebnis erforderlichen Aufrufe getrennt betrachten.

Tokenverbrauch der Responses API berechnen: Eingabe, Ausgabe, Cache und Reasoning
Kontext: Wir erklären die Zähler der Responses API, die erneute Erfassung des Kontexts und die Kostenformel. Reasoning ist bereits in output_tokens enthalten; Cache-Tokens zählen zur Eingabe, und das Schreiben in den Cache kann separat berechnet werden.
Visuelles Motiv: Ein gemeinsames KI-Titelbild für die russische, englische und deutsche Version. Fotorealistisches redaktionelles Stillleben: Auf dem Schreibtisch eines Entwicklers liegen vier Gruppen kleiner, halbtransparenter Glasplättchen; inn
© jsonscraper · KI-generiertes Bild

Vier Zähler und ihre Verschachtelung

Im Beispiel für das usage-Objekt zeigt OpenAI die Eingabe, die Ausgabe und die Aufschlüsselung beider Zähler. Lesen Sie sie folgendermaßen:

  • input_tokens – Gesamtzahl der Eingabe-Tokens dieses Aufrufs, einschließlich des Kontexts, der für die Fortsetzung des Gesprächs verwendet wird.
  • input_tokens_details.cached_tokens – Teil der Eingabe, der aus dem Cache bereitgestellt wurde. Er ist bereits in input_tokens enthalten.
  • output_tokens – Gesamtzahl der generierten Tokens, einschließlich des Reasonings.
  • output_tokens_details.reasoning_tokens – Teil der Ausgabe, der für Reasoning aufgewendet wurde.

Reasoning-Tokens sind bereits in output_tokens enthalten; addieren Sie sie nicht ein zweites Mal zur Ausgabe. OpenAI berechnet sie zum Tarif für Ausgabe-Tokens. Ebenso würde das erneute Addieren von cached_tokens zur Eingabe denselben Teil der Anfrage doppelt erfassen. Für das Gesamtvolumen verwenden Sie total_tokens oder die Summe aus input_tokens + output_tokens.

Kosten: Die Eingabe nach Kategorien aufschlüsseln

Auf der aktuellen Preisseite werden normale Eingabe, Cache-Eingabe, Cache-Schreibvorgänge und Ausgabe separat aufgeführt. Wählen Sie die Tarife für das tatsächlich verwendete Modell, den Verarbeitungsmodus und die geltende Kontextlänge. Bewahren Sie die genauen Werte in einer versionierten Berechnungskonfiguration auf.

Ein wichtiger Punkt in der aktuellen Dokumentation zum Prompt-Caching: Bei GPT-5.6 und neueren Modellen wird input_tokens_details.cache_write_tokens erfasst. Wenn Ihr Schema das Schreiben in den Cache separat berechnet, ziehen Sie diese Kategorie von der normalen Eingabe ab und wenden Sie ihren Tarif an.

I = input_tokens
C = input_tokens_details.cached_tokens
W = input_tokens_details.cache_write_tokens
O = output_tokens

ordinary_input = I - C - W
cost = ((I - C - W) * P_input
        + C * P_cached
        + W * P_write
        + O * P_output) / 1_000_000
Tokenverbrauch der Responses API berechnen: Eingabe, Ausgabe, Cache und Reasoning
Kontext: Wir erklären die Zähler der Responses API, die erneute Erfassung des Kontexts und die Kostenformel. Reasoning ist bereits in output_tokens enthalten; Cache-Tokens zählen zur Eingabe, und das Schreiben in den Cache kann separat berechnet werden.
Visuelles Motiv: Ein gemeinsames KI-Titelbild für die russische, englische und deutsche Version. Fotorealistisches redaktionelles Stillleben: Auf dem Schreibtisch eines Entwicklers liegen vier Gruppen kleiner, halbtransparenter Glasplättchen; inn
© jsonscraper · KI-generiertes Bild

Hier sind die Preise pro Million Tokens angegeben; für ein Schema ohne separate Kategorie für Schreibvorgänge verwenden Sie W = 0. Die Formel deckt die aufgeführten Tokenkategorien ab. Fügen Sie kostenpflichtige Tools als separate Positionen gemäß ihren Abrechnungsbedingungen hinzu.

Beispiel: Eingabe – 4000, Cache-Eingabe – 3000, Cache-Schreibvorgänge – 500, Ausgabe – 1000, davon 600 Reasoning-Tokens. Das ergibt 500 normale Eingabe-Tokens und insgesamt 5000 Tokens. Die Ausgabe wird mit 1000 Tokens berechnet; der Wert 600 bleibt für Diagnosezwecke erhalten.

Bei der Fortsetzung eines Gesprächs wird die Eingabe erneut berechnet

Wenn die Anwendung den Gesprächsverlauf manuell verwaltet, übermittelt sie die vorherigen Nachrichten zusammen mit der neuen Eingabe. Nachrichten, die in die nächste Anfrage aufgenommen werden, zählen erneut als Eingabekontext. Wer nur die letzte Nutzernachricht misst, lässt daher die Kosten des Verlaufs außer Acht.

Mit previous_response_id übermittelt die Anwendung einen Verweis auf die vorherige Antwort, und die API verknüpft den Kontext. Laut den Abrechnungsregeln für Fortsetzungen werden vorherige Eingabe-Tokens der Kette erneut als Eingabe berechnet. Der Cache kann die Tarifkategorie eines Teils dieser Eingabe verändern; prüfen Sie den tatsächlichen Cache-Treffer in cached_tokens jeder Antwort.

So überprüfen Sie das Optimierungsergebnis

  1. Erfassen Sie eine Ausgangsstichprobe. Vergleichen Sie dieselben Aufgaben, dasselbe Modell, dieselben Erfolgskriterien und ähnlich lange Dialoge.
  2. Protokollieren Sie jeden Aufruf. Erfassen Sie Antwort- und Aufgaben-IDs, Modell, Reasoning-Einstellungen, Status, Latenz und das vollständige usage. Bewahren Sie die Version des Prompts und der Tarifkonfiguration auf.
  3. Summieren Sie die Kosten pro Aufgabe. Berücksichtigen Sie alle zugehörigen Aufrufe und die Antworten auf Wiederholungsversuche. Die wichtigste Kennzahl sind die Kosten einer erfolgreich abgeschlossenen Aufgabe.
  4. Trennen Sie die Ursachen für Veränderungen. Beobachten Sie normale Eingabe, Cache-Lese- und Schreibvorgänge, Ausgabe und den Anteil des Reasonings. Für den aggregierten Cache-Anteil teilen Sie die Summe von C durch die Summe von I.
  5. Prüfen Sie Qualität und Verteilungsschwanz. Vergleichen Sie neben den durchschnittlichen Kosten auch p95, die Anzahl der Versuche und den Prozentsatz erfolgreicher Aufgaben.

Der Parameter max_output_tokens begrenzt die Generierung einschließlich Reasoning. Wird das Limit ausgeschöpft, kann die Antwort den Status incomplete erhalten – auch ohne sichtbaren Text, aber mit Tokenverbrauch. Berücksichtigen Sie solche Antworten bei der Prüfung der Einsparungen: Die Optimierung ist erfolgreich, wenn vergleichbare Aufgaben mit geringeren Gesamtkosten abgeschlossen werden.

People

No people listed for this article yet.

Keep readingAnthropic veröffentlicht Claude Haiku 5.5: Der Tarif hängt von der Promptlänge ab
Read the next article

Vom Artikel zur funktionierenden Integration

Entdecke die Social-Data-APIs von jsonscraper, teste Anfragen und entwickle deinen nächsten Workflow.

APIs entdecken