jsonscraper

GPT‑6.1 Sol in Codex: fünfmal günstiger als Astra – aber ist sie in der Praxis gleichauf?

API-Preise, Codex-Limits und Kosten pro akzeptiertem Patch: Was Berechnungen und Tests belegen – und was bislang nur frühe Erfahrungsberichte sagen.

Dieselbe Anfrage an ein Repository kann mehrere Versuche erfordern: Der Agent schlägt einen Patch vor, führt Tests aus und behebt anschließend Fehler. Ein niedriger Tokenpreis allein beantwortet nicht die entscheidende Frage: Was kostet es, eine Änderung zu erhalten, die sich übernehmen lässt?

Am 2. Oktober 2026 lautet die Antwort: Die Standard-API-Preise von GPT‑6.1 Sol für Eingabe- und Ausgabetokens liegen fünfmal unter denen von GPT‑6 Astra. OpenAI erklärt außerdem, Sol habe Astra in einem Test für agentisches Programmieren eingeholt. Das beweist jedoch keine allgemeine Leistungsgleichheit in Codex und garantiert auch keine fünffache Ersparnis bei einem fertigen Patch.

Zuerst API und Codex-Abonnement auseinanderhalten

Die API wird nach den verwendeten Tokens abgerechnet. In Codex über ChatGPT gilt das im jeweiligen Arbeitsplan enthaltene Nutzungslimit; daher lassen sich die API-Preise nicht darauf übertragen. OpenAI erläutert, dass der Verbrauch des Limits von Modell, Aufgabe und Einstellungen abhängt und die API separat abgerechnet wird. Dies wird in der Hilfe zur Nutzung von Work und Codex beschrieben.

Die Tabelle zeigt die regulären API-Preise pro eine Million Tokens für Anfragen mit einem Eingabekontext von bis zu 272.000 Tokens:

Modell Normale Eingabe Gecachte Eingabe Cache-Schreibvorgang Ausgabe
GPT‑6.1 Sol $2 $0,10 $2,50 $10
GPT‑6 Sol $2 $0,20 $2,50 $10
GPT‑6 Astra $10 $1 $12,50 $50
GPT‑6 Luna $0,10 $0,01 $0,125 $0,50

Bei den regulären Preisen für Eingabe und Ausgabe ist Sol fünfmal günstiger als Astra; gecachte Eingaben kosten zehnmal weniger. Im Vergleich zu GPT‑6 Sol ist die neue Version bei normaler Ein- und Ausgabe nicht günstiger: Ihr Preisvorteil liegt bei der gecachten Eingabe, deren Preis sich halbiert hat. Luna ist deutlich günstiger als alle drei; der niedrige Preis allein sagt jedoch nichts darüber aus, wie gut das Modell eine schwierige Aufgabe bewältigt. Diese Preise sind in der OpenAI-API-Preisliste aufgeführt.

Was kostet ein identischer Versuch?

Arbeitender Mann
Sanni Sahil

Zur Veranschaulichung nehmen wir eine hypothetische Anfrage an: 20.000 neue Eingabetokens, 80.000 gecachte Eingabetokens und 10.000 Ausgabetokens. Wir gehen davon aus, dass der Cache greift; Cache-Schreibvorgänge, Tool-Aufrufe und Wiederholungsversuche bleiben unberücksichtigt.

Modell Berechnung Kosten
GPT‑6.1 Sol $0,040 + $0,008 + $0,100 $0,148
GPT‑6 Sol $0,040 + $0,016 + $0,100 $0,156
GPT‑6 Astra $0,200 + $0,080 + $0,500 $0,780
GPT‑6 Luna $0,002 + $0,0008 + $0,005 $0,0078

Bei dieser Zusammensetzung kostet ein Versuch mit Sol ungefähr 5,3-mal weniger als mit Astra. Gegenüber GPT‑6 Sol beträgt der Unterschied $0,008 – rund 5,1 % der Versuchskosten. Das ist ein Rechenbeispiel und keine Messung einer typischen Codex-Aufgabe: Tokenverbrauch, Anzahl der Tool-Aufrufe und Wiederholungen können sich zwischen den Modellen unterscheiden.

Außerdem gibt es eine Preisstufe: Bei Anfragen mit einem Kontext von mehr als 272.000 Eingabetokens verdoppeln sich die Preise für Eingaben und Cache, während die Ausgabe für die gesamte Anfrage um den Faktor 1,5 teurer wird. Die obige Berechnung passt daher ohne Anpassungen nicht für lange Kontexte; die Bedingungen stehen auf der Modellseite von GPT‑6.1 Sol.

Was der Vergleich mit Astra tatsächlich belegt

In der Ankündigung von GPT‑6.1 Sol erklärte OpenAI, Sol habe bei DeepSWE v1.1, einem Test schwieriger Entwicklungsaufgaben in realen Codebasen, Astra bei ungefähr einem Fünftel der Kosten eingeholt. Die korrekte Formulierung lautet hier: „bei DeepSWE v1.1 laut OpenAI“.

Bei OSWorld 2.0, das die Ausführung von Aufgaben am Computer bewertet, lag Sol bei maximaler Reasoning-Stufe 2,1 Prozentpunkte hinter Astra. Laut OpenAI waren die Kosten pro Aufgabe dabei ungefähr siebenmal niedriger. Das Unternehmen weist darauf hin, dass seine Bewertungen in einer Forschungsumgebung oder über die API durchgeführt wurden und sich aufgrund von Systemanweisungen, Tools und Einstellungen von der Nutzung in Produktionsoberflächen unterscheiden können.

Dies sind vom Anbieter selbst veröffentlichte Ergebnisse und keine unabhängige Überprüfung der Modelle in einem identischen Codex-Arbeitsablauf. Die für diesen Artikel ausgewerteten Materialien enthalten keinen vergleichbaren unabhängigen Test von Sol und Astra anhand derselben Codex-Aufgaben.

Was Entwickler berichten

Erste Diskussionen nach der Markteinführung sind ein Anlass, das Modell in der eigenen Umgebung zu testen, aber kein repräsentativer Test. In einem Reddit-Thread zu Geschwindigkeit und Limitverbrauch beschweren sich Nutzer über langsame Generierung. Ein Verfasser schreibt, eine einfache Aktion oder das Verdichten des Kontexts habe bei ihm mindestens zwei Minuten gedauert. Das sind einzelne Beobachtungen ohne identische Aufgaben und kontrollierte Bedingungen.

In einer weiteren Diskussion zur Geschwindigkeit von Sol gehen die Meinungen auseinander: Einige halten die langsame Generierung für ein Problem, andere merken an, dass die Geschwindigkeit der Token-Ausgabe allein nicht zeigt, wie lange die gesamte Aufgabe dauert. Das sind unterschiedliche Messgrößen; der Thread liefert für keine davon eine kontrollierte Messung.

Es gibt auch einen einzelnen negativen Erfahrungsbericht über den Versuch, eine Spiel-Demo zu erstellen: Der Verfasser berichtet, das Modell habe Anforderungen übergangen und nach einer Präzisierung wesentliche Mängel nicht behoben. Das misst weder die Gesamtqualität des Modells noch vergleicht es dieses direkt mit Astra.

Schließlich berichtete ein Nutzer am 30. September in einem GitHub-Issue zur Modellauswahl in der VS-Code-Erweiterung, Sol sei in der Codex-Desktop-App sichtbar gewesen, habe aber in der Modellliste der Erweiterung unter Windows gefehlt. Das beschreibt eine konkrete Konfiguration; weder Ursache noch Ausmaß des Problems sind damit geklärt.

Die überprüfbaren Verfasser dieser Beiträge verwenden Pseudonyme; direkte Zitate mit bestätigten echten Namen werden daher hier nicht wiedergegeben. Die bescheidene praktische Schlussfolgerung aus diesen frühen Erfahrungsberichten lautet: Qualität, Zeit bis zum Abschluss der Aufgabe und Limitverbrauch müssen getrennt gemessen werden.

Kurzer Zeitstrahl

  1. 3. September 2026. OpenAI stellte GPT‑6 Astra vor.
  2. 22. September 2026. GPT‑6 Sol und GPT‑6 Luna wurden in der API veröffentlicht.
  3. 29. September 2026. OpenAI kündigte die Veröffentlichung von GPT‑6.1 Sol für API, ChatGPT Work und Codex an.
  4. 30. September 2026. Auf GitHub erschien ein Bericht, dass Sol in der Modellliste der VS-Code-Erweiterung unter Windows fehlte.

Die Veröffentlichungstermine sind im OpenAI-API-Changelog aufgeführt; der Bericht zu VS Code steht in der konkreten GitHub-Diskussion. Dies ist ein früher Zeitstrahl und keine Bewertung der Verfügbarkeit des Modells für alle Nutzer.

Wann Sol wählen – und wann Astra

Für Plus und Standard Business nennt OpenAI einen Richtwert von 15–160 lokalen Nachrichten innerhalb eines Fünf-Stunden-Fensters für Sol und 5–45 für Astra. Das ist keine garantierte Anzahl von Aufgaben: Der Verbrauch hängt von Modell, Aufgabe und Einstellungen ab; Cloud-Aufgaben können mehr vom Limit verbrauchen, außerdem können wöchentliche Beschränkungen gelten. Diese Schätzungen lassen sich weder in einen Sparfaktor umrechnen noch direkt mit API-Preisen vergleichen – die Bedingungen werden in der Hilfe zu den Work- und Codex-Limits erläutert.

Die praktische Wahl hängt vom Preis eines Fehlers und der Wartezeit ab:

  • Sol sollte man testen bei wiederkehrenden Aufgaben mit einem klar überprüfbaren Ergebnis – etwa, wenn Tests und eindeutige Abnahmekriterien vorhanden sind. Ihre regulären API-Preise liegen deutlich unter denen von Astra.
  • Astra kann man für komplexe oder risikoreiche Aufgaben beibehalten, bei denen die Ergebnisqualität wichtiger ist als die Kosten eines einzelnen Versuchs. Wie viel besser sie die Aufgaben des jeweiligen Teams bewältigt, muss in der Praxis geprüft werden.
  • Luna kann sich eignen für einfache, wiederkehrende Vorgänge, sofern die Qualität ausreicht. Der minimale Tokenpreis beweist nicht, dass komplexe Arbeit mit diesem Modell günstiger wird.

Führen Sie zum Vergleich mit den Modellen denselben kleinen Aufgabensatz aus und legen Sie vorab fest, welches Ergebnis als akzeptabel gilt: beispielsweise bestandene Tests, Anforderungserfüllung und Freigabe im Review. Erfassen Sie die Zahl der Versuche, den Tokenverbrauch, Tool-Aufrufe und die Zeit bis zum fertigen Patch. So bewerten Sie nicht den Preis einer Antwort, sondern die Kosten des Ergebnisses.

Fazit: Sol ist bei normalen API-Eingabe- und Ausgabetokens tatsächlich fünfmal günstiger als Astra; bei einem Test für agentisches Programmieren berichtet OpenAI von einem gleichwertigen Ergebnis. Für eine allgemeine Leistungsgleichheit in Codex reichen die Belege jedoch nicht aus. Bei einem Abonnement lässt sich die API-Ersparnis nicht direkt übertragen, und die frühen Erfahrungsberichte von Entwicklern sind bislang uneinheitlich und widersprüchlich. Sol ist ein gut begründeter Kandidat für eine kostengünstigere Alternative – ob sie Astra ersetzen sollte, hängt jedoch davon ab, wie beide Modelle die Aufgaben des jeweiligen Teams bewältigen.

Ähnliche Beiträge

Vom Artikel zur funktionierenden Integration

Entdecke die Social-Data-APIs von jsonscraper, teste Anfragen und entwickle deinen nächsten Workflow.

APIs entdecken