To samo zapytanie dotyczące repozytorium może wymagać kilku prób: agent proponuje poprawkę, uruchamia testy, a następnie naprawia błędy. Niska cena tokenów sama w sobie nie odpowiada na najważniejsze pytanie: ile kosztuje uzyskanie zmiany, którą można zaakceptować.
Na 2 października 2026 roku odpowiedź jest następująca: standardowe stawki API GPT‑6.1 Sol za tokeny wejściowe i wyjściowe są pięć razy niższe niż stawki GPT‑6 Astra. OpenAI twierdzi również, że Sol dorównała Astrze w jednym teście kodowania agentowego. Nie dowodzi to jednak ogólnego parytetu w Codex ani nie gwarantuje pięciokrotnych oszczędności na gotowej poprawce.
Najpierw rozróżnijmy API i subskrypcję Codex
Za API płaci się według wykorzystanych tokenów. W Codex używanym przez ChatGPT obowiązuje limit wliczony w plan, dlatego nie można przenosić na niego cen API. OpenAI wyjaśnia, że zużycie limitu zależy od modelu, zadania i ustawień, a API jest rozliczane osobno — opisano to w pomocy dotyczącej korzystania z Work i Codex.
Tabela przedstawia standardowe stawki API za milion tokenów dla zapytań z kontekstem wejściowym do 272 tysięcy tokenów:
| Model | Zwykłe wejście | Wejście z pamięci podręcznej | Zapis do pamięci podręcznej | Wyjście |
|---|---|---|---|---|
| GPT‑6.1 Sol | $2 | $0,10 | $2,50 | $10 |
| GPT‑6 Sol | $2 | $0,20 | $2,50 | $10 |
| GPT‑6 Astra | $10 | $1 | $12,50 | $50 |
| GPT‑6 Luna | $0,10 | $0,01 | $0,125 | $0,50 |
Według standardowych stawek za wejście i wyjście Sol jest pięć razy tańsza od Astry, a wejście z pamięci podręcznej kosztuje dziesięć razy mniej. W porównaniu z GPT‑6 Sol nowa wersja nie jest jednak tańsza za zwykłe wejście i wyjście: jej przewaga cenowa dotyczy wejścia z pamięci podręcznej, którego cena spadła o połowę. Luna kosztuje znacznie mniej niż wszystkie trzy modele, ale sama niska cena nie mówi, jak dobrze model poradzi sobie ze złożonym zadaniem. Stawki te podano w cenniku API OpenAI.
Ile kosztuje taka sama próba
Dla zobrazowania weźmy przykładowe zapytanie: 20 tysięcy nowych tokenów wejściowych, 80 tysięcy tokenów z pamięci podręcznej i 10 tysięcy tokenów wyjściowych. Załóżmy, że pamięć podręczna zadziałała; pomijamy zapis do pamięci podręcznej, wywołania narzędzi i ponowne próby.
| Model | Obliczenie | Koszt |
|---|---|---|
| GPT‑6.1 Sol | $0,040 + $0,008 + $0,100 | $0,148 |
| GPT‑6 Sol | $0,040 + $0,016 + $0,100 | $0,156 |
| GPT‑6 Astra | $0,200 + $0,080 + $0,500 | $0,780 |
| GPT‑6 Luna | $0,002 + $0,0008 + $0,005 | $0,0078 |
Przy takim składzie zapytania jedna próba z Sol kosztuje około 5,3 raza mniej niż z Astrą. W porównaniu z GPT‑6 Sol różnica wynosi $0,008 — około 5,1% kosztu próby. To przykład arytmetyczny, a nie pomiar typowego zadania Codex: modele mogą różnić się zużyciem tokenów, liczbą wywołań narzędzi i liczbą ponownych prób.
Obowiązuje też próg cenowy: w przypadku zapytań z kontekstem przekraczającym 272 tysiące tokenów wejściowych stawki za wejście i pamięć podręczną są podwajane, a za wyjście rosną półtorakrotnie — dla całego zapytania. Dlatego powyższe obliczenie nie uwzględnia długiego kontekstu; warunki opisano na stronie modelu GPT‑6.1 Sol.
Co dokładnie potwierdza porównanie z Astrą
W zapowiedzi GPT‑6.1 Sol OpenAI stwierdziło, że w teście DeepSWE v1.1, który obejmuje złożone zadania inżynierskie w rzeczywistych bazach kodu, Sol dorównała Astrze przy koszcie wynoszącym około jednej piątej. Precyzyjne sformułowanie brzmi: „w DeepSWE v1.1 według danych OpenAI”.
W OSWorld 2.0, oceniającym wykonywanie zadań na komputerze, Sol uzyskała wynik o 2,1 punktu procentowego niższy od Astry przy maksymalnym poziomie rozumowania. Według szacunków OpenAI koszt zadania był przy tym około siedem razy niższy. Firma zastrzega, że jej pomiary przeprowadzono w środowisku badawczym lub przez API i mogą różnić się od działania w interfejsach produkcyjnych ze względu na instrukcje systemowe, narzędzia i ustawienia.
Są to wyniki opublikowane przez samego dostawcę, a nie niezależne sprawdzenie modeli w tym samym procesie pracy z Codex. Materiały przeanalizowane na potrzeby tego artykułu nie zawierają porównywalnego, niezależnego testu Sol i Astry na tych samych zadaniach Codex.
Co mówią deweloperzy
Pierwsze dyskusje po premierze są powodem, by sprawdzić model we własnym środowisku, ale nie stanowią reprezentatywnego testu. W jednym wątku na Reddicie o szybkości i zużyciu limitu użytkownicy skarżą się na powolne generowanie. Jeden z autorów pisze, że prosta czynność lub kompresja kontekstu zajmowały mu co najmniej dwie minuty. To pojedyncze obserwacje bez identycznych zadań i kontrolowanych warunków.
W innej dyskusji o szybkości Sol uczestnicy mają różne opinie: niektórzy uważają powolne generowanie za problem, inni zauważają, że sama szybkość generowania tokenów nie pokazuje, ile czasu zajmie całe zadanie. To różne wskaźniki, a wątek nie przedstawia kontrolowanego pomiaru żadnego z nich.
Pojawiła się też pojedyncza negatywna opinia o próbie stworzenia demonstracyjnej gry: autor twierdzi, że model pominął wymagania i nie naprawił istotnych niedociągnięć po doprecyzowaniu polecenia. Nie jest to pomiar ogólnej jakości modelu ani jego bezpośrednie porównanie z Astrą.
Wreszcie w zgłoszeniu na GitHubie dotyczącym wyboru modelu w rozszerzeniu VS Code użytkownik poinformował 30 września, że Sol była widoczna w aplikacji Codex, ale nie pojawiała się na liście modeli rozszerzenia w systemie Windows. To opis konkretnej konfiguracji; nie ustala ani przyczyny, ani skali problemu.
Autorzy tych wpisów posługują się pseudonimami, a ich tożsamości nie da się zweryfikować, dlatego nie przytaczamy bezpośrednich cytatów przypisanych potwierdzonym prawdziwym nazwiskom. Praktyczny wniosek z tych wczesnych opinii jest skromniejszy: jakość, czas ukończenia zadania i zużycie limitu należy mierzyć osobno.
Krótka chronologia
- 3 września 2026 roku. OpenAI zaprezentowało GPT‑6 Astra.
- 22 września 2026 roku. W API udostępniono GPT‑6 Sol i GPT‑6 Luna.
- 29 września 2026 roku. OpenAI ogłosiło premierę GPT‑6.1 Sol w API, ChatGPT Work i Codex.
- 30 września 2026 roku. Na GitHubie pojawiło się zgłoszenie, że Sol nie ma na liście modeli rozszerzenia VS Code w systemie Windows.
Daty premier podano w dzienniku zmian API OpenAI, a zgłoszenie dotyczące VS Code znajduje się w konkretnym wątku na GitHubie. To wczesna chronologia, a nie ocena dostępności modelu dla wszystkich użytkowników.
Kiedy wybrać Sol, a kiedy Astrę
Dla planów Plus i Standard Business OpenAI podaje orientacyjny zakres 15–160 lokalnych wiadomości w pięciogodzinnym oknie dla Sol oraz 5–45 dla Astry. Nie jest to gwarantowana liczba zadań: zużycie zależy od modelu, zadania i ustawień; zadania w chmurze mogą zużywać więcej limitu, a także mogą obowiązywać limity tygodniowe. Tych szacunków nie można zamieniać na współczynnik oszczędności ani bezpośrednio porównywać z cenami API — warunki opisano w pomocy dotyczącej limitów Work i Codex.
Praktyczny wybór zależy od kosztu błędu i czasu oczekiwania:
- Warto przetestować Sol przy powtarzalnych zadaniach z jasnymi kryteriami weryfikacji wyniku — na przykład gdy dostępne są testy i precyzyjne warunki akceptacji. Jej standardowe stawki API są znacznie niższe niż stawki Astry.
- Astrę można zostawić do złożonych lub ryzykownych zadań, w których jakość wyniku jest ważniejsza od kosztu pojedynczej próby. To, czy lepiej radzi sobie z zadaniami konkretnego zespołu, trzeba sprawdzić w praktyce.
- Luna może się sprawdzić w prostych, powtarzalnych operacjach, jeśli jej jakość jest wystarczająca. Minimalna cena tokenów nie dowodzi, że złożona praca z tym modelem będzie tańsza.
Aby przeprowadzić porównanie, uruchom na modelach ten sam niewielki zestaw zadań i wcześniej określ, jaki wynik uznajesz za akceptowalny: na przykład przejście testów, spełnienie wymagań i pozytywną ocenę podczas przeglądu. Zapisuj liczbę prób, zużycie tokenów, wywołania narzędzi i czas do uzyskania gotowej poprawki. Dzięki temu oszacujesz koszt wyniku, a nie samej odpowiedzi.
Werdykt: Sol rzeczywiście kosztuje pięć razy mniej od Astry za zwykłe tokeny wejściowe i wyjściowe API; OpenAI informuje o równym wyniku w jednym teście kodowania agentowego. Nie ma jednak wystarczających dowodów na ogólny parytet w Codex. W subskrypcji oszczędności API nie przekładają się bezpośrednio na koszty, a pierwsze opinie deweloperów są na razie rozproszone i sprzeczne. Sol jest uzasadnioną kandydatką na bardziej ekonomiczny wariant, ale to, czy powinna zastąpić Astrę, zależy od tego, jak oba modele poradzą sobie z zadaniami konkretnego zespołu.