La stessa richiesta su un repository può richiedere diversi tentativi: l’agente propone una patch, esegue i test e poi corregge gli errori. Il basso costo dei token, da solo, non risponde alla domanda principale: quanto costa ottenere una modifica che si possa accettare.
Al 2 ottobre 2026, la risposta è questa: le tariffe API standard di GPT‑6.1 Sol per i token di input e output sono cinque volte inferiori a quelle di GPT‑6 Astra. OpenAI afferma inoltre che Sol ha raggiunto la parità con Astra in un test di coding agentico. Ma questo non dimostra una parità generale in Codex né garantisce un risparmio di cinque volte su una patch pronta.
Prima di tutto, distinguiamo API e abbonamento a Codex
Le API si pagano in base ai token utilizzati. In Codex tramite ChatGPT è incluso un limite d’uso nel piano di lavoro, quindi non è possibile applicarvi i prezzi delle API. OpenAI spiega che il consumo del limite dipende dal modello, dall’attività e dalle impostazioni, mentre le API si pagano a parte: i dettagli sono disponibili nella guida all’utilizzo di Work e Codex.
La tabella mostra le tariffe API standard per milione di token per richieste con un contesto di input fino a 272.000 token:
| Modello | Input normale | Input memorizzato nella cache | Scrittura nella cache | Output |
|---|---|---|---|---|
| GPT‑6.1 Sol | $2 | $0,10 | $2,50 | $10 |
| GPT‑6 Sol | $2 | $0,20 | $2,50 | $10 |
| GPT‑6 Astra | $10 | $1 | $12,50 | $50 |
| GPT‑6 Luna | $0,10 | $0,01 | $0,125 | $0,50 |
Con le tariffe normali, Sol costa un quinto di Astra per input e output, mentre l’input memorizzato nella cache costa un decimo. Rispetto a GPT‑6 Sol, però, la nuova versione non costa meno per l’input e l’output normali: il vantaggio tariffario riguarda l’input memorizzato nella cache, il cui prezzo si è dimezzato. Luna costa molto meno di tutti e tre i modelli, ma il prezzo basso, da solo, non dice quanto bene il modello risolverà un’attività complessa. Queste tariffe sono riportate nella pagina dei prezzi API di OpenAI.
Quanto costa un tentativo equivalente
Per chiarire, consideriamo una richiesta ipotetica: 20.000 nuovi token di input, 80.000 token memorizzati nella cache e 10.000 token di output. Supponiamo che la cache venga utilizzata; non consideriamo la scrittura nella cache, le chiamate agli strumenti o i tentativi successivi.
| Modello | Calcolo | Costo |
|---|---|---|
| GPT‑6.1 Sol | $0,040 + $0,008 + $0,100 | $0,148 |
| GPT‑6 Sol | $0,040 + $0,016 + $0,100 | $0,156 |
| GPT‑6 Astra | $0,200 + $0,080 + $0,500 | $0,780 |
| GPT‑6 Luna | $0,002 + $0,0008 + $0,005 | $0,0078 |
Con questa composizione della richiesta, un tentativo con Sol costa circa 5,3 volte meno che con Astra. Rispetto a GPT‑6 Sol, la differenza è di $0,008, circa il 5,1% del costo del tentativo. È un esempio aritmetico, non una misurazione di un’attività tipica di Codex: il consumo di token, il numero di chiamate agli strumenti e quello dei tentativi possono variare da un modello all’altro.
C’è anche una soglia tariffaria: per le richieste con un contesto superiore a 272.000 token di input, le tariffe di input e cache raddoppiano e quelle di output aumentano di una volta e mezza, per l’intera richiesta. Il calcolo sopra non è quindi adatto a un contesto lungo senza correzioni; le condizioni sono riportate nella pagina del modello GPT‑6.1 Sol.
Che cosa dimostra davvero il confronto con Astra
Nell’annuncio di GPT‑6.1 Sol, OpenAI ha dichiarato che, nel test DeepSWE v1.1 su attività ingegneristiche complesse in basi di codice reali, Sol ha raggiunto la parità con Astra a circa un quinto del costo. La formulazione corretta è «nel test DeepSWE v1.1, secondo OpenAI».
In OSWorld 2.0, che valuta l’esecuzione di attività al computer, Sol è risultata inferiore ad Astra di 2,1 punti percentuali al livello massimo di ragionamento. Secondo OpenAI, il costo per attività era circa sette volte inferiore. L’azienda avverte che le proprie valutazioni sono state condotte in un ambiente di ricerca o tramite API e possono differire dall’utilizzo nelle interfacce di produzione a causa di istruzioni di sistema, strumenti e impostazioni.
Questi sono risultati pubblicati dal fornitore stesso, non una verifica indipendente dei modelli con lo stesso flusso di lavoro in Codex. I materiali esaminati per questo articolo non forniscono un test indipendente comparabile di Sol e Astra sulle stesse attività di Codex.
Che cosa dicono gli sviluppatori
Le prime discussioni dopo il lancio sono un motivo per provare il modello nel proprio ambiente, ma non costituiscono un test rappresentativo. In un thread Reddit sulla velocità e sul consumo del limite, gli utenti si lamentano della generazione lenta. Un autore scrive che, nel suo caso, un’azione semplice o la compattazione del contesto richiedeva almeno due minuti. Si tratta di osservazioni isolate, senza attività identiche né condizioni controllate.
In un’altra discussione sulla velocità di Sol, i partecipanti sono in disaccordo: alcuni considerano problematica la generazione lenta, mentre altri fanno notare che la velocità di output dei token, da sola, non indica quanto durerà l’intera attività. Sono metriche diverse e il thread non fornisce misurazioni controllate di nessuna delle due.
C’è anche una singola recensione negativa di un tentativo di realizzare una demo di gioco: l’autore riferisce che il modello ha ignorato alcuni requisiti e non ha corretto difetti sostanziali dopo una richiesta di chiarimento. Questo non misura la qualità complessiva del modello e non lo confronta direttamente con Astra.
Infine, in una segnalazione GitHub sulla selezione del modello nell’estensione per VS Code, un utente ha riferito il 30 settembre che Sol era visibile nell’app desktop Codex, ma non nell’elenco dei modelli dell’estensione su Windows. È la descrizione di una configurazione specifica: non stabilisce né la causa né la portata del problema.
Gli autori verificabili di questi post usano pseudonimi, quindi qui non riportiamo citazioni dirette attribuite a nomi reali verificati. La conclusione pratica di queste prime recensioni è più limitata: qualità, tempo per completare un’attività e consumo del limite vanno misurati separatamente.
Breve cronologia
- 3 settembre 2026. OpenAI presenta GPT‑6 Astra.
- 22 settembre 2026. GPT‑6 Sol e GPT‑6 Luna arrivano nelle API.
- 29 settembre 2026. OpenAI annuncia il rilascio di GPT‑6.1 Sol per API, ChatGPT Work e Codex.
- 30 settembre 2026. Su GitHub viene segnalata l’assenza di Sol nell’elenco dei modelli dell’estensione per VS Code su Windows.
Le date di rilascio sono riportate nel changelog delle API di OpenAI, mentre la segnalazione su VS Code è contenuta nella specifica discussione su GitHub. È una cronologia iniziale, non una valutazione della disponibilità del modello per tutti gli utenti.
Quando scegliere Sol e quando Astra
Per Plus e Standard Business, OpenAI indica un intervallo orientativo di 15–160 messaggi locali ogni cinque ore per Sol e 5–45 per Astra. Non è un numero garantito di attività: il consumo dipende dal modello, dall’attività e dalle impostazioni; le attività nel cloud possono consumare più limite e possono inoltre essere applicati limiti settimanali. Queste stime non vanno trasformate in un coefficiente di risparmio né confrontate direttamente con i prezzi API: le condizioni sono descritte nella guida ai limiti di Work e Codex.
La scelta pratica dipende dal costo di un errore e dai tempi di attesa:
- Vale la pena provare Sol su attività ripetitive con un risultato facile da verificare, per esempio se si dispone di test e criteri di accettazione chiari. Le sue tariffe API standard sono molto inferiori a quelle di Astra.
- Si può tenere Astra per attività complesse o rischiose, in cui la qualità del risultato conta più del costo di un singolo tentativo. Quanto meglio riesca a gestire le attività del proprio team va verificato nella pratica.
- Luna può essere adatta a operazioni semplici e ripetitive, se la qualità è sufficiente. Il costo minimo dei token non dimostra che il lavoro complesso con questo modello costerà meno.
Per confrontarli, eseguite sugli stessi modelli un piccolo insieme di attività e stabilite in anticipo quale risultato sia accettabile: per esempio, il superamento dei test, la conformità ai requisiti e l’approvazione in revisione. Annotate il numero di tentativi, il consumo di token, le chiamate agli strumenti e il tempo necessario per arrivare a una patch pronta. Così valuterete non il prezzo di una risposta, ma il costo del risultato.
Verdetto: Sol costa davvero un quinto di Astra per i normali token API di input e output; in un test di coding agentico, OpenAI riferisce risultati equivalenti. Ma non ci sono prove sufficienti di una parità generale in Codex. Con l’abbonamento, il risparmio sulle API non si applica direttamente, mentre le prime recensioni degli sviluppatori sono ancora frammentarie e contraddittorie. Sol è una valida candidata a un’opzione più economica, ma decidere se sostituire Astra dipende da come entrambi i modelli si comporteranno sulle attività specifiche del team.