Une même requête sur un dépôt peut nécessiter plusieurs tentatives : l’agent propose un correctif, lance les tests, puis corrige les erreurs. Le faible prix des jetons ne répond pas à la question essentielle : combien coûte l’obtention d’une modification que l’on peut accepter.
Au 2 octobre 2026, la réponse est la suivante : les tarifs API standard de GPT‑6.1 Sol pour les jetons d’entrée et de sortie sont cinq fois moins élevés que ceux de GPT‑6 Astra. OpenAI affirme également que Sol a atteint la parité avec Astra sur un test de codage agentique. Mais cela ne prouve pas une parité générale dans Codex et ne garantit pas une économie par cinq sur un correctif prêt à être accepté.
Commençons par distinguer l’API de l’abonnement Codex
L’API est facturée selon les jetons utilisés. Dans Codex via ChatGPT, le forfait comprend une limite d’utilisation ; les tarifs API ne peuvent donc pas lui être appliqués. OpenAI explique que la consommation de cette limite dépend du modèle, de la tâche et des paramètres, tandis que l’API est facturée séparément, comme le précise le guide d’utilisation de Work et Codex.
Le tableau présente les tarifs API standard par million de jetons pour les requêtes dont le contexte d’entrée ne dépasse pas 272 000 jetons :
| Modèle | Entrée standard | Entrée mise en cache | Écriture du cache | Sortie |
|---|---|---|---|---|
| GPT‑6.1 Sol | $2 | $0,10 | $2,50 | $10 |
| GPT‑6 Sol | $2 | $0,20 | $2,50 | $10 |
| GPT‑6 Astra | $10 | $1 | $12,50 | $50 |
| GPT‑6 Luna | $0,10 | $0,01 | $0,125 | $0,50 |
Aux tarifs standard d’entrée et de sortie, Sol coûte cinq fois moins cher qu’Astra, et l’entrée mise en cache coûte dix fois moins cher. En revanche, par rapport à GPT‑6 Sol, la nouvelle version n’est pas moins chère pour l’entrée et la sortie standard : son avantage tarifaire concerne l’entrée mise en cache, dont le prix a été divisé par deux. Luna coûte bien moins cher que les trois autres, mais son faible prix ne dit rien, à lui seul, sur sa capacité à résoudre une tâche complexe. Ces tarifs figurent dans la grille tarifaire de l’API OpenAI.
Combien coûte une même tentative
Pour illustrer, prenons une requête hypothétique : 20 000 nouveaux jetons d’entrée, 80 000 jetons mis en cache et 10 000 jetons de sortie. Supposons que le cache ait fonctionné ; nous ne tenons pas compte de l’écriture du cache, des appels d’outils ni des nouvelles tentatives.
| Modèle | Calcul | Coût |
|---|---|---|
| GPT‑6.1 Sol | $0,040 + $0,008 + $0,100 | $0,148 |
| GPT‑6 Sol | $0,040 + $0,016 + $0,100 | $0,156 |
| GPT‑6 Astra | $0,200 + $0,080 + $0,500 | $0,780 |
| GPT‑6 Luna | $0,002 + $0,0008 + $0,005 | $0,0078 |
Avec cette composition de requête, une tentative avec Sol coûte environ 5,3 fois moins cher qu’avec Astra. Par rapport à GPT‑6 Sol, l’écart est de $0,008, soit environ 5,1 % du coût de la tentative. Il s’agit d’un exemple arithmétique, pas d’une mesure d’une tâche Codex typique : les modèles peuvent différer par leur consommation de jetons, le nombre d’appels d’outils et le nombre de nouvelles tentatives.
Il existe également un seuil tarifaire : pour les requêtes dont le contexte dépasse 272 000 jetons d’entrée, les tarifs d’entrée et de cache doublent, tandis que celui de sortie est multiplié par 1,5, pour l’ensemble de la requête. Le calcul ci-dessus ne convient donc pas aux contextes longs sans ajustement ; les conditions sont précisées sur la page du modèle GPT‑6.1 Sol.
Ce que la comparaison avec Astra confirme exactement
Dans l’annonce de GPT‑6.1 Sol, OpenAI affirme que Sol a atteint la parité avec Astra sur DeepSWE v1.1, un test de tâches d’ingénierie complexes dans des bases de code réelles, pour environ un cinquième du coût. La formulation exacte est donc : « sur DeepSWE v1.1, selon OpenAI ».
Sur OSWorld 2.0, qui évalue l’exécution de tâches sur ordinateur, Sol a obtenu un résultat inférieur de 2,1 points de pourcentage à celui d’Astra au niveau de raisonnement maximal. Selon OpenAI, le coût par tâche était environ sept fois inférieur. L’entreprise précise que ses évaluations ont été menées dans un environnement de recherche ou via l’API et que les résultats peuvent différer dans les interfaces de production, en raison des instructions système, des outils et des paramètres.
Il s’agit de résultats publiés par le fournisseur lui-même, et non d’une évaluation indépendante des modèles dans un même flux de travail Codex. Les documents examinés pour cet article ne fournissent pas de test indépendant comparable de Sol et d’Astra sur les mêmes tâches Codex.
Ce qu’en disent les développeurs
Les premières discussions après le lancement incitent à tester le modèle dans son propre environnement, mais ne constituent pas une évaluation représentative. Dans un fil Reddit sur la vitesse et la consommation de la limite, des utilisateurs se plaignent d’une génération lente. Un auteur indique qu’une action simple ou la compression du contexte lui prenait au moins deux minutes. Ce sont des observations isolées, sans tâches identiques ni conditions contrôlées.
Dans une autre discussion sur la vitesse de Sol, les avis divergent : certains jugent la génération lente problématique, tandis que d’autres soulignent que la vitesse de production des jetons ne suffit pas à déterminer la durée totale d’une tâche. Ce sont des mesures différentes, et le fil ne fournit de mesure contrôlée d’aucune d’elles.
On trouve également un retour négatif isolé sur une tentative de création d’une démo de jeu : l’auteur indique que le modèle a omis des exigences et n’a pas corrigé des défauts importants après des précisions. Cela ne mesure pas la qualité générale du modèle et ne le compare pas directement à Astra.
Enfin, dans une issue GitHub sur le choix du modèle dans l’extension VS Code, un utilisateur a signalé le 30 septembre que Sol était visible dans Codex sur ordinateur, mais absente de la liste des modèles de l’extension sous Windows. Ce témoignage décrit une configuration précise ; il n’établit ni la cause ni l’ampleur du problème.
Les auteurs vérifiables de ces publications utilisent des pseudonymes ; aucune citation directe attribuée à un nom réel confirmé n’est donc présentée ici. La conclusion pratique tirée de ces premiers retours est plus modeste : il faut mesurer séparément la qualité, le temps d’achèvement de la tâche et la consommation de la limite.
Chronologie succincte
- 3 septembre 2026. OpenAI présente GPT‑6 Astra.
- 22 septembre 2026. GPT‑6 Sol et GPT‑6 Luna sont lancées dans l’API.
- 29 septembre 2026. OpenAI annonce la sortie de GPT‑6.1 Sol pour l’API, ChatGPT Work et Codex.
- 30 septembre 2026. Un message paraît sur GitHub au sujet de l’absence de Sol dans la liste des modèles de l’extension VS Code sous Windows.
Les dates de lancement figurent dans le journal des modifications de l’API OpenAI, et le signalement concernant VS Code dans une discussion GitHub précise. Cette chronologie est préliminaire et ne constitue pas une évaluation de la disponibilité du modèle pour tous les utilisateurs.
Quand choisir Sol et quand choisir Astra
Pour les abonnements Plus et Standard Business, OpenAI indique une fourchette indicative de 15 à 160 messages locaux par fenêtre de cinq heures pour Sol et de 5 à 45 pour Astra. Il ne s’agit pas d’un nombre de tâches garanti : la consommation dépend du modèle, de la tâche et des paramètres ; les tâches dans le cloud peuvent consommer davantage de la limite, et des plafonds hebdomadaires peuvent également s’appliquer. Ces estimations ne doivent pas être transformées en coefficient d’économie ni comparées directement aux tarifs API ; les conditions sont détaillées dans le guide sur les limites de Work et Codex.
Le choix pratique dépend du coût d’une erreur et du temps d’attente :
- Sol mérite d’être testée sur des tâches répétitives dont le résultat est facile à vérifier, par exemple lorsqu’il existe des tests et des critères d’acceptation clairs. Ses tarifs API standard sont nettement inférieurs à ceux d’Astra.
- Astra peut être conservée pour les tâches complexes ou risquées, où la qualité du résultat compte davantage que le coût d’une tentative. Il faut vérifier en pratique dans quelle mesure elle réussit mieux les tâches propres à une équipe.
- Luna peut convenir à des opérations simples et répétitives si sa qualité est suffisante. Le prix minimal des jetons ne prouve pas qu’un travail complexe coûtera moins cher avec ce modèle.
Pour comparer, lancez le même petit ensemble de tâches sur les modèles et définissez à l’avance le résultat jugé acceptable : réussite des tests, respect des exigences et approbation lors de la revue, par exemple. Notez le nombre de tentatives, la consommation de jetons, les appels d’outils et le temps nécessaire pour obtenir un correctif prêt. Vous évaluerez ainsi le coût du résultat, et non celui de la réponse.
Verdict : Sol coûte effectivement cinq fois moins cher qu’Astra pour les jetons API standard d’entrée et de sortie ; selon OpenAI, elle obtient un résultat équivalent sur un test de codage agentique. Mais les preuves d’une parité générale dans Codex sont insuffisantes. Dans le cadre d’un abonnement, les économies sur l’API ne s’appliquent pas directement, et les premiers retours des développeurs restent dispersés et contradictoires. Sol est une candidate crédible pour réduire les coûts, mais son remplacement éventuel d’Astra dépendra de la façon dont les deux modèles se comportent sur les tâches propres à chaque équipe.