Un utilisateur de Reddit est passé à Codex pour ses projets personnels, mais a continué à utiliser Claude Code au travail. Sa critique portait principalement sur l’interface de l’extension Claude Code pour VS Code, notamment sur la façon dont elle affiche les appels d’outils et les sous-agents. Dans une autre discussion, des développeurs expliquaient utiliser un agent pour apporter des modifications et un autre pour les vérifier. Il s’agit d’expériences individuelles, et non de résultats de tests : les conditions varient d’un participant à l’autre et l’utilité de la revue croisée n’a pas été mesurée indépendamment dans ces témoignages. Mais ils suggèrent une question pratique : quel outil convient le mieux à votre flux de travail, et comment le vérifier ? L’auteur du premier post parle précisément de l’extension pour VS Code, tandis que les participants à la deuxième discussion partagent différentes façons de faire travailler des agents ensemble.
Ces témoignages donnent des pistes sur les aspects à examiner : l’interface, la vérification des modifications, les limites et la consommation. Mais ils ne permettent pas de déterminer quel agent écrit le mieux le code. Pour faire votre choix, distinguez les impressions personnelles des données plus systématiques et comparez les outils et les conditions que vous comptez réellement utiliser.
Comparez l’environnement, pas seulement les outils
Claude Code et Codex sont souvent présentés comme deux variantes d’un même produit. Pourtant, les résultats d’une comparaison ne dépendent pas uniquement du modèle : le fait d’utiliser l’outil dans un terminal, un éditeur ou un environnement cloud compte également.
Le 4 février 2026, GitHub a annoncé l’aperçu public de Claude et Codex dans Agent HQ. Depuis GitHub, vous pouvez confier une tâche à un agent, puis recevoir une pull request à examiner. Mais une interface commune ne transforme pas ce scénario en comparaison en laboratoire : les modèles, les paramètres et l’environnement d’exécution peuvent différer. Ce n’est pas non plus la même chose que d’exécuter Claude Code ou Codex en local.
Selon la documentation de GitHub sur les agents tiers, les sessions consomment des minutes GitHub Actions et des crédits d’IA ; les coûts dépendent du modèle et du nombre de jetons traités. Une critique visant une extension précise ne s’applique donc pas nécessairement à toutes les façons d’utiliser Claude Code, et une session cloud réussie ne garantit pas que le même outil conviendra à votre travail quotidien dans un éditeur.
Ce que montrent les données sur les pull requests
Dans une étude publiée en 2026, les auteurs ont analysé 7 156 pull requests créées par cinq agents. Ils ont constaté que le taux d’acceptation des modifications dépendait du type de tâche : par exemple, Claude Code a obtenu de bons résultats pour la documentation et les nouvelles fonctionnalités, tandis que Codex s’est distingué dans plusieurs catégories, notamment les corrections et la refactorisation. Les auteurs n’ont identifié aucun agent qui domine systématiquement dans toutes les catégories. Les détails figurent dans l’étude sur l’acceptation des pull requests.
Ces résultats ne répondent pas à la question de savoir quel produit est le meilleur dans votre dépôt. L’étude porte sur des PR publiques créées au cours d’une période antérieure, et non sur un test contrôlé de versions actuelles dans des conditions identiques. L’échantillon de Claude Code était nettement plus petit que celui de Codex : 139 PR contre 2 002. De plus, l’acceptation d’une PR n’équivaut pas à la qualité du code : les auteurs signalent que le dépôt, l’expérience de l’utilisateur et d’autres facteurs non contrôlés peuvent influencer le résultat.
Cette étude est moins un classement qu’un rappel : les résultats peuvent dépendre de la tâche. Pour déterminer ce qui vous convient, testez les outils sur le travail que vous effectuez réellement.
Les limites ne se résument pas à un seul indicateur
Dans une discussion Reddit sur les limites, l’auteur a demandé de comparer la durée d’utilisation pratique offerte par différents forfaits et modèles. Les réponses divergeaient : par exemple, un participant préférait Codex avec une formule d’entrée de gamme et Claude avec une formule plus chère. Ce sont des avis personnels, et non des mesures effectuées sur des tâches et des paramètres identiques. La discussion sur les limites ne prouve pas quel service est le plus avantageux.
En outre, une « limite » peut désigner une restriction de quelques heures, un quota hebdomadaire ou l’impression subjective qu’un abonnement suffit pour une charge de travail habituelle. Le 6 mai 2026, Anthropic a annoncé une hausse des limites de cinq heures de Claude Code pour plusieurs formules, ainsi que la fin de la réduction des limites aux heures de pointe pour Pro et Max. Il s’agit d’une modification concrète des conditions, pas d’une réponse à la question de la quantité de travail dont chaque utilisateur dispose par rapport à Codex.
Pour votre propre comparaison, notez la formule, le modèle, les paramètres et le mode d’exécution. Si un outil fonctionne en local et l’autre via GitHub Agent HQ, les écarts de consommation peuvent venir non seulement de l’agent, mais aussi des conditions propres à l’environnement.
Comment comparer les outils dans votre dépôt
Choisissez quelques tâches représentatives de votre travail quotidien : corriger un bug, apporter une petite modification à une fonctionnalité et mettre à jour la documentation. Donnez à chaque outil la même description de tâche et un accès comparable au dépôt. Notez les modèles et les paramètres choisis.
Évaluez ensuite non seulement le résultat, mais aussi le travail nécessaire pour le vérifier :
- Les tests existants ont-ils réussi ? Quelles vérifications avez-vous dû lancer ou ajouter manuellement ?
- Combien de fois avez-vous dû préciser la tâche ou intervenir sur les modifications ?
- Dans quelle mesure le diff était-il facile à comprendre et à vérifier ?
- Combien de temps le travail a-t-il pris et quels quotas ou crédits a-t-il consommés ?
- Y a-t-il eu des modifications superflues, des exigences oubliées ou des erreurs ?
Ne ramenez pas des tâches de types différents à une seule note sans explication. Si vous voulez essayer une méthode où un agent apporte les modifications et un autre les vérifie, considérez-la comme un processus distinct : notez le temps et la consommation supplémentaires, puis vérifiez vous-même les remarques du réviseur. Les témoignages d’utilisateurs peuvent suggérer cette approche, mais ne prouvent pas qu’elle soit plus fiable ou plus économique.
Pour choisir entre Claude Code et Codex, mieux vaut ne pas se fier à un vote ni à un seul témoignage de changement d’outil. Testez les deux sur vos tâches, dans l’environnement souhaité et en tenant compte des limites réelles de votre formule. Ce test ne donnera pas de réponse universelle pour toutes les équipes, mais vous aidera à déterminer quelle option convient à votre flux de travail.