Un usuario de Reddit se pasó a Codex para sus proyectos personales, pero siguió usando Claude Code en el trabajo. Su principal queja tenía que ver con la interfaz de la extensión de Claude Code para VS Code: en particular, con la forma en que muestra las llamadas a herramientas y los subagentes. En otro debate, los desarrolladores describieron cómo usan un agente para hacer cambios y otro para revisarlos. Son experiencias individuales, no resultados de pruebas: las condiciones de los participantes son distintas y la utilidad de la revisión cruzada no se midió de forma independiente en esas historias. Pero sugieren una pregunta práctica: ¿qué herramienta encaja mejor con tu flujo de trabajo y cómo puedes comprobarlo? El autor de la primera publicación habla específicamente de la extensión para VS Code, mientras que los participantes del segundo debate comparten distintas formas de trabajar con varios agentes.
Estas opiniones son útiles como pistas sobre qué aspectos observar: la interfaz, la revisión de cambios, los límites y el consumo. Pero no determinan qué agente escribe mejor código. Para elegir, conviene separar las impresiones personales de los datos más sistemáticos y comparar las herramientas y condiciones que realmente piensas usar.
Compara tanto el entorno como las herramientas
Claude Code y Codex suelen presentarse como dos alternativas para el mismo producto. Sin embargo, los resultados de una comparación no dependen solo del modelo: también importa si ejecutas la herramienta en el terminal, en un editor o en un entorno en la nube.
El 4 de febrero de 2026, GitHub anunció la versión preliminar pública de Claude y Codex en Agent HQ. A través de GitHub, puedes asignar una tarea a un agente y luego recibir un pull request para revisarlo. Pero una interfaz común no convierte este escenario en una comparación de laboratorio: los modelos, la configuración y el entorno de ejecución pueden variar. Tampoco equivale a ejecutar Claude Code o Codex localmente.
Según la documentación de GitHub sobre agentes de terceros, las sesiones consumen minutos de GitHub Actions y créditos de IA; el coste depende del modelo y de la cantidad de tokens procesados. Por eso, una queja sobre una extensión concreta no tiene por qué aplicarse a todas las formas de usar Claude Code, y una sesión en la nube satisfactoria no garantiza que la misma herramienta sea adecuada para el trabajo diario en un editor.
Qué muestran los datos sobre los pull requests
En un estudio publicado en 2026, los autores analizaron 7 156 pull requests de cinco agentes. Observaron que la proporción de cambios aceptados depende del tipo de tarea: por ejemplo, Claude Code obtuvo buenos resultados en documentación y funciones nuevas, mientras que Codex destacó en varias categorías, incluidas las correcciones y la refactorización. Los autores no encontraron ningún agente que liderara de forma sistemática en todas las categorías. Los detalles aparecen en el estudio sobre la aceptación de pull requests.
Estos resultados no responden a la pregunta de qué producto funcionará mejor en tu repositorio. El trabajo se basa en pull requests públicos creados en un periodo anterior, no en una prueba controlada de versiones actuales bajo las mismas condiciones. La muestra de Claude Code fue considerablemente menor que la de Codex: 139 pull requests frente a 2 002. Además, que se acepte un pull request no equivale a la calidad del código: los autores señalan que el repositorio, la experiencia del usuario y otros factores no controlados pueden influir en el resultado.
El estudio es útil no como una clasificación, sino como recordatorio de que los resultados pueden depender de la tarea. Para averiguar qué te conviene, vale la pena probar las herramientas con el trabajo que realmente haces.
Los límites no son una única medida
En un debate de Reddit sobre límites, el autor pidió comparar cuánto tiempo de uso práctico ofrecían distintos planes y modelos. Las respuestas variaron: por ejemplo, un participante prefirió Codex en el nivel más económico y Claude en los planes más caros. Son valoraciones personales, no mediciones realizadas con las mismas tareas y configuración. El debate sobre los límites no demuestra qué servicio ofrece más por el precio.
Además, «límite» puede referirse a una restricción de unas horas, a una cuota semanal o a la impresión subjetiva de que una suscripción alcanza para la carga de trabajo habitual. El 6 de mayo de 2026, Anthropic anunció un aumento de los límites de cinco horas de Claude Code para varios planes y la eliminación de la reducción de límites en horas punta para Pro y Max. Es un cambio concreto en las condiciones, pero no responde a cuánto trabajo podrá hacer cada usuario en comparación con Codex.
Al comparar por tu cuenta, anota el plan, el modelo, la configuración y la forma de ejecución. Si una herramienta se ejecuta localmente y otra a través de GitHub Agent HQ, las diferencias de consumo pueden deberse tanto a las condiciones del entorno como al agente.
Cómo comparar herramientas en tu repositorio
Elige varias tareas similares a las que haces a diario: corregir un error, hacer un pequeño cambio en una función y actualizar la documentación. Dale a cada herramienta la misma descripción de la tarea y un acceso comparable al repositorio. Anota los modelos y la configuración elegidos.
Después, evalúa no solo el resultado, sino también el trabajo que te llevó revisarlo:
- ¿Pasaron las pruebas existentes? ¿Qué comprobaciones tuviste que ejecutar o añadir manualmente?
- ¿Cuántas veces tuviste que aclarar la tarea o intervenir en los cambios?
- ¿Qué tan fácil fue entender y revisar el diff?
- ¿Cuánto tiempo llevó el trabajo y qué cuotas o créditos consumió?
- ¿Hubo cambios innecesarios, requisitos omitidos o errores?
No reduzcas tareas de distintos tipos a una sola puntuación sin explicar el criterio. Si quieres probar un flujo en el que un agente hace los cambios y otro los revisa, evalúalo como un proceso aparte: registra el tiempo y el consumo adicionales, y comprueba por tu cuenta las observaciones del revisor. Las experiencias de los usuarios pueden sugerir esta opción, pero no demuestran que sea más fiable o económica.
Es mejor elegir entre Claude Code y Codex no por una votación ni por una sola historia de alguien que se cambió de herramienta. Prueba ambas con tus tareas, en el entorno que necesitas y teniendo en cuenta las limitaciones reales de tu plan. Esta prueba no dará una respuesta universal para todos los equipos, pero te ayudará a saber qué opción se adapta a tu flujo de trabajo.