jsonscraper

Claude Code oder Codex: Vergleichen Sie Ihre Arbeit, nicht die Marke

So wählen Sie zwischen zwei Agenten anhand Ihrer Aufgaben, der Laufzeitumgebung und tatsächlicher Nutzungslimits.

Ein Reddit-Nutzer wechselte für persönliche Projekte zu Codex, verwendete bei der Arbeit aber weiterhin Claude Code. Seine Kritik bezog sich vor allem auf die Oberfläche der Claude-Code-Erweiterung für VS Code, insbesondere darauf, wie dort Tool-Aufrufe und Subagenten dargestellt werden. In einer anderen Diskussion beschrieben Entwickler, wie sie einen Agenten für Änderungen und einen zweiten zur Überprüfung einsetzen. Das sind einzelne Nutzererfahrungen, keine Testergebnisse: Die Bedingungen unterscheiden sich, und der Nutzen der gegenseitigen Überprüfung wurde in diesen Berichten nicht unabhängig gemessen. Sie legen aber eine praktische Frage nahe: Welches Tool passt besser zu Ihrem Arbeitsablauf – und wie können Sie das überprüfen? Der erste Beitrag behandelt konkret die VS-Code-Erweiterung, während Teilnehmer der zweiten Diskussion verschiedene Möglichkeiten beschreiben, Agenten gemeinsam einzusetzen.

Mann bei der Arbeit
Sanni Sahil

Solche Erfahrungsberichte sind nützliche Hinweise darauf, worauf man achten sollte: Benutzeroberfläche, Überprüfung von Änderungen, Limits und Verbrauch. Sie belegen jedoch nicht, welcher Agent besser programmiert. Für die Entscheidung sollten Sie persönliche Eindrücke von systematischeren Daten trennen und die Tools unter den Bedingungen vergleichen, unter denen Sie sie tatsächlich einsetzen möchten.

Vergleichen Sie nicht nur die Tools, sondern auch die Umgebung

Claude Code und Codex werden oft als zwei Varianten desselben Produkts diskutiert. Das Ergebnis eines Vergleichs hängt jedoch nicht nur vom Modell ab: Es macht einen Unterschied, ob Sie das Tool im Terminal, im Editor oder in einer Cloud-Umgebung ausführen.

Am 4. Februar 2026 kündigte GitHub die öffentliche Vorschau von Claude und Codex in Agent HQ an. Über GitHub können Sie einem Agenten eine Aufgabe zuweisen und anschließend einen Pull Request zur Überprüfung erhalten. Eine gemeinsame Oberfläche macht dieses Szenario jedoch nicht zu einem Labortest: Modelle, Einstellungen und Laufzeitumgebungen können sich unterscheiden. Außerdem ist das nicht dasselbe, wie Claude Code oder Codex lokal auszuführen.

Laut der aktuellen Dokumentation von GitHub zu Drittanbieter-Agenten verbrauchen Sitzungen GitHub-Actions-Minuten und AI-Credits; die Kosten hängen vom Modell und der Anzahl der verarbeiteten Tokens ab. Eine Beschwerde über eine bestimmte Erweiterung lässt sich daher nicht unbedingt auf alle Einsatzweisen von Claude Code übertragen. Umgekehrt garantiert eine erfolgreiche Cloud-Sitzung nicht, dass sich dasselbe Tool für die tägliche Arbeit im Editor eignet.

Was die Daten zu Pull Requests zeigen

In einer 2026 veröffentlichten Studie analysierten die Autoren 7.156 Pull Requests von fünf Agenten. Sie stellten fest, dass der Anteil angenommener Änderungen von der Art der Aufgabe abhing: Claude Code schnitt beispielsweise bei Dokumentation und neuen Funktionen gut ab, während Codex in mehreren Kategorien, darunter Fehlerbehebungen und Refactoring, gute Ergebnisse erzielte. Die Autoren fanden keinen Agenten, der in allen Kategorien durchgehend führend war. Einzelheiten enthält die Studie zur Annahme von Pull Requests.

Diese Ergebnisse beantworten nicht die Frage, welches Produkt in Ihrem Repository besser ist. Die Arbeit basiert auf öffentlichen PRs aus einem früheren Zeitraum und nicht auf einem kontrollierten Test aktueller Versionen unter gleichen Bedingungen. Die Stichprobe für Claude Code war deutlich kleiner als die für Codex: 139 PRs gegenüber 2.002. Außerdem ist die Annahme eines PRs nicht gleichbedeutend mit Codequalität: Die Autoren weisen darauf hin, dass Repository, Nutzererfahrung und andere nicht kontrollierte Faktoren das Ergebnis beeinflussen können.

Die Studie ist keine Rangliste, sondern eine Erinnerung daran, dass das Ergebnis von der Aufgabe abhängen kann. Um herauszufinden, was für Sie passt, sollten Sie die Tools an den Aufgaben testen, die Sie tatsächlich erledigen.

Limits sind keine einheitliche Kennzahl

In einer Reddit-Diskussion über Nutzungslimits bat der Verfasser darum, zu vergleichen, wie viel praktische Nutzungszeit verschiedene Tarife und Modelle bieten. Die Antworten gingen auseinander: Ein Teilnehmer bevorzugte beispielsweise Codex im günstigeren Tarif, Claude dagegen in einem teureren. Das sind persönliche Einschätzungen, keine Messungen mit identischen Aufgaben und Einstellungen. Die Diskussion über Nutzungslimits beweist nicht, welcher Dienst das bessere Preis-Leistungs-Verhältnis bietet.

Außerdem kann „Limit“ eine Beschränkung für einige Stunden, ein Wochenkontingent oder den subjektiven Eindruck bezeichnen, dass ein Abo für die übliche Arbeitslast ausreicht. Am 6. Mai 2026 teilte Anthropic eine Erhöhung der Fünf-Stunden-Limits für Claude Code bei mehreren Tarifen mit und gab bekannt, die Beschränkung während der Spitzenzeiten für Pro und Max aufzuheben. Das ist eine konkrete Änderung der Nutzungsbedingungen, beantwortet aber nicht die Frage, wie viel Arbeit einzelne Nutzer im Vergleich zu Codex erledigen können.

Notieren Sie bei Ihrem eigenen Vergleich den Tarif, das Modell, die Einstellungen und die Startumgebung. Wenn ein Tool lokal und das andere über GitHub Agent HQ läuft, können die Verbrauchsunterschiede nicht nur am Agenten, sondern auch an den Bedingungen der Umgebung liegen.

So vergleichen Sie die Tools in Ihrem Repository

Wählen Sie mehrere Aufgaben aus, die Ihrer täglichen Arbeit ähneln: einen Fehler beheben, eine kleine Funktion ändern und die Dokumentation aktualisieren. Geben Sie jedem Tool dieselbe Aufgabenbeschreibung und einen vergleichbaren Zugriff auf das Repository. Notieren Sie die ausgewählten Modelle und Einstellungen.

Bewerten Sie anschließend nicht nur das Ergebnis, sondern auch den Aufwand für die Überprüfung:

  • Wurden die vorhandenen Tests bestanden? Welche Prüfungen mussten Sie manuell ausführen oder hinzufügen?
  • Wie oft mussten Sie die Aufgabe präzisieren oder in die Änderungen eingreifen?
  • Wie leicht lässt sich der Diff nachvollziehen und überprüfen?
  • Wie lange dauerte die Arbeit, und welche Kontingente oder Credits wurden verbraucht?
  • Gab es unnötige Änderungen, übersehene Anforderungen oder Fehler?

Fassen Sie Aufgaben unterschiedlicher Art nicht ohne Erläuterung zu einer einzigen Punktzahl zusammen. Wenn Sie einen Ablauf ausprobieren möchten, bei dem ein Agent Änderungen vornimmt und ein anderer sie überprüft, betrachten Sie ihn als eigenständigen Prozess: Halten Sie den zusätzlichen Zeit- und Ressourcenaufwand fest und prüfen Sie die Anmerkungen des Reviewers selbst. Nutzerberichte können auf diese Möglichkeit hinweisen, beweisen aber nicht, dass sie zuverlässiger oder kostengünstiger ist.

Am besten entscheiden Sie sich zwischen Claude Code und Codex nicht aufgrund einer Abstimmung oder eines einzelnen Berichts über einen Wechsel. Testen Sie beide Tools mit Ihren Aufgaben, in der benötigten Umgebung und unter Berücksichtigung der tatsächlichen Tariflimits. Ein solcher Test liefert keine allgemeingültige Antwort für alle Teams, hilft Ihnen aber herauszufinden, welche Option zu Ihrem Arbeitsablauf passt.

Ähnliche Beiträge

Vom Artikel zur funktionierenden Integration

Entdecke die Social-Data-APIs von jsonscraper, teste Anfragen und entwickle deinen nächsten Workflow.

APIs entdecken