Skip to main content

Agenten?

Ich werde den aktuellen Stand von Coding-Agents recherchieren, denn diese Landschaft bewegt sich schnell und wir sind jetzt mitten im Jahr 2026. Deine OpenAI-kompatible Multi-Model-Setup-Umgebung ist eine zentrale Einschränkung, also konzentriere ich mich auf Tools, die benutzerdefinierte Endpunkte unterstützen.
Ich hole mir Details aus ein paar der inhaltlich wichtigsten Vergleiche und bestätige den aktuellen Stand der Benchmarks.

Basierend auf aktuellerder aktuellen Recherche (Mitte 2026) ist dassieht die Landschaft so aus — speziell gefiltert genau für deine Situation, denn genau das ist der entscheidende Faktor:entscheidend: Du hast einen einzelnen OpenAI-kompatiblen Endpunkt mit vielen Modellen dahinter. Diese Einschränkung eliminiertschließt viele sonst sehr gute Tools aus oder priorisiertstuft sehrsie viele ansonsten großartige Tools herausherunter und hebt die Bring-Your-Own-Modelyour-own-model“-Tools (BYOM)-Ansätze stark nach oben. 🚀


Zuerst die Kernrahmung:wichtigste Einordnung: Agent = Modell + Harness 🧱Gerüst

Die wichtigste Erkenntnis aus der aktuellen Recherche ist, dass das Gerüst (Harness) mindestens genauso wichtig ist wie das Modell. In einem Test imvom Februar 2026 lieferteerzielte dasselbe Modell (Opus 4.5), einmaldas durchüber drei verschiedene Agent-Agenten-Frameworks geflogen,lief, eineeinen DifferenzUnterschied von 17 Problemen aufin einereinem 731-ProblemmengeDatensatz mit 731 Problemen — ein Abstand so groß wie eine Lückekomplette inModellgeneration. der Größenordnung einer kompletten Modell-Generation. Daher ist deineDeine Wahl des HarnessGerüsts ist also nicht kosmetisch;nur sieKosmetik, sondern bestimmt direkt die Ausgabequalität.Qualität der Ergebnisse.

Da du die Modelle selbst bereitstellst, lautet diedeine zentraleeigentliche FrageEntscheidung im Kern:also: Welches HarnessGerüst nutzt einen benutzerdefinierten OpenAI-kompatiblen Endpunkt mit mehreren Modellen am besten aus?


Das komplettegesamte Feld –Feld, nach PassformEignung für dein Setup gruppiert

TierStufe A — Beste PassformWahl für dich (native BYOM, Multi-Model,Modell, OpenAI-kompatibel) ✅

Diese Tools lassen dich auf eineine Custombenutzerdefinierte base_url zeigen, deinen KeySchlüssel einsteckeneintragen und verschiedene Modelle verschiedenen Rollen zuweisen. DasGenau das ist exakt dein Use Case.Anwendungsfall.

Tool Formfaktor Warum es zu dir passt
Cline VS VS-Code-Erweiterung ~5MCa. 5 Mio. Installationen; explizite Konfiguration für „OpenAI Compatible“ (Base Basis-URL + KeySchlüssel + Model-Modell-IDs). Plan/ActDer Plan-/Act-Modus trennt Architect-Architekt- und Coder-Rollen perfekt, um Opus fürsfür Planendie Planung und Sonnet für die UmsetzungAusführung zuzuweisen. KeineKein Inferenz-„Markup“-Sonderwege.Aufschlag.
Roo Code VS VS-Code-Erweiterung (Cline-Fork) RufHat alsden Ruf, bei großen Änderungen über viele Dateien hinweg am zuverlässigsten beizu großen, mehrdateiigen Änderungen.sein. Mehr Konfigurationshebel,Konfigurationsmöglichkeiten, eigenebenutzerdefiniertemodes“Modi“ (Rollen), die du an bestimmte Modelle bindest.binden Sehrkannst. starkKlassenbeste Lösung für das von dir beschriebene Biggroße Project“Projekt“-Problem, das du beschrieben hast.Problem.
Aider CLI / git-Git-nativ Sehr stark beiAusgezeichnetes Repo-Mapping, atomarenatomare git-Git-Commits, funktioniert mit jedem OpenAI-kompatiblen Modell. Integrierter „architectArchitect mode“Mode“, der ein starkes Reasoning-Modell fürsfür Planendie nutztPlanung und ein günstigeres Modell,Modell umzum denSchreiben Diffdes zuDiffs schreibennutzt — also genau das Multi-Model-Modell-Muster, das ich obenvorher beschrieben habe, outsofort of the box.einsatzbereit.
OpenHands (früher OpenDevin) Self-hostedSelbst gehosteter autonomer Agent MIT-lizensiert,lizenziert, 100+über 100 Backends, jede OpenAI-kompatible API. LäuftFührt eineeinen komplettevollständigen CodeAct-SchleifeZyklus aus (Code ausführen, Tests laufen lassen, browsen) in einemeiner Docker-Sandbox. 72%72 % auf SWE-bench Verified. AmDie autonomstenautonomste Option unter den BYOM-Optionen.Tools.
Kilo Code VS VS-Code-Erweiterung EntwickeltHolt sichschnell schnell;auf; Fokusfokussiert auf engesenge Kontext-HandlingKontextkontrolle und strukturierte Modes;Modi; dokumentiertdokumentierte SupportUnterstützung für benutzerdefinierte OpenAI-kompatible Provider.

TierStufe B — Sehr guteHervorragende Tools, aber holprig mit deinem Endpunkt etwas umständlich

  • Claude Codederzeit der aktuelle LeaderSpitzenreiter bei Code-Qualitätder Codequalität (Opus 4.7/4.8), mit Selbst-VerifikationSelbstverifikation (schreibt Tests, führt sie aus, behebt Fehler,Fehler bevorvor erder zurückantwortet)Antwort). Aber es ist auf Anthropic’sdie eigene API/SubscriptionAPI gebaut;bzw. Routingdas eigene Abo von Anthropic ausgelegt; es über ein beliebiges OpenAI-kompatibles Gateway zu leiten, ist eher „Kampf“,ein keinKampf Feature.als ⚠️eine Funktion.
  • OpenAI Codex CLI — aktuell #1 beiauf Terminal-Bench (GPT-5.5, 82,7%7 %), sehr stark für DevOps/DevOps- und Terminal-Workflows. An OpenAI-APIs/OpenAIs API bzw. ChatGPT-Pläne gebunden; eineine Custom-benutzerdefinierte Base-URL-OverrideURL war historisch eher eine gewünschte, aber begrenzt unterstützteeingeschränkte Funktion.
  • Cursordasdie meistgeliebtebeliebteste AI-IDE-Tool,KI-IDE, model-agnostischmodellagnostisch innerhalb seinerihrer eigenen unterstützten ModelllisteListe (Opus 4.7, GPT-5.5, Gemini 3.1), aber es ist sein eigener Editor undsie akzeptiert keinennicht sauber einen beliebigen Drittanbieter-EndpunktEndpunkt. sauber. Außerdem:Außerdem nur VSals VS-Code-Fork.
  • GitHub Copilot — inzwischen Multi-ModelModell und 2026 mit Base-URL-Override, aber primäreher auf Enterprise/Enterprise-/Compliance-DefaultsStandards ausgelegt,ausgerichtet plusund Wechselmit einem Abrechnungsmodell auf Usage-CreditsBasis alsvon Billing-Modell.Nutzungsguthaben unterwegs. Weniger natürlich für ein reines Custom-Gateway-Setup.

TierStufe C — Autonom/NischenbereichAutonom / Nische

  • Devin 2.0 — vollständig gesandboxterisolierter Cloud-Engineer;Ingenieur; stark bei klar abgegrenzten Aufgaben (Migrations,Migrationen, Test-Coverage)Testabdeckung), schwachschwächer bei mehrdeutigen.mehrdeutigen NichtAufgaben. Kein BYOM.
  • Augment Code — herausragende Repository-Kontext-Engine (indexiertindiziert das ganze Repo,Repo bevorvor esdem startet)Start), über MCP verfügbar,nutzbar, sodass du esdie nebenIndizierung zusammen mit einem anderen Generator nutzenverwenden könntest. Enterprise-Preise.Preislich eher Enterprise.

Meine Empfehlung für dich 🎯

AufgrundMit deinesdeinem OpenAI-kompatiblen Multi-Model-GatewaysModell-Gateway und deinesdeinem ZielsZiel von großen Projekten, die deutlich über einen einzelnen Prompt hinausgehen, würde ich eineinen layeredmehrschichtigen BYOM-SetupStack bauen:aufsetzen:

1. Primärer Treiber:Hauptwerkzeug: Roo Code (oder Cline) 💪

Das ist dein Haupt-Workhorse.wichtigstes Arbeitstool. Gründe:

  • NativeNativer „OpenAI Compatible“-Provider — Gateway-URL/Keydu kannst die URL und den Schlüssel deines Gateways direkt einstecken.eintragen.
  • CustomBenutzerdefinierte modesModi, mitdie verschiedenenan Modellenverschiedene Modelle gebunden sind — das ist der Killer-Use-Case für dich.dich Konfigurieren:die entscheidende Funktion. Konfiguriere:
    • Architect/Plan modePlan-Modus → Opus (oder GPT-5.5) für ZersetzungZerlegung und Design.
    • Code modeCode-Modus → Claude Sonnet für den Großteil der UmsetzungImplementierung (schnell, günstig, stark).
    • Debug/Review modeReview-Modus → ein anderes starkes Modell als dasder Autor-ModellAutor, für Reviewmodellübergreifendes über Modellgrenzen hinweg.Review.
  • Zuverlässig bei Multi-File,Änderungen Long-Horizon-Änderungenüber viele Dateien und mit langem Horizont — genau das, was große Projekte brauchen.
  • Läuft in VS Code, damitsodass du Diffs, Review und dieden SchleifeLoop eng integriert bekommst.hast.

Nimm Cline nimmst du,, wenn du eine etwas einfachere, polierterundere Erfahrung willst;möchtest; nimm Roo Code, wenn du maximalmaximale Kontrolle und Zuverlässigkeit bei großen RefactorsRefactorings willst (seinedas ist sein Haupt-Referenz)Ruf).

2. GroßeSchwere RefactorsRefactorings / CLI-Puristen:Fans: Aider 🧰

Behalte Aider behältst du in deiner Toolbox für git-nativesGit-native RefactoringRefactorings mit Commit-pro-Änderung im „commit-per-change“-Stil.Werkzeugkasten. Sein architectArchitect + editor zwei-Modell Editor-Zwei-Modell-Modus passt perfekt zu deinem Multi-Model-Modell-Zugang: architectRichte roledie Architekten-Rolle auf Opus und editordie roleEditor-Rolle auf Sonnet.Sonnet aus. Ideal, wenn Korrektheit und eine saubere Historie wichtiger sind als IDE-Komfort.

3. „Fire-and-forget“-Autonomie:Vollautonome Ausführung: OpenHands (optional) 🔥

Wenn du gutklar spezifiziertedefinierte Aufgaben abgeben willst, die komplett autonom laufen sollenlassen willst (Code schreiben → Tests ausführen → iterieren in einer Sandbox iterieren)Sandbox), self-hostestdann duhoste OpenHands selbst gegen deinen Endpunkt. Am besten für den Anwendungsfall lassLass es diese Komponente über Nacht durcharbeiten“-Use-Case.an diesem Modul arbeiten“. 🌙🤖

Modell-RoutingRouting, (überdas alledu in allen Tools hinweg)konfigurieren – zum Konfigurierensolltest

Rolle Modell Begründung
ArchitectArchitekt / plannerPlaner Opus (oder GPT-5.5) TiefsteTiefstes Reasoning-Tiefe;Reasoning; aktuellerderzeit Leaderführend bei Code-Qualität.der KostetCodequalität. Die Kosten lohnen sich beimfür Planen.die Planung.
ImplementerImplementierer (bulk)Masse) Claude Sonnet Schnell, günstig, stark fürsbeim CodierenCoden — deine High-Volume-Rolle.Rolle mit dem höchsten Volumen.
Terminal/DevOps Terminal-/DevOps-Aufgaben GPT-5.5 #1 beiauf Terminal-Bench (82,7%7 %); am besten für Shell-/ und Pipeline-Work.Arbeit.
Reviewer / criticKritiker Ein ein anderes Modell als der AuthorAutor Cross-ModelModellübergreifendes Review fängterkennt geteiltegemeinsame Blindspotsblinde ab.Flecken.

Zwei wichtige Caveats, die duHinweise aus der Recherche mitnehmen solltest 🔒

  1. Benchmarks sind geradeim wacklig.Moment unsicher. SWE-bench Verified wurde als kontaminiert gefundeneingestuft (FebFebruar 2026) jedes Frontier-Modell konnte „Gold“-die Gold-Antworten aus dem Gedächtnis reproduzieren. Daher:Behandle veröffentlichte ScoresWerte daher nur als richtungsweisendgrobe Orientierung behandeln und lasse 50–100 Aufgaben aus deinemdeiner eigenen CodebaseCodebasis durch dein Kandidaten-Setup laufen lassen,laufen, bevor du dich festlegst.

  2. Security-PostureDie Sicherheitslage unterscheidet sich stark.deutlich. BYOM-Tools wie Cline/Roo/Aider laufen standardmäßig mit lokalem Systemzugriff standardmäßig — sie können .env-Dateien lesen und Shell-KommandosBefehle ausführen. BeiFür großengroße autonomenautonome Projekten:Projekte solltest du eine expliziteklare Human-menschliche Review-GateSchranke definieren und über Sandboxing in Betracht ziehennachdenken (genau deshalb ist die Docker-Isolation beivon OpenHands attraktiv für „hands-off“unbeaufsichtigte Runs)Läufe so attraktiv).


Fazit:Kurz gesagt: Starte mit Roo Code (oder Cline) als deinem primären Agenten,Agenten, konfiguriert mit per-modemodellbezogenem ModellroutingRouting pro Modus über dein Gateway; ergänze Aider für git-Git-native Refactors;Refactorings; und setze optional OpenHands für autonomes,autonome, gesandboxtesisolierte Task-Ausführen.Aufgabenausführung Diesesein. TrioDiese maximiertKombination holt den größten Nutzen aus deiner Multi-Model OpenAI-kompatiblen Multi-Modell-API heraus und setzt direkt dieden benötigtePlanen-→-Bauen-→-Reviewen-Loop Schleifeum, um:den planProjekte → build → review — genau für Projekte,brauchen, die zu groß für einen einzelnen Prompt sind. ✅🤖