Agenten?

Basierend auf der aktuellen Recherche (Mitte 2026) sieht die Landschaft so aus — speziell gefiltert für deine Situation, denn genau das ist entscheidend: Du hast einen einzelnen OpenAI-kompatiblen Endpunkt mit vielen Modellen dahinter. Diese Einschränkung schließt viele sonst sehr gute Tools aus oder stuft sie herunter und hebt die „Bring-your-own-model“-Tools (BYOM) nach oben. 🚀


Zuerst die wichtigste Einordnung: Agent = Modell + Gerüst

Die wichtigste Erkenntnis aus der aktuellen Recherche ist, dass das Gerüst genauso wichtig ist wie das Modell. In einem Test vom Februar 2026 erzielte dasselbe Modell (Opus 4.5), das über drei verschiedene Agenten-Frameworks lief, einen Unterschied von 17 Problemen in einem Datensatz mit 731 Problemen — ein Abstand so groß wie eine komplette Modellgeneration. Deine Wahl des Gerüsts ist also nicht nur Kosmetik, sondern bestimmt direkt die Qualität der Ergebnisse.

Da du die Modelle selbst bereitstellst, lautet deine eigentliche Entscheidung also: Welches Gerüst nutzt einen benutzerdefinierten OpenAI-kompatiblen Endpunkt mit mehreren Modellen am besten aus?


Das gesamte Feld, nach Eignung für dein Setup gruppiert

Stufe A — Beste Wahl für dich (native BYOM, Multi-Modell, OpenAI-kompatibel)

Diese Tools lassen dich auf eine benutzerdefinierte base_url zeigen, deinen Schlüssel eintragen und verschiedene Modelle verschiedenen Rollen zuweisen. Genau das ist dein Anwendungsfall.

Tool Formfaktor Warum es zu dir passt
Cline VS-Code-Erweiterung Ca. 5 Mio. Installationen; explizite Konfiguration für „OpenAI Compatible“ (Basis-URL + Schlüssel + Modell-IDs). Der Plan-/Act-Modus trennt Architekt- und Coder-Rollen — perfekt, um Opus für die Planung und Sonnet für die Ausführung zuzuweisen. Kein Inferenz-Aufschlag.
Roo Code VS-Code-Erweiterung (Cline-Fork) Hat den Ruf, bei großen Änderungen über viele Dateien hinweg am zuverlässigsten zu sein. Mehr Konfigurationsmöglichkeiten, benutzerdefinierte „Modi“ (Rollen), die du an bestimmte Modelle binden kannst. Klassenbeste Lösung für das von dir beschriebene „große Projekt“-Problem.
Aider CLI / Git-nativ Ausgezeichnetes Repo-Mapping, atomare Git-Commits, funktioniert mit jedem OpenAI-kompatiblen Modell. Integrierter „Architect Mode“, der ein starkes Reasoning-Modell für die Planung und ein günstigeres Modell zum Schreiben des Diffs nutzt — also genau das Multi-Modell-Muster, das ich vorher beschrieben habe, sofort einsatzbereit.
OpenHands (früher OpenDevin) Selbst gehosteter autonomer Agent MIT-lizenziert, über 100 Backends, jede OpenAI-kompatible API. Führt einen vollständigen CodeAct-Zyklus aus (Code ausführen, Tests laufen lassen, browsen) in einer Docker-Sandbox. 72 % auf SWE-bench Verified. Die autonomste Option unter den BYOM-Tools.
Kilo Code VS-Code-Erweiterung Holt schnell auf; fokussiert auf enge Kontextkontrolle und strukturierte Modi; dokumentierte Unterstützung für benutzerdefinierte OpenAI-kompatible Provider.

Stufe B — Hervorragende Tools, aber mit deinem Endpunkt etwas umständlich

Stufe C — Autonom / Nische


Meine Empfehlung für dich

Mit deinem OpenAI-kompatiblen Multi-Modell-Gateway und deinem Ziel von großen Projekten, die über einen einzelnen Prompt hinausgehen, würde ich einen mehrschichtigen BYOM-Stack aufsetzen:

1. Hauptwerkzeug: Roo Code (oder Cline)

Das ist dein wichtigstes Arbeitstool. Gründe:

Nimm Cline, wenn du eine etwas einfachere, rundere Erfahrung möchtest; nimm Roo Code, wenn du maximale Kontrolle und Zuverlässigkeit bei großen Refactorings willst (das ist sein Haupt-Ruf).

2. Schwere Refactorings / CLI-Fans: Aider

Behalte Aider für Git-native Refactorings mit Commit-pro-Änderung im Werkzeugkasten. Sein Architect + Editor-Zwei-Modell-Modus passt perfekt zu deinem Multi-Modell-Zugang: Richte die Architekten-Rolle auf Opus und die Editor-Rolle auf Sonnet aus. Ideal, wenn Korrektheit und eine saubere Historie wichtiger sind als IDE-Komfort.

3. Vollautonome Ausführung: OpenHands (optional)

Wenn du klar definierte Aufgaben komplett autonom laufen lassen willst (Code schreiben → Tests ausführen → iterieren in einer Sandbox), dann hoste OpenHands selbst gegen deinen Endpunkt. Am besten für den Anwendungsfall „Lass es über Nacht an diesem Modul arbeiten“. 🌙🤖

Modell-Routing, das du in allen Tools konfigurieren solltest

Rolle Modell Begründung
Architekt / Planer Opus (oder GPT-5.5) Tiefstes Reasoning; derzeit führend bei der Codequalität. Die Kosten lohnen sich für die Planung.
Implementierer (Masse) Claude Sonnet Schnell, günstig, stark beim Coden — deine Rolle mit dem höchsten Volumen.
Terminal-/DevOps-Aufgaben GPT-5.5 #1 auf Terminal-Bench (82,7 %); am besten für Shell- und Pipeline-Arbeit.
Reviewer / Kritiker Ein anderes Modell als der Autor Modellübergreifendes Review erkennt gemeinsame blinde Flecken.

Zwei wichtige Hinweise aus der Recherche

  1. Benchmarks sind im Moment unsicher. SWE-bench Verified wurde als kontaminiert eingestuft (Februar 2026) — jedes Frontier-Modell konnte die Gold-Antworten aus dem Gedächtnis reproduzieren. Behandle veröffentlichte Werte daher nur als grobe Orientierung und lasse 50–100 Aufgaben aus deiner eigenen Codebasis durch dein Kandidaten-Setup laufen, bevor du dich festlegst.

  2. Die Sicherheitslage unterscheidet sich deutlich. BYOM-Tools wie Cline/Roo/Aider laufen standardmäßig mit lokalem Systemzugriff — sie können .env-Dateien lesen und Shell-Befehle ausführen. Für große autonome Projekte solltest du eine klare menschliche Review-Schranke definieren und über Sandboxing nachdenken (deshalb ist die Docker-Isolation von OpenHands für unbeaufsichtigte Läufe so attraktiv).


Kurz gesagt: Starte mit Roo Code (oder Cline) als deinem primären Agenten, konfiguriert mit modellbezogenem Routing pro Modus über dein Gateway; ergänze Aider für Git-native Refactorings; und setze optional OpenHands für autonome, isolierte Aufgabenausführung ein. Diese Kombination holt den größten Nutzen aus deiner OpenAI-kompatiblen Multi-Modell-API heraus und setzt direkt den Planen-→-Bauen-→-Reviewen-Loop um, den Projekte brauchen, die zu groß für einen einzelnen Prompt sind. ✅✨


Revision #2
Created 2026-07-04 23:55:15 UTC by art10m
Updated 2026-07-05 00:05:31 UTC by art10m