Skip to main content

Coding-Fähigkeiten im Agenten-Kontext (Hermes Agent / "hermes"-Tool-Calling)

Vorab kurz zur Einordnung, weil das für die Bewertung wichtig ist: "Hermes" taucht bei dir in zwei Bedeutungen auf, die beide relevant sind:

  1. Hermes Agent (Nous Research) – ein Open-Source-Agenten-Harness (Nachfolger von OpenClaw) mit Skill-Learning, Memory, Tool-Gateway etc. Läuft mit praktisch jedem Provider (OpenRouter, Bedrock, vLLM, Ollama, …).
  2. Der "hermes"-Tool-Call-Parser in vLLM/llama.cpp – das ChatML-<tool_call>-Format, das ursprünglich für Nous-Hermes-Modelle entwickelt wurde und heute auch von Qwen2.5/3, Llama 3.x, Mistral, DeepSeek u.a. genutzt wird. Modelle mit nativer Unterstützung dieses Formats lassen sich in einem Agenten-Loop deutlich zuverlässiger steuern (weniger "Tool-Call als Fließtext"-Fehler).

Für die Bewertung zählt daher nicht nur der reine SWE-bench-Score, sondern auch Tool-Calling-Zuverlässigkeit, Kontextlänge, Kosten/Token und Ausführungsgeschwindigkeit in einem Multi-Step-Agenten-Loop.

Gesamtübersicht (Stand: Juli 2026)

Modell SWE-bench Verified (ca., je nach Harness) Architektur / Aktive Params Kontext Tool-Calling-Eignung im Agenten-Loop Einschätzung
Qwen3-Coder-480B-A35B ~55% (mini-SWE-agent) MoE, 35B aktiv 256K (bis 1M ext.) Nativ stark, explizit für Agentic Coding trainiert Starkes Flaggschiff-Open-Model, aber inzwischen von kleineren Nachfolgern teils überholt
Qwen3-Coder-30B-A3B (Flash) ~50–60% (Werte variieren stark je Quelle/Update) MoE, nur 3B aktiv 256K Sehr gut, „out-of-the-box" starke Tool-Use-Scores Bestes Preis/Leistungs-Verhältnis für lokale/günstige Agenten, oft nahe an 480B-Modell
Qwen3-Coder-Next >70% (SWE-Agent-Scaffold) Hybrid (Attention+SSM), 3B aktiv/80B total 256K+ Für Agenten-Workflows und lokale Entwicklung optimiert State-of-the-Art unter den Effizienzmodellen (Feb. 2026) – exzellent für Hermes lokal via vLLM/Ollama
Codestral 2508 ~52% Dense, ~22B 256K Eher FIM/Autocomplete-fokussiert, weniger als reiner Agent gedacht Gut für IDE-Vervollständigung; für vollen Agenten-Loop ist Mistrals Devstral (53–62%) die bessere Wahl
KAT-Coder-Pro V2 73–80% (nähert sich Claude Opus 4.6) Proprietär, günstig (Kwaipilot) 256K Explizit für agentische Coding-Tasks gebaut, Top-Terminal-Bench-Werte Einer der stärksten Nicht-Reasoning-Agenten-Coder aktuell, ~12x günstiger als Claude
GPT-5.1-Codex-Mini solide, aber unter Codex-Max Proprietär 400K Für Codex-Workflows gebaut, zuverlässiges Tool-Calling Guter Kompromiss Kosten/Leistung bei OpenAI, aber klar unter GPT-5.1-Codex(-Max)
DeepSeek V3 (0324) Basis-Niveau (älter) MoE 671B/37B aktiv 128K Ordentlich, aber unter V3.1/V3.2 Nur noch als Baseline relevant
DeepSeek V3.1 / Terminus verbessert ggü. V3 MoE 128K Function Calling im Non-Reasoning-Modus deutlich verbessert Guter Zwischenschritt, durch V3.2 abgelöst
DeepSeek V3.2 / V3.2-Exp 70% (high reasoning) MoE, mit Sparse-Attention (DSA) 128K+ Sehr stark in Agent-/Terminal-Bench-Evals Aktuell eines der stärksten offenen Reasoning-Coding-Modelle, nahe an Gemini 3 Pro
GLM-4.5-Air ~57–58% MoE, leichtgewichtig (~12B aktiv) 128K Höchste Tool-Calling-Erfolgsrate in der GLM-Familie (90,6%) Sehr gute leichte Agenten-Option, günstig selbst zu hosten
MiniMax M2 Basis-Niveau, günstig MoE 200K Gut, textbasiert Solide günstige Einstiegsoption
MiniMax M2.1 >67% (über mehrere Harnesses) MoE 200K Multilingual verbessert Deutlicher Sprung ggü. M2
MiniMax M2.5 75,8% (einer der schnellsten auf 80%+) MoE 200K Sehr günstig (~$0,07/Task laut swebench.com) Top Preis/Leistung, konkurriert mit Claude Opus 4.6
MiniMax M2.7 weiter verbessert MoE 200K Text-only, aktueller OAuth-Default in Hermes Agent Aktuell Standard-Empfehlung für MiniMax in Hermes
MiniMax M3 Flaggschiff (Juni 2026) MoE, multimodal ~1M Anthropic-Messages-kompatibel, Bild/Video Stärkster MiniMax, aber (noch) nicht überall Standard-Default
MiniMax M2-her Keine belastbaren Quellen gefunden – vermutlich Verwechslung/Community-Fine-Tune, kein offizielles MiniMax-Release
Qwen3-235B-A22B-Instruct-2507 solide, oberhalb Kimi K2/Claude 4 Opus in AA-Index MoE, 22B aktiv 256K Guter Generalist mit Agentic-Fähigkeiten Starker Allrounder, für reines Coding aber unter den Coder-Varianten
Qwen3-235B-A22B-Thinking-2507 Top-Reasoning (92,3 im AA-Reasoning-Index) MoE, 22B aktiv 256K Stark bei komplexer Logik/Multi-Step-Planung Beste Wahl, wenn Agent tiefes Reasoning vor Tool-Calls braucht
Qwen3-Next-80B-A3B wettbewerbsfähig, sehr effizient Hybrid, nur 3B aktiv 256K, 10x Durchsatz Für agentisches Coding & Reasoning positioniert Extrem effizient – gute Balance aus Geschwindigkeit und Fähigkeit
gpt-oss-120b ~62% (mit Tool-Zugriff) MoE, ~5B aktiv 128K Explizit auf Function-Calling/Agentic trainiert (OpenAI) Bestes offenes OpenAI-Modell für Agenten, Apache-2.0
gpt-oss-20b ~37% MoE, kleiner 128K Ebenfalls gutes Tool-Calling, aber klar schwächer Für sehr limitierte Hardware/leichte Tasks
GPT-5 Mini ~56–60% (je nach Scaffold) Proprietär groß Solides Tool-Calling Guter Mittelweg, deutlich günstiger als GPT-5
GPT-5 Nano ~35% Proprietär groß Funktioniert, aber schwach bei komplexen Multi-Step-Tasks Nur für einfache/hochfrequente Aufgaben sinnvoll
Hermes 4 70B eher mittel (kein spezialisiertes Coding-Modell) Dense, Llama-3.1-70B-Basis 128K Nativ auf das "hermes"-Tool-Call-Format trainiert, hybrides Reasoning (Think-Mode) Beste rohe Kompatibilität mit Hermes-Agent/vLLM-Parser, aber bei reinen SWE-bench-Coding-Metriken hinter den spezialisierten Coder-MoEs
Llama 4 Maverick ~15–21% (stark scaffold-abhängig, teils widersprüchliche Angaben) MoE, 17B aktiv/400B total 1M (nominell) Community-Feedback zur Coding-Qualität eher negativ Nicht empfehlenswert als primärer Coding-Agent-Backend
Llama 4 Scout ~9% (teils höhere Einzelwerte in anderen Benchmarks, uneinheitlich) MoE, 17B aktiv/109B total 10M (nominell) Schwach bei komplexem Agentic Coding Eher für lange Kontext-Aufgaben als für Coding-Agenten geeignet

(Werte schwanken teils stark je nach Scaffold/Datum der Messung – SWE-bench-Zahlen für dasselbe Modell können sich zwischen mini-SWE-agent, OpenHands, Claude Code, Droid etc. um 10–20 Prozentpunkte unterscheiden. Als Trend/Ranking sind sie aber verlässlich.)

Gruppierte Einschätzung

🥇 Top-Tier Open-Weight-Agentencoder (beste Wahl für Hermes, wenn Budget/Hardware es zulässt)

  • KAT-Coder-Pro V2 und MiniMax M2.5/M2.7 liegen aktuell an der Spitze der Nicht-Reasoning-Agentencoder (75–80% SWE-bench Verified) bei sehr niedrigen Kosten – ideal für Hermes im Cloud-Betrieb.
  • DeepSeek V3.2 ist die stärkste Reasoning-Variante unter den offenen Modellen, sehr gut in Terminal-Bench/Agenten-Setups.
  • Qwen3-Coder-Next ist der Effizienz-Champion: fast so gut wie 10–20x größere Modelle, exzellent lokal via Ollama/vLLM in Hermes.

💪 Solide Generalisten mit guter Agentic-Fähigkeit

  • Qwen3-235B-A22B (Instruct für schnelle Antworten, Thinking für tiefe Planung), Qwen3-Coder-480B, GLM-4.5-Air – gute Allrounder, GLM-4.5-Air besonders attraktiv als leichtgewichtige, selbst hostbare Option.

🏠 Beste lokale/Edge-Optionen

  • gpt-oss-120b/20b, Qwen3-Coder-30B-A3B, Qwen3-Next-80B-A3B – alle mit nativer Tool-Calling-Unterstützung in vLLM/llama.cpp (Parser hermes/qwen), laufen gut auf einer einzelnen High-End-GPU oder Apple-Silicon-Mac und sind explizit für Agenten-Workflows trainiert.

💰 Proprietäre Cloud-Optionen mit Preis/Leistungs-Fokus

  • GPT-5.1-Codex-Mini, GPT-5 Mini – brauchbare Mittelklasse, aber teurer und nicht klar besser als die günstigsten offenen Alternativen (KAT-Coder, MiniMax).
  • GPT-5 Nano, Codestral 2508 – eher für einfache/hochfrequente Aufgaben (Autocomplete, Klassifikation) als für komplexe Multi-Step-Agenten-Loops.

⚠️ Weniger geeignet als primärer Coding-Agent-Backend

  • Llama 4 Maverick/Scout: bei Release (April 2025) durchwachsenes Community-Feedback zur Coding-Qualität, klar hinter spezialisierten MoE-Coding-Modellen zurück.
  • Hermes 4 70B: hervorragend bei Tool-Use-Protokoll-Treue (logisch, da vom selben Team wie der Hermes-Agent-Harness trainiert) und gutem hybridem Reasoning, aber als generalistisches Dense-Modell auf Llama-3.1-70B-Basis bei reinen SWE-bench-Coding-Metriken hinter den 2025/2026er-Spezialcoder-MoEs. Sehr gute Wahl, wenn dir Zuverlässigkeit der Tool-Calls und Steuerbarkeit wichtiger ist als rohe Benchmark-Zahlen bei riesigen Repos.
  • MiniMax M2-her: konnte ich nicht verifizieren – vermutlich kein offizielles Release (evtl. Verwechslung mit M2.5/M2.7 oder ein Community-Fine-Tune).

Praktische Empfehlung für den Einsatz mit Hermes Agent

Szenario Empfehlung
Maximale Coding-Power, Cloud, Budget egal KAT-Coder-Pro V2 oder MiniMax M2.5/M2.7, alternativ DeepSeek V3.2 (Reasoning)
Bestes Preis/Leistungs-Verhältnis MiniMax M2.5/M2.7, Qwen3-Coder-30B-A3B
Lokal/self-hosted (eine GPU/Apple Silicon) Qwen3-Coder-Next, gpt-oss-120b, Qwen3-Coder-30B-A3B
Höchste Tool-Call-Zuverlässigkeit/„Hermes-nativ" Hermes 4 70B (nativer Parser), Qwen3-Familie
OpenAI-Ökosystem, moderat GPT-5.1-Codex-Mini oder GPT-5 Mini
Vermeiden für ernsthafte Agenten-Coding-Tasks Llama 4 Maverick/Scout, GPT-5 Nano, Codestral 2508 (besser: Devstral)

Wenn du magst, kann ich als nächsten Schritt einen konkreten Kosten/Latenz-Vergleich (Tokens/Sekunde, $/Mio Tokens) für 3–4 deiner Favoriten im Hermes-Agent-Setup zusammenstellen, oder tiefer in ein einzelnes Modellpaar (z.B. KAT-Coder-Pro V2 vs. MiniMax M2.5) einsteigen.