Skip to main content

Qwen3.6-35B-A3B

Qwen3.6-35B-A3B (April 2026 von Alibaba veröffentlicht) ist ein sparse MoE-Modell mit 35 Mrd. Gesamtparametern, aber nur 3 Mrd. aktiven Parametern pro Inferenzschritt. Es wurde explizit für "Agentic Coding" optimiert und schlägt sich überraschend stark.

Coding-Benchmarks (im Vergleich)

Benchmark Qwen3.6-35B-A3B Gemma4-31B (dense) Qwen3.5-35B-A3B (Vorgänger)
SWE-bench Verified 73.4 52.0 70.0
SWE-bench Multilingual 67.2 51.7 60.3
Terminal-Bench 2.0 51.5 42.9 40.5
MCPMark (Tool-Use) 37.0 18.1 27.0
LiveCodeBench v6 80.4 80.0 74.6

Was dafür spricht 👍

  • SWE-bench Verified 73.4% ist für ein Modell mit nur 3B aktiven Parametern beeindruckend – schlägt dichte Modelle mit weit mehr aktiven Parametern (z.B. Gemma4-31B klar geschlagen)
  • Deutlicher Sprung gegenüber dem Vorgänger Qwen3.5-35B-A3B in praktisch allen Coding-Metriken
  • "Thinking preservation"-Feature hilft bei mehrstufigen Agentic-Coding-Aufgaben (Reasoning bleibt über Turns erhalten)
  • 262K natives Kontextfenster (bis 1M mit RoPE-Scaling) – gut für große Repos
  • Läuft lokal (Q4 GGUF ~20,9 GB) auf normaler Consumer-Hardware
  • Integriert sich mit Claude Code, Qwen Code, OpenClaw
  • Apache 2.0 Lizenz, quasi kostenlos

Was man kritisch sehen sollte 👎

  • Community-Feedback ist gemischt: Auf Reddit (r/LocalLLaMA) gab es einen Thread "Is qwen3.6 35b a3b good for coding at all?" mit eher durchwachsenen Praxiseindrücken – bei realen agentischen Coding-Tasks (z.B. HackerNews-Report: nur 11/98 gelöste Power-Ranking-Tasks) zeigt sich, dass es an die absolute Spitze (GPT-5-Klasse, Claude Opus) nicht heranreicht
  • Auf komplexeren, "harten" Benchmarks wie SkillsBench oder bei manchen General-Agent-Tasks (TAU3, VITA Bench) schwächer als der 27B-Dense-Vorgänger
  • Es ist ein kleines/effizientes Modell – die 3B aktiven Parameter bedeuten, dass es bei sehr komplexen, kreativen oder mehrdeutigen Programmieraufgaben Grenzen hat verglichen mit echten Flaggschiff-Modellen

Fazit

Für seine Effizienzklasse (3B aktive Parameter, lokal lauffähig) ist Qwen3.6-35B-A3B eines der stärksten Open-Source-Coding-Modelle 2026 – ideal wenn du lokal/günstig arbeiten willst und "gut genug" reicht. Für anspruchsvollste Produktions-Coding-Agents oder komplexe Refactorings würde ich es aber (noch) nicht als Ersatz für Top-Closed-Source-Modelle wie Claude Opus 4.7 oder GPT-5-Klasse sehen.

Praxistipp: Wenn du es testen willst – läuft günstig über die API (~$0.38/$2.25 pro Mio. Token) oder lokal via LM Studio/Ollama mit dem Q4-GGUF (Unsloth).