Zum Inhalt springen
news · 2 min Lesezeit

Qwen3.8-Flash-Next zeigt die Architektur hinter Qwen4

Qwens experimentelles Open-Weight-Modell gibt einen konkreten Ausblick auf Qwen4, bleibt für lokale Tests aber ein Schwergewicht.

qwen qwen4 open-weight moe

Qwen hat am 26. August Qwen3.8-Flash-Next veröffentlicht: die erste Open-Weight-Veröffentlichung einer neuen Architektur, die nach Angaben des Anbieters künftig Qwen4 tragen soll. Das Modell erscheint ausdrücklich als experimentelle Vorschau.

Große Kapazität, kleiner aktiver Anteil

125 Milliarden Gesamtparameter, davon sechs Milliarden aktiv — so beziffert Qwen das Modell auf seiner Hugging-Face-Seite (2026-08-26). Dazu kommt eine Kontextlänge von 262.144 Token, erweiterbar auf bis zu eine Million.

Der Anspruch ist damit klar umrissen: Eine sehr große Gesamtzahl an Parametern trifft auf einen deutlich kleineren aktiven Anteil. Was das für lokale Agenten- oder Coding-Workloads bedeutet, entscheidet sich erst in Evaluationen auf ausreichend dimensionierter Hardware. Die Eckdaten allein belegen keine Produktionsreife.

Sechs Milliarden aktiv, 72,5 Gigabyte groß

Genau hier setzt der erste öffentliche Praxistest an. Simon Willison hat Qwen3.8-Flash-Next auf einer Nvidia DGX Spark ausprobiert und ordnet es als multimodales Mixture-of-Experts-Modell ein, kurz MoE. Er lud zwei quantisierte Varianten: eine 72,5 Gigabyte große UD-IQ1_S-Version und eine 78,9 Gigabyte große UD-Q2_K_XL-Version.

Sechs Milliarden aktive Parameter machen das Modell also nicht automatisch klein. Wer nur auf den aktiven Anteil schaut, übersieht die Größe der tatsächlich geladenen Gewichte. Willisons Messpunkte liefern dafür eine konkrete Größenordnung — allerdings nur für diese beiden Quantisierungen, nicht als allgemeine Mindestanforderung.

Anschluss an verbreitete Inferenz-Software

Gewichte und Konfigurationsdateien liegen laut Modellseite im Transformers-Format vor. Qwen nennt die Artefakte kompatibel mit Hugging Face Transformers, vLLM, SGLang und TokenSpeed. Das erlaubt Evaluationen in gängigen Umgebungen — vorausgesetzt, die Hardware trägt die gewählte Variante.

Für den produktiven Einsatz verweist Qwen auf Flash

Qwen trennt auf der Modellseite zwischen Vorschau und Produkt und verweist für den produktiven Einsatz auf Qwen3.8-Flash als offizielle Version mit zusätzlichen produktionsorientierten Funktionen, darunter eine Million Token Kontext als Standardeinstellung und eingebaute Tools.

Diese Abgrenzung setzt die vernünftige Einsatzgrenze: Qwen3.8-Flash-Next ist Material für Architekturtests und lokale Evaluationen, nicht für den Regelbetrieb. Der Ausblick auf Qwen4 ist konkret. Ein Produktionsversprechen ist er nicht.

Transparenz

agentenlog.de nutzt KI-Assistenz für Recherche, Struktur und Entwurf. Inhaltliche Auswahl, Einordnung und Veröffentlichung liegen redaktionell bei agentenlog.de; Quellen und Fakten werden vor Veröffentlichung automatisiert geprüft.