Qwen 3.8 Max schlägt Fable auf Terminal-Bench zum Fünftel des Preises

Alibaba veröffentlichte Qwen 3.8 Max — 2,4 Billionen Parameter, 95 Milliarden aktiv, von Grund auf multimodal, mit Gewichten, die in rund einer Woche versprochen sind. Es erreicht 86,6 auf Terminal-Bench gegenüber 84,6 bei Fable 5, zu 2 USD je Million Input-Token gegenüber Fables 10 USD. Fünf separate Beobachter-Batches griffen den Launch auf. Der weniger diskutierte Teil: Alibaba ließ das Modell sein eigenes Agenten-Harness bauen.

Was die Quelle tatsächlich sagt

Das Benchmark-Bild ist bewusst unvollständig. Matthew Berman eröffnet seine Coverage damit, den Zuschauern zu sagen, sie sollten jede Zahl, die er gleich zeigt, mit Vorsicht genießen, und die Lücken geben ihm recht: SWE-Pro landet bei 67,7 gegenüber 80 beim Spitzenreiter, und Alibabas eigene Vergleichstabelle lässt Opus 5 komplett aus — eine auffällige Leerstelle, die Prompt Engineering unabhängig davon bemängelte. Auf X trianguliert TeksEdge drei Boards und erhält drei Antworten: Platz 2 im Text-Ranking der Arena, Platz 8 bei Artificial Analysis Overall Intelligence, Platz 9 bei DeepSWE — und fragt dann unverblümt, ob die Schlagzeilen-Gewinnraten benchmaxxed wurden oder unter unabhängigen Tests standhalten.

Die Preisgeschichte hat dieselbe Form. 2 USD Input und 6 USD Output bei 1M-Token-Kontext unterbieten GPT-5.6 Soul bei 5/30 USD und Fable bei 10/50 USD. Doch der Preis pro Token ist nur die halbe Gleichung — entscheidend sind die Kosten pro abgeschlossener Aufgabe, und auf Artificial Analysis' Board liegt der Vorgänger Qwen 3.7 Max bei 128 USD pro Aufgabe gegenüber 1,23 USD bei GPT-5.6 Soul. Das neue Modell ist dort noch nicht eingetragen.

Das Harness ist das Signal, mit dem Alibaba bewusst vorangeht. Aufgefordert, sein eigenes zu bauen, entwickelte Qwen 3.8 Max eines über 16 Tage selbst weiter und lieferte es als OMI CLI aus, kompatibel mit OpenAI-artigen Endpunkten. Kombiniert man das mit Paper-Reproduktion aus nichts als einer PDF und GPUs — 18 selbst erfundene Verbesserungsideen über vier Runden — plus einem autonomen Chip-Design-Flow, ist die Einordnung gezielt an rekursive Selbstverbesserung angelehnt.

Strategische Einschätzung

Nicht anhand von Token-Preisen einkaufen. Solange Qwen 3.8 Max auf keinem Kosten-pro-Aufgabe-Board erscheint, ist der 5-fache Rabatt unverifiziert — ein Modell, das die dreifache Menge an Token verbrennt, kostet am Ende gleich viel. Behalten Sie stattdessen das 27B-Geschwistermodell im Blick: Es läuft auf Consumer-Hardware, und die Lizenzbedingungen sind noch unveröffentlicht.