DeepSeek V4 Flash erledigt für 0,53 $, wofür Kimi K3 25 $ berechnete

DeepSeeks V4-Flash-0731-Update erschien am 31. Juli mit offenen Gewichten und wurde die Woche über eher gemessen als angekündigt. Ein Praxistester ließ drei mehrstündige Build-Aufgaben auf Frontier-Niveau über die Cloud-API laufen — für 0,53 $; dieselbe Spiel-Aufgabe hatte ihn auf Kimi K3 25 $ gekostet. Vier Beobachter-Reports bestätigen den Befund aus unterschiedlichen Blickwinkeln — ein agentisches Leaderboard, ein Kostenindex und Consumer-Hardware.

Was die Quelle tatsächlich sagt

Tonbi's AI Garage ließ jede Aufgabe zweimal laufen: einmal über die offizielle API, einmal auf einer stark Q2-quantisierten lokalen Kopie, die auf einem einzigen DGX Spark lief (~1.000 Tok/s Prefill, 59 Tok/s Multi-Agent-Serving). Das Cloud-Modell erstellte im ersten Versuch eine scroll-gesteuerte Launch-Website, die er als „definitiv auf Frontier-Niveau" einstufte, rekonstruierte Karpathys Three.js-Herr-der-Ringe-Szene in 40 Minuten — Opus 5 brauchte zwei Stunden und rund 1M Token — und lieferte einen Zeitschleifen-Puzzle-Platformer, dessen Mechanik er konzeptionell erfinderischer nannte als die von Kimi K3 oder GPT Soul, näher an Fable. Die lokale Q2-Kopie schloss alle drei Aufgaben ab, grob, aber funktional.

Die Größenlücke ist die eigentliche Geschichte. 284 Mrd. Parameter insgesamt gegenüber Kimi K3s 2,8 Billionen: rund 10-mal kleiner, ~8-mal weniger aktive Parameter, 2,2-mal tiefere Layer, gleiches Kontextfenster. OpenRouter listet 0,09 $ Input / 0,18 $ Output gegenüber K3s 2,90 $ / 14 $. Der 0,53-$-Lauf trug einen temporären 90-%-Werberabatt — selbst zum Listenpreis landet er bei rund 5 $, gegenüber 25 $ für eine einzige K3-Aufgabe. Arena.ai platzierte V4-Flash-20260731 (High) auf Platz 21 insgesamt in der Agent Arena über 12.500 reale agentische Sitzungen hinweg: 13 Plätze über dem vorherigen Flash, Platz 3 unter Open-Source-Modellen und das erste lokale Modell auf der Top-Liste. Vals AI nennt es das günstigste Modell auf seinem Index mit einem Score über 60 — und 35-mal günstiger als das nächstbeste. Unsloths Quants laufen verlustfrei bei 4-bit auf 168 GB RAM, 3-bit auf 110 GB.

Strategische Einschätzung

Nehmen Sie das eigene Urteil des Reviewers ernst: Derzeit gibt es keinen wirtschaftlichen Grund, das lokal zu betreiben, weil der Cloud-Preis bereits nahe null liegt. Lokal erkauft man sich Privatsphäre, Tüftelfreiheit und Immunität gegen die API-Verbindungsabbrüche, die ihm begegneten. Kalkulieren Sie Ihre Agenten-Workloads neu, bevor Sie Frontier-Abrechnung als Preisboden voraussetzen.