KI für Ihr Unternehmen – Jetzt Demo buchen

Neue Version von DeepSeek-V4-Flash mit verbesserten agentischen Fähigkeiten veröffentlicht

Kategorien:
No items found.
Freigegeben:
August 1, 2026

KI sauber im Unternehmen integrieren: Der 5-Schritte-Plan

Von der ersten Idee bis zur voll integrierten KI-Lösung – strukturiert, sicher und mit messbarem Erfolg

1
🎯

Strategie & Zieldefinition

Wir analysieren Ihre Geschäftsprozesse und identifizieren konkrete Use Cases mit dem höchsten ROI-Potenzial.

✓ Messbare KPIs definiert

2
🛡️

Daten & DSGVO-Compliance

Vollständige Datenschutz-Analyse und Implementierung sicherer Datenverarbeitungsprozesse nach EU-Standards.

✓ 100% DSGVO-konform

3
⚙️

Technologie- & Tool-Auswahl

Maßgeschneiderte Auswahl der optimalen KI-Lösung – von Azure OpenAI bis zu Open-Source-Alternativen.

✓ Beste Lösung für Ihren Fall

4
🚀

Pilotprojekt & Integration

Schneller Proof of Concept mit nahtloser Integration in Ihre bestehende IT-Infrastruktur und Workflows.

✓ Ergebnisse in 4-6 Wochen

5
👥

Skalierung & Team-Schulung

Unternehmensweiter Rollout mit umfassenden Schulungen für maximale Akzeptanz und Produktivität.

✓ Ihr Team wird KI-fit

Inhaltsverzeichnis

    mindverse studio – Ihre Plattform für digitale Effizienz

    Optimieren Sie Prozesse, automatisieren Sie Workflows und fördern Sie Zusammenarbeit – alles an einem Ort.
    Mehr über Mindverse Studio erfahren

    Das Wichtigste in Kürze

    • DeepSeek-V4-Flash-0731 ist die offizielle Veröffentlichung des Sprachmodells DeepSeek-V4-Flash und löst die vorherige Vorschauversion ab.
    • Das Modell weist verbesserte agentische Fähigkeiten auf, die sich in Benchmarks wie Terminal Bench 2.1, Cybergym und DeepSWE zeigen.
    • Obwohl es die gleiche Architektur wie die Vorschauversion besitzt, resultieren die Leistungssteigerungen aus einem erneuten Post-Training.
    • Die Kostenstruktur von DeepSeek-V4-Flash-0731 ist für den API-Zugang im Vergleich zu DeepSeek-V4-Pro (Preview) deutlich günstiger.
    • Das Modell ist unter einer MIT-Lizenz verfügbar und ermöglicht sowohl den API-Zugang als auch das Selbst-Hosting für Unternehmen.
    • Die Integration eines spekulativen Decoding-Moduls (DSpark) zielt auf eine Beschleunigung der Inferenz ab.

    Die Landschaft der Künstlichen Intelligenz (KI) ist einem ständigen Wandel unterworfen, geprägt von fortlaufenden Innovationen und der Freigabe neuer Modelle. In diesem Kontext hat das Unternehmen DeepSeek die offizielle Version seines Sprachmodells, DeepSeek-V4-Flash-0731, veröffentlicht. Diese Entwicklung stellt eine signifikante Aktualisierung gegenüber der zuvor verfügbaren Vorschauversion dar und bietet insbesondere verbesserte agentische Fähigkeiten, die für B2B-Anwendungen von Relevanz sein können.

    Architektur und Leistungssteigerungen

    DeepSeek-V4-Flash-0731 basiert auf einer Mixture-of-Experts (MoE)-Architektur mit 284 Milliarden Parametern, von denen 13 Milliarden pro Token aktiviert werden. Das Modell verfügt über ein Kontextfenster von einer Million Token. Eine bemerkenswerte Eigenschaft ist die Integration eines spekulativen Decoding-Moduls namens DSpark, das darauf abzielt, die Inferenzgeschwindigkeit zu optimieren.

    Die Leistungssteigerungen der 0731-Version ergeben sich laut DeepSeek aus einem erneuten Post-Training, nicht aus einer grundlegend neuen Architektur oder einer Erhöhung der Parameterzahl. Dies unterstreicht die Bedeutung von Optimierungsprozessen nach der initialen Modellentwicklung. Das Modell übertrifft in verschiedenen agentischen Benchmarks die Vorschauversion von DeepSeek-V4-Pro, einem größeren Modell aus derselben Familie.

    Benchmark-Ergebnisse im Detail

    Die von DeepSeek veröffentlichten Benchmark-Ergebnisse illustrieren die verbesserten Fähigkeiten des DeepSeek-V4-Flash-0731. Besonders hervorzuheben sind folgende Werte:

    • Terminal Bench 2.1: 82.7 Punkte
    • NL2Repo: 54.2 Punkte
    • Cybergym: 76.7 Punkte
    • DeepSWE: 54.4 Punkte
    • Toolathlon-Verified: 70.3 Punkte

    Im Vergleich zur Vorschauversion von DeepSeek-V4-Flash zeigt die 0731-Version deutliche Verbesserungen in diesen Kategorien. Beispielsweise stieg der Wert auf Terminal Bench 2.1 von 61.8 auf 82.7 Punkte, was eine relative Steigerung von rund 33,8 % darstellt. Diese Ergebnisse positionieren DeepSeek-V4-Flash-0731 als ein Modell, das in der Lage ist, komplexe agentische Aufgaben und Coding-Herausforderungen effizient zu bewältigen.

    Es ist zu beachten, dass diese Benchmark-Ergebnisse vom Hersteller selbst berichtet wurden und auf einem internen Test-Harness basieren, das nicht öffentlich zugänglich ist. Für eine unabhängige Bewertung wird Unternehmen empfohlen, eigene Evaluierungen durchzuführen.

    Zugänglichkeit und Einsatzmöglichkeiten

    DeepSeek-V4-Flash-0731 ist sowohl über eine API als auch durch Selbst-Hosting zugänglich. Die API-Preise sind im Vergleich zu DeepSeek-V4-Pro (Preview) deutlich günstiger, was das Modell für eine breitere Palette von Anwendern, einschließlich Start-ups und internen Entwicklungsteams, attraktiv machen könnte. Die Kosten werden mit 0,14 US-Dollar pro 1 Million Input-Token (bei Cache-Miss) und 0,28 US-Dollar pro 1 Million Output-Token angegeben. Diese Preisgestaltung ermöglicht es, agentische Schleifen ohne ein großes GPU-Budget zu betreiben.

    Für Unternehmen, die eine On-Premise-Bereitstellung bevorzugen, ist das Modell unter einer MIT-Lizenz verfügbar. Das Selbst-Hosting erfordert jedoch erhebliche Ressourcen. Eine 3-Bit-Quantisierung erfordert etwa 110 GB Arbeitsspeicher und VRAM, während eine Volldarstellung auf einem einzelnen 4xGB300-Knoten mit vLLM realisiert werden kann. Dies macht das Selbst-Hosting primär für mittelgroße und große Unternehmen mit entsprechender Infrastruktur praktikabel.

    Die offizielle API unterstützt nun nativ das Responses API-Format und ist für Codex-Workflows optimiert. Dies erweitert die Anwendungsbereiche des Modells, insbesondere im Kontext von Entwickler-Schnittstellen und Coding-Agenten.

    Technische Details und Optimierungen

    Die Architektur des Modells beinhaltet ein hybrides Aufmerksamkeitsverfahren, das Compressed Sparse Attention (CSA) und Heavily Compressed Attention (HCA) kombiniert. Darüber hinaus ersetzt Manifold-Constrained Hyper-Connections (mHC) herkömmliche Residual Connections. Das Pre-Training erfolgte mit über 32 Billionen Token und nutzte den Muon-Optimizer. Die im technischen Bericht angegebene Effizienzsteigerung von 27 % der Single-Token-Inferenz-FLOPs und 10 % des KV-Cache im Vergleich zu DeepSeek-V3.2 bei einem Kontext von 1 Million Token bezieht sich auf V4-Pro, nicht auf die Flash-Version.

    Die Integration des DSpark-Moduls, das ein spekulatives Decoding ermöglicht, soll die Generierungsgeschwindigkeit pro Nutzer um 60-85 % gegenüber einer Baseline ohne dieses Modul steigern, bei gleichbleibendem aggregierten Durchsatz.

    Für die Konfiguration des Modells empfiehlt DeepSeek eine Temperatur von 1.0 und einen Top-p-Wert von 0.95 für agentische Anwendungen und 1.0 für andere Verwendungszwecke. Das Modell unterstützt bis zu 384.000 Output-Token bei hoher oder maximaler Rechenanstrengung.

    Fazit

    Die Veröffentlichung von DeepSeek-V4-Flash-0731 stellt einen Fortschritt in der Entwicklung von Sprachmodellen mit agentischen Fähigkeiten dar. Durch gezieltes Post-Training konnte DeepSeek die Leistung des Modells signifikant steigern, ohne die zugrunde liegende Architektur zu ändern. Die verbesserte Performance, kombiniert mit einer wettbewerbsfähigen Preisgestaltung für den API-Zugang und der Möglichkeit zum Selbst-Hosting, positioniert dieses Modell als eine relevante Option für Unternehmen im B2B-Bereich, die nach effizienten und leistungsstarken KI-Lösungen suchen, insbesondere in den Bereichen Codegenerierung und Automatisierung.

    Es bleibt abzuwarten, wie sich DeepSeek-V4-Flash-0731 in der Praxis bewähren wird und welche weiteren Innovationen DeepSeek in Zukunft präsentieren wird. Die kontinuierliche Verbesserung bestehender Architekturen durch gezieltes Training verdeutlicht das Potenzial, auch ohne radikale Designänderungen signifikante Leistungssprünge zu erzielen.

    Bibliography: - deepseek-ai/DeepSeek-V4-Flash-0731 · Hugging Face (https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731) - DeepSeek-V4-Flash-0731 — Benchmarks, Specs & Release Date (https://aireleasetracker.com/model/deepseek/deepseek-v4-flash-0731) - DeepSeek Upgrades DeepSeek-V4-Flash-0731 with Major Agentic and Coding Gains - MarkTechPost (https://www.marktechpost.com/2026/07/31/deepseek-upgrades-deepseek-v4-flash-0731-with-major-agentic-and-coding-gains/) - DeepSeek V4 Flash: Official Release, Explained (https://www.orcarouter.ai/blog/deepseek-v4-flash-official-release) - DeepSeek V4 Flash 0731: The Official Release, Benchmarks, and How to Run It in OpenCode - Developers Digest (https://www.developersdigest.tech/blog/deepseek-v4-flash-0731-opencode-guide) - DeepSeek V4 Flash Official API (0731): 82.7 Terminal-Bench, $0.14/$0.28 & Agent Upgrades - SeaWork Blog (https://seawork.ai/en/blogs/deepseek-v4-flash-0731/) - README.md · deepseek-ai/DeepSeek-V4-Flash-0731 at main (https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731/blob/main/README.md) - DeepSeek opens V4-Flash API public beta with stronger agent benchmarks | LavX News (https://news.lavx.hu/article/deepseek-opens-v4-flash-api-public-beta-with-stronger-agent-benchmarks) - DeepSeek Opens the Final V4-Flash API - News - Cocoloop (https://news.cocoloop.cn/en/2026/07/deepseek-v4-flash-0731-api/) - DeepSeek-V4-Flash-0731 API & Playground (https://fireworks.ai/models/deepseek-ai/deepseek-v4-flash-0731)

    Artikel jetzt als Podcast anhören

    Kunden die uns vertrauen:
    Arise Health logoArise Health logoThe Paak logoThe Paak logoOE logo2020INC logoEphicient logo
    und viele weitere mehr!

    Bereit für den nächsten Schritt?

    Das Expertenteam von Mindverse freut sich darauf, Ihnen zu helfen.
    Herzlichen Dank! Deine Nachricht ist eingegangen!
    Oops! Du hast wohl was vergessen, versuche es nochmal.

    🚀 Neugierig auf Mindverse Studio?

    Lernen Sie in nur 30 Minuten kennen, wie Ihr Team mit KI mehr erreichen kann – live und persönlich.

    🚀 Demo jetzt buchen