
Von der ersten Idee bis zur voll integrierten KI-Lösung – strukturiert, sicher und mit messbarem Erfolg
Wir analysieren Ihre Geschäftsprozesse und identifizieren konkrete Use Cases mit dem höchsten ROI-Potenzial.
✓ Messbare KPIs definiert
Vollständige Datenschutz-Analyse und Implementierung sicherer Datenverarbeitungsprozesse nach EU-Standards.
✓ 100% DSGVO-konform
Maßgeschneiderte Auswahl der optimalen KI-Lösung – von Azure OpenAI bis zu Open-Source-Alternativen.
✓ Beste Lösung für Ihren Fall
Schneller Proof of Concept mit nahtloser Integration in Ihre bestehende IT-Infrastruktur und Workflows.
✓ Ergebnisse in 4-6 Wochen
Unternehmensweiter Rollout mit umfassenden Schulungen für maximale Akzeptanz und Produktivität.
✓ Ihr Team wird KI-fit
Die Landschaft der künstlichen Intelligenz wird kontinuierlich durch Innovationen und neue Entwicklungen geprägt. Ein jüngster Meilenstein ist die Einführung von Qwen3.8-Max durch Alibaba, einem Sprachmodell, das mit beeindruckenden 2,4 Billionen Parametern auf die autonome Bewältigung komplexer und langfristiger Aufgaben ausgelegt ist. Dieses Modell, das auf der Qwen3.5-Architektur aufbaut, repräsentiert einen signifikanten Schritt in Richtung fortgeschrittener Agenten-KI-Fähigkeiten.
Qwen3.8-Max nutzt eine sogenannte Mixture-of-Experts (MoE)-Architektur. Diese ermöglicht es dem Modell, eine enorme Gesamtparameterzahl von 2,4 Billionen zu erreichen, während pro Abfrage lediglich etwa 95 Milliarden Parameter aktiv sind. Dieser Ansatz ist darauf ausgelegt, eine hohe Skalierbarkeit mit einer effizienten Inferenz zu verbinden, was zu reduzierten Rechenkosten und Latenzzeiten im Vergleich zu traditionellen, dichten Modellen ähnlicher Größe führen kann.
Ein zentraler Fokus bei der Entwicklung von Qwen3.8-Max liegt auf der Fähigkeit, komplexe Aufgaben über längere Zeiträume hinweg selbstständig zu bearbeiten, anstatt nur auf einzelne Prompts zu reagieren. Die Kontextfenster des Modells unterstützen bis zu einer Million Tokens, was die Verarbeitung von etwa 750.000 Wörtern pro Eingabe ermöglicht. Dies ist besonders relevant für Aufgaben, die ein tiefes Verständnis und eine langfristige Planung erfordern.
Alibaba hat verschiedene Fallstudien vorgestellt, die die autonomen Fähigkeiten von Qwen3.8-Max illustrieren. Diese reichen von der Softwareentwicklung über die wissenschaftliche Forschung bis hin zu Simulationen im E-Commerce.
In einer bemerkenswerten Fallstudie entwickelte Qwen3.8-Max über einen Zeitraum von 16 Tagen das Kommandozeilen-Tool "oh-my-cli". Das Modell verarbeitete Benutzeranfragen, wandelte diese in GitHub-Issues um, schrieb den Code, führte Tests durch und verbesserte die Ergebnisse iterativ. Bis zum 30. Juli 2026 wurden 265 Commits, 127 Pull Requests und 151 Issues registriert, alles ohne menschliches Eingreifen. Dies demonstriert eine fortgeschrittene Fähigkeit zur Selbstorganisation und kontinuierlichen Verbesserung in einem realen Entwicklungsumfeld.
Eine weitere Anwendung zeigte, wie Qwen3.8-Max ein wissenschaftliches Papier mit dem Titel "Unified Data Selection for LLM Reasoning" erhielt, ohne Startcode. Das Modell reproduzierte die Ergebnisse des Papiers und entwickelte anschließend neue Methoden, die die ursprünglichen Ergebnisse übertrafen. Über etwa fünf Tage und 125 Stunden Rechenzeit schrieb das Modell 7.600 Codezeilen und führte 33 GPU-Trainingsjobs durch. Es reproduzierte nicht nur alle sechs Hauptergebnisse des Papiers, sondern testete auch 18 eigene Ideen in vier Runden und übertraf die Methode des Papiers im AIME24-Mathematik-Benchmark um 2,7 Punkte.
Im Rahmen des E-Commerce-Benchmarks "E-Commerce-Bench" simulierte Qwen3.8-Max ein gesamtes Geschäftsjahr im Online-Handel. Basierend auf anonymisierten Daten von Taobao und Tmall startete das Modell mit einem Kapital von 100.000 Yuan und musste mehrere Online-Shops parallel betreiben. Dies umfasste den Einkauf von Produkten, Preisverhandlungen, Retourenmanagement und die Bewältigung von Krisen wie Taifunen oder Lieferkettenunterbrechungen. Das Modell erzielte ein Endkapital von 416.252 Yuan, was einer Vervierfachung des Startkapitals entspricht und die Leistung des Vorgängermodells Qwen3.7-Max um das 2,5-fache übertraf.
In einer weiteren Fallstudie war Qwen3.8-Max damit beauftragt, einen kryptografischen Baustein für Verschlüsselungsschemata zu entwerfen. Das Modell begann mit einem funktionsfähigen, aber überdimensionierten Design und reduzierte die Anzahl der Logikgatter von 8.298 auf 678 über etwa 500 Iterationen. Nach einem automatisierten Layout-Durchgang mit dem Open-Source-Tool OpenROAD schrumpfte die physische Chipfläche von 106x106 auf 46x46 Mikrometer, eine Reduktion um 81 Prozent. Das Qwen-Team betonte, dass das Modell auch nach Hunderten von Iterationen tiefgreifende strukturelle Änderungen vornahm, anstatt sich auf oberflächliche Anpassungen zu beschränken.
Neben den textbasierten und agentenbasierten Aufgaben zeigt Qwen3.8-Max auch fortgeschrittene multimodale Fähigkeiten. Es kann Dokumente mit über 200 Seiten und Videos von mehr als 100 Stunden Länge verarbeiten. Das Modell ist in der Lage, Rohmaterial in professionelle Vlogs zu verwandeln, immersive Bildungsanimationen aus Textprompts zu generieren und komplette Frontend-Webprojekte aus einem einzigen Screenshot der Benutzeroberfläche zu rekonstruieren.
Ein neuer Benchmark namens RecreationBench testet die Fähigkeit des Modells, laufende Anwendungen ohne Zugang zum Quellcode zu rekonstruieren. Dabei kann das Modell die Zielanwendung nur durch Interaktion, also Klicks und Tastatureingaben, beobachten. Diese Tests umfassen verschiedene Betriebssysteme und Umgebungen wie Ubuntu, macOS, Windows, Android und das Web. Ergänzend dazu wurden Qwen-MM-Plugins veröffentlicht, eine Erweiterungsbibliothek, die Bild- und Videoverarbeitung, visuelle Werkzeugnutzung und multimodales Gedächtnis in bestehende Agentensysteme integriert.
Internen Benchmarks zufolge, die vom Qwen-Team veröffentlicht wurden, liegt Qwen3.8-Max in vielen Kategorien nahe an oder über der Leistung von Modellen wie Claude Opus 4.8, Claude Fable 5 und GPT-5.6 Sol. Auf PaperBench erreichte Qwen3.8-Max mit 93 den höchsten Wert im Vergleich, während es auf TerminalBench 2.1 mit 86,6 Punkten knapp hinter GPT-5.6 Sol (88,8) lag. Es ist jedoch zu beachten, dass diese Ergebnisse aus internen Tests stammen und eine unabhängige Überprüfung noch aussteht.
Die Fähigkeit des Modells, solch langfristige Aufgaben zu bewältigen, wird auf eine erhebliche Erweiterung der Trainingsumgebungen während des Reinforcement Learnings zurückgeführt. Das Training konzentrierte sich nicht mehr nur auf einzelne Aufgaben, sondern umfasste mehrtägige Arbeitsabläufe, verschachtelte Verzeichnisstrukturen anstelle einzelner Dateien und eine Vielzahl von Agenten-Harnesses.
Alibaba plant, die Gewichte von Qwen3.8-Max in der kommenden Woche über Plattformen wie Hugging Face und ModelScope öffentlich zugänglich zu machen. Dies markiert eine Rückkehr zur Open-Source-Strategie für Alibabas Top-Modelle und positioniert das Unternehmen im Wettbewerb mit anderen chinesischen Entwicklern wie Moonshot AI, die ebenfalls leistungsstarke Modelle mit offenen Gewichten veröffentlichen.
Qwen3.8-Max unterstützt sowohl das Chat Completions Format von OpenAI als auch das API-Protokoll von Anthropic, was eine direkte Integration in bestehende Systeme wie Claude Code, Codex, Qoder CLI, Qwen Code und OpenClaw ermöglicht. Ein Parameter namens `reasoning_effort` erlaubt es Benutzern, zwischen drei Stufen zu wählen, die Geschwindigkeit gegen Gründlichkeit abwägen.
Die Einführung von Qwen3.8-Max unterstreicht Alibabas Ambitionen im Bereich der künstlichen Intelligenz und die zunehmende Wettbewerbsintensität auf dem globalen Markt. Die Fokussierung auf autonome, langfristige Aufgaben und die multimodalen Fähigkeiten könnten neue Anwendungsmöglichkeiten für Unternehmen eröffnen, die nach umfassenden KI-Lösungen suchen. Die offene Verfügbarkeit der Modellgewichte signalisiert zudem eine Entwicklung hin zu mehr Transparenz und Kollaboration in der KI-Forschung und -Entwicklung, was für die gesamte Branche von Bedeutung sein könnte.
Lernen Sie in nur 30 Minuten kennen, wie Ihr Team mit KI mehr erreichen kann – live und persönlich.
🚀 Demo jetzt buchen