
Von der ersten Idee bis zur voll integrierten KI-Lösung – strukturiert, sicher und mit messbarem Erfolg
Wir analysieren Ihre Geschäftsprozesse und identifizieren konkrete Use Cases mit dem höchsten ROI-Potenzial.
✓ Messbare KPIs definiert
Vollständige Datenschutz-Analyse und Implementierung sicherer Datenverarbeitungsprozesse nach EU-Standards.
✓ 100% DSGVO-konform
Maßgeschneiderte Auswahl der optimalen KI-Lösung – von Azure OpenAI bis zu Open-Source-Alternativen.
✓ Beste Lösung für Ihren Fall
Schneller Proof of Concept mit nahtloser Integration in Ihre bestehende IT-Infrastruktur und Workflows.
✓ Ergebnisse in 4-6 Wochen
Unternehmensweiter Rollout mit umfassenden Schulungen für maximale Akzeptanz und Produktivität.
✓ Ihr Team wird KI-fit
Das deutsche KI-Unternehmen Black Forest Labs (BFL) hat mit der Einführung von FLUX 3 einen signifikanten Fortschritt im Bereich der generativen Künstlichen Intelligenz bekannt gegeben. FLUX 3 ist ein multimodales Fundamentmodell, das in der Lage ist, Videos mit nativem Audio von bis zu 20 Sekunden Länge zu erzeugen. Diese Entwicklung markiert einen wichtigen Schritt hin zu Modellen, die ein umfassenderes Verständnis der realen Welt aufweisen.
Im Gegensatz zu vielen bestehenden Modellen, die auf separaten Modalitäten trainiert und nachträglich miteinander verbunden werden, wurde FLUX 3 simultan mit Bildern, Videos und Audio trainiert. Dieser integrierte Ansatz ermöglicht es dem Modell, ein kohärenteres Verständnis davon zu entwickeln, wie die Welt aussieht, sich bewegt und klingt. BFL argumentiert, dass jede Modalität einzigartige Informationen liefert – Bilder die räumliche Struktur, Videos deren zeitliche Veränderung und Audio die Verbindung zwischen mechanischen Ereignissen und ihren Klängen. Durch die gemeinsame Verarbeitung dieser Daten können die Lücken einer einzelnen Modalität geschlossen und ein tieferes Weltverständnis aufgebaut werden.
FLUX 3 Video demonstriert die Fähigkeit, aus Texteingaben (Text-zu-Video), Bildern (Bild-zu-Video) und anderen Videos (Video-zu-Video) hochwertige Clips zu generieren. Darüber hinaus unterstützt das Modell schlüsselbildbasierte Übergänge (Keyframe-based Transitions) und mehrsprachige Dialoge. Eine weitere bemerkenswerte Funktion ist die Möglichkeit, einzelne Clips durch agentengesteuerte Verknüpfungen zu längeren, mehrszenigen Sequenzen zusammenzufügen. BFL hebt hervor, dass das Modell besonders gut in der Darstellung menschlicher Mimik und der präzisen Abstimmung von Geräuschen auf physische Ereignisse ist.
In internen Vorab-Evaluierungen wurden 10-sekündige Videoclips in 720p-Auflösung generiert und mit denen von acht Konkurrenzmodellen verglichen. BFL berichtet, dass FLUX 3 in 93 Prozent der Vergleiche Luma Ray 3.2 überlegen war, in 77 Prozent Runway Gen-4.5 und in 69 Prozent Grok Imagine Video. Gegenüber stärkeren Wettbewerbern wie Kling v3 Pro (60 Prozent), Happy Horse v1 (59 Prozent), Happy Horse 1.1 (57 Prozent) sowie Seedance 2.0 und Gemini Omni Flash (jeweils 52 Prozent) waren die Präferenzmargen geringer. Diese Ergebnisse sind vorläufig und bedürfen unabhängiger Bestätigung, deuten jedoch auf eine vielversprechende Leistungsfähigkeit hin.
Neben der Videogenerierung soll FLUX 3 auch die Bildgenerierung verbessern, insbesondere bei komplexen Prompts und der präzisen Wiedergabe von Text in verschiedenen Sprachen. Die Veröffentlichung von FLUX 3 Image ist in den kommenden Wochen geplant. Ein weiteres Anwendungsfeld ist die Robotik. BFL hat in Zusammenarbeit mit Mimic Robotics das Modell Flux-mimic entwickelt, ein Video-Aktionsmodell, das derzeit bei Audi für Produktionsaufgaben getestet wird. Diese Fähigkeit zur Vorhersage von Aktionen basiert auf dem tiefgreifenden Weltverständnis des Modells.
Die technologische Grundlage von FLUX 3 bildet Self-Flow, ein Ansatz von BFL, der es einem einzigen Modell ermöglicht, Inhalte gleichzeitig zu generieren und zu verstehen. Ein multimodaler Transformer nutzt dedizierte Komponenten, um Bilder, Videos und Audio in eine gemeinsame interne Repräsentation umzuwandeln und diese dann wieder in Ausgaben zu übersetzen. BFL ist der Ansicht, dass dieser vereinheitlichte Lernprozess im Vergleich zur bisherigen Flow-Matching-Methode sowohl in der Generierungsqualität als auch im Verständnis der physischen Welt überlegen ist.
BFL plant eine gestaffelte Einführung der FLUX 3-Fähigkeiten, beginnend mit FLUX 3 Video, das bereits verfügbar ist. FLUX 3 Image wird in den nächsten Wochen folgen, und die Aktionsvorhersage wird zunächst über ausgewählte Partner angeboten. Darüber hinaus beabsichtigt BFL, einen Open-Weight-Zugang zur multimodalen Architektur unter dem Namen "FLUX 3 Dev" bereitzustellen. Langfristig arbeitet das Unternehmen an Modellen der nächsten Generation, die Wahrnehmung, Aktion und Sprachvorhersage in einem einzigen Modell vereinen sollen.
Für Unternehmen im B2B-Bereich, die auf innovative KI-Lösungen angewiesen sind, stellt FLUX 3 eine vielversprechende Entwicklung dar. Die Fähigkeit, hochwertige Videos mit nativem Audio zu generieren, eröffnet neue Möglichkeiten in den Bereichen Marketing, Content-Erstellung, Simulation und Produktentwicklung. Die Integration von Bild- und Aktionsvorhersage in ein multimodales Modell könnte zudem personalisierte Nutzererfahrungen und effizientere Automatisierungsprozesse ermöglichen. Die strategische Bereitstellung eines Open-Weight-Zugangs deutet auf das Potenzial zur Förderung von Innovationen innerhalb der Entwicklergemeinschaft und zur Schaffung neuer Anwendungsfälle hin.
Die Einführung von FLUX 3 durch Black Forest Labs markiert einen bedeutenden Schritt in der Entwicklung multimodaler KI-Modelle. Durch das integrative Training von Bild, Video und Audio strebt BFL ein umfassenderes Weltverständnis an, das über die Fähigkeiten traditioneller Modelle hinausgeht. Die angekündigten Funktionen und die vielversprechenden internen Benchmarks positionieren FLUX 3 als einen potenziellen Akteur im Wettbewerbsumfeld der Videogenerierung und darüber hinaus in der Robotik und generativen Bildverarbeitung. Die weitere Entwicklung und unabhängige Evaluierung des Modells werden zeigen, inwiefern diese ambitionierten Ziele erreicht und in der Praxis nutzbar gemacht werden können.
Lernen Sie in nur 30 Minuten kennen, wie Ihr Team mit KI mehr erreichen kann – live und persönlich.
🚀 Demo jetzt buchen