KI für Ihr Unternehmen – Jetzt Demo buchen

Effiziente Optimierung von Diffusionsmodellen durch Nunchaku 4-Bit-Quantisierung

Kategorien:
No items found.
Freigegeben:
July 24, 2026

KI sauber im Unternehmen integrieren: Der 5-Schritte-Plan

Von der ersten Idee bis zur voll integrierten KI-Lösung – strukturiert, sicher und mit messbarem Erfolg

1
🎯

Strategie & Zieldefinition

Wir analysieren Ihre Geschäftsprozesse und identifizieren konkrete Use Cases mit dem höchsten ROI-Potenzial.

✓ Messbare KPIs definiert

2
🛡️

Daten & DSGVO-Compliance

Vollständige Datenschutz-Analyse und Implementierung sicherer Datenverarbeitungsprozesse nach EU-Standards.

✓ 100% DSGVO-konform

3
⚙️

Technologie- & Tool-Auswahl

Maßgeschneiderte Auswahl der optimalen KI-Lösung – von Azure OpenAI bis zu Open-Source-Alternativen.

✓ Beste Lösung für Ihren Fall

4
🚀

Pilotprojekt & Integration

Schneller Proof of Concept mit nahtloser Integration in Ihre bestehende IT-Infrastruktur und Workflows.

✓ Ergebnisse in 4-6 Wochen

5
👥

Skalierung & Team-Schulung

Unternehmensweiter Rollout mit umfassenden Schulungen für maximale Akzeptanz und Produktivität.

✓ Ihr Team wird KI-fit

Inhaltsverzeichnis

    mindverse studio – Ihre Plattform für digitale Effizienz

    Optimieren Sie Prozesse, automatisieren Sie Workflows und fördern Sie Zusammenarbeit – alles an einem Ort.
    Mehr über Mindverse Studio erfahren

    Das Wichtigste in Kürze

    • Die Integration von Nunchaku 4-Bit-Quantisierung in Diffusers ermöglicht effizientere Diffusion Inference.
    • Dies reduziert den VRAM-Bedarf erheblich und beschleunigt den Denoising-Loop.
    • Nunchaku Lite bietet eine native Ladefunktion in Diffusers ohne separate Inferenz-Engine.
    • Die Technologie basiert auf SVDQuant, welches 4-Bit-Gewichte und -Aktivierungen nutzt.
    • Benchmark-Ergebnisse zeigen eine Reduzierung des Spitzen-VRAM um bis zu 50 % und eine Beschleunigung um ca. 30 %.
    • Die Kombination mit `torch.compile` und quantisierten Text-Encodern kann die Leistung weiter steigern.
    • Ein Toolkit namens `diffuse-compressor` ermöglicht die Quantisierung eigener Modelle.

    Sehr geehrte Leserin, sehr geehrter Leser,

    Die rapide Entwicklung im Bereich der generativen Künstlichen Intelligenz stellt Unternehmen und Entwickler vor die Herausforderung, leistungsstarke Modelle effizient zu betreiben. Insbesondere Diffusionstransformer, die für die Erstellung hochauflösender Bilder und anderer Medieninhalte eingesetzt werden, erfordern oft erhebliche Mengen an Grafikspeicher (VRAM). Dies kann den Einsatz auf Consumer-Hardware oder in kostensensiblen B2B-Umgebungen limitieren. Eine vielversprechende Lösung für diese Herausforderung ist die 4-Bit-Quantisierung, die nun durch die Integration von Nunchaku in die Diffusers-Bibliothek weitreichende Anwendung findet.

    Die Herausforderung der Effizienz bei Diffusionsmodellen

    Moderne Text-zu-Bild-Modelle, selbst in BF16-Präzision, benötigen typischerweise 20-30 GB VRAM. Dies übersteigt die Kapazitäten vieler gängiger GPUs und schränkt die Zugänglichkeit sowie die Skalierbarkeit ein. Quantisierung stellt einen etablierten Ansatz dar, um diesen Speicherbedarf zu reduzieren. Während viele bestehende Quantisierungs-Backends wie bitsandbytes oder GGUF primär gewichtsbasierte Optimierungen vornehmen, die den Speicherverbrauch senken, aber nicht zwingend die Inferenzgeschwindigkeit erhöhen, geht Nunchaku einen Schritt weiter.

    Nunchaku und SVDQuant: Eine neue Dimension der Optimierung

    Die Nunchaku-Inferenz-Engine, basierend auf der Quantisierungsmethode SVDQuant, verfolgt einen anderen Ansatz. Sie führt die Haupttransformator-Ebenen mit 4-Bit-Gewichten und -Aktivierungen (W4A4) aus. Dies reduziert nicht nur den Speicherbedarf, sondern beschleunigt auch den Denoising-Loop, einen zentralen Bestandteil des Diffusionsprozesses. SVDQuant adressiert das Problem großer Ausreißer in Gewichten und Aktivierungen, die bei der traditionellen 4-Bit-Quantisierung zu Qualitätseinbußen führen können. Dies geschieht durch die Verlagerung von Aktivierungs-Ausreißern in die Gewichte und die Darstellung des anspruchsvollsten Teils jeder Gewichtsmatrix mit einem kleinen 16-Bit Low-Rank-Branch. Der verbleibende Rest wird auf 4 Bit quantisiert. Nunchaku nutzt hierbei optimierte Fused-Kernel für den 4-Bit-Pfad und den Low-Rank-Branch, um eine hohe Geschwindigkeit zu gewährleisten.

    Bisher erforderte die Nutzung von SVDQuant-Checkpoints eine separate Inferenz-Bibliothek. Die jüngste Integration in Diffusers vereinfacht diesen Prozess erheblich und ermöglicht ein nahtloses Laden dieser Modelle.

    Nunchaku Lite: Nahtlose Integration in Diffusers

    Mit der aktuellen Version von Diffusers ist das Laden eines Nunchaku-Checkpoints durch einen einfachen Aufruf von from_pretrained() möglich. Dank des kernels-Pakets entfällt die Notwendigkeit einer lokalen CUDA-Kompilierung. Darüber hinaus bietet das begleitende Toolkit diffuse-compressor die Möglichkeit, neue Architekturen selbst zu quantisieren und als reguläre Diffusers-Repositories zu veröffentlichen.

    Nunchaku Lite stellt den neuen Integrationspfad in Diffusers dar. Es ermöglicht Diffusers, Nunchaku-ähnliche Checkpoints ohne eine benutzerdefinierte Pipeline oder eine separate Inferenz-Engine zu laden. Im Hintergrund modifiziert Nunchaku Lite die relevanten nn.Linear-Module eines Standard-Diffusers-Modells mit SVDQ/AWQ-Linear-Layern zur Laufzeit, bevor der Checkpoint geladen wird. Die CUDA-Kernel werden bei der ersten Verwendung vom Hub über die Nunchaku Lite kernels page heruntergeladen. Dabei kommen zwei Kernel-Familien zum Einsatz:

    • svdq_w4a4: 4-Bit-Gewichte und -Aktivierungen mit der SVDQuant Low-Rank-Korrektur. Dieser Layer wird für die Aufmerksamkeits- und MLP-Projektionen des Transformers verwendet, wo der Großteil der Rechenleistung anfällt. Er ist sowohl in INT4- als auch in NVFP4-Varianten verfügbar.
    • awq_w4a16: 4-Bit-Gewichte mit 16-Bit-Aktivierungen, eingesetzt für adaptive Normalisierungs- und Modulationsprojektionen wie FLUX adanorm_single / adanorm_zero oder Qwen-Image Modulations-Layer. Diese Layer sind speicherintensiv und präzisionsempfindlich, wodurch AWQ eine gute Wahl ist, um die Präzision zu erhalten und gleichzeitig Speicherplatz zu sparen.

    Ein Kompromiss besteht darin, dass Nunchaku Lite ohne architekturspezifische Fused-Kernel und Module nicht die gleiche Geschwindigkeitssteigerung wie die ursprüngliche Nunchaku-Engine erreichen kann. Dennoch liefert die Implementierung eine Beschleunigung von rund 30 % bei gleicher Reduzierung des VRAM-Bedarfs.

    Native Ladefunktion in Diffusers

    Die Mechanik von Nunchaku Lite ist vergleichbar mit der Nutzung von bitsandbytes oder torchao in Diffusers. Ein Nunchaku Lite Modell-Repository ist ein gewöhnliches Diffusers-Repository. Einzigartig ist der quantization_config-Block innerhalb der config.json des Transformers:

    "quantization_config": {
        "quant_method": "nunchaku_lite",
        "compute_dtype": "bfloat16",
        "svdq_w4a4": {
            "precision": "nvfp4",
            "group_size": 16,
            "rank": 32,
            "targets": [
                "layers.0.self_attention.to_q",
                "layers.0.self_attention.to_k",
                "..."
            ]
        },
        "awq_w4a16": {
            "precision": "int4",
            "group_size": 64,
            "targets": [
                "adaLN_modulation.1",
                "..."
            ]
        }
    }
    

    Diese Konfiguration informiert Diffusers darüber, welche Module quantisiert wurden, welches Schema sie verwenden und welcher Nunchaku Lite Laufzeit-Layer instanziiert werden soll (SVDQW4A4Linear oder AWQW4A16Linear).

    Da das quantisierte Modell die exakte Modulstruktur des dichten Modells beibehält, sieht alles nachgelagerte (Scheduler, LoRA-Ladehaken, Offloading, torch.compile) ein normales Diffusers-Modell.

    Hardware-Unterstützung

    Nunchaku Lite nutzt je nach GPU-Generation und Checkpoint-Präzision unterschiedliche Kernel-Varianten:

    Schema: svdq_w4a4

    Präzision: nvfp4

    Unterstützte GPUs: Blackwell (RTX 50-Serie, RTX PRO 6000, B200)

    Schema: svdq_w4a4

    Präzision: int4

    Unterstützte GPUs: Turing / Ampere / Ada (RTX 30- & 40-Serie, A100, L40S)

    Schema: awq_w4a16

    Präzision: int4

    Unterstützte GPUs: Turing / Ampere / Ada (RTX 30- & 40-Serie, A100, L40S)

    Volta- und Hopper-GPUs werden derzeit von den 4-Bit-Kernels nicht unterstützt. Der Quantisierer validiert zur Ladezeit die CUDA-Fähigkeit der GPU und gibt bei Inkompatibilität eine Fehlermeldung aus.

    Leistungssteigerung und Speichereinsparung

    Nunchaku Lite lässt sich mit weiteren Diffusers-Optimierungen für Speicher und Geschwindigkeit kombinieren:

    • torch.compile: Das Kompilieren des Transformers kann die End-to-End-Beschleunigung von 1,35x auf 1,8x verbessern.
    • Quantisierte Text-Encoder: Text-Encoder wie T5 oder Qwen3 können selbst mehrere Gigabyte belegen. Eine weitere Quantisierung des Text-Encoders mit bitsandbytes NF4 reduziert den Spitzen-VRAM um etwa 22 %.
    • Offloading: Diffusers-Offloading-Helfer wie enable_model_cpu_offload() und enable_sequential_cpu_offload() funktionieren wie gewohnt, um die Pipeline auf eine kleinere GPU anzupassen.

    Benchmarks

    Alle untenstehenden Zahlen wurden auf einer NVIDIA RTX PRO 6000 (Blackwell) bei 1024x1024 Pixeln unter Verwendung von rootonchair/ERNIE-Image-Turbo-nunchaku-lite-int4-bnb4-text-encoder ermittelt.

    End-to-End-Latenz und -Speicher

    Konfiguration: BF16 Baseline

    Volle Pipeline: 3.00 s

    Denoise Loop: 2.86 s

    Peak VRAM: 31.1 GB

    Speedup: 1.0x

    Konfiguration: Nunchaku Lite NVFP4

    Volle Pipeline: 2.27 s

    Denoise Loop: 2.13 s

    Peak VRAM: 20.6 GB

    Speedup: 1.35x

    Konfiguration: Nunchaku Lite NVFP4 + torch.compile

    Volle Pipeline: 1.68 s

    Denoise Loop: 1.53 s

    Peak VRAM: 20.6 GB

    Speedup: 1.8x

    Konfiguration: Nunchaku Lite NVFP4 + NF4 Text-Encoder

    Volle Pipeline: 2.29 s

    Denoise Loop: 2.13 s

    Peak VRAM: 16.0 GB

    Speedup: 1.35x

    Die Ergebnisse zeigen, dass Nunchaku den Spitzen-VRAM um bis zu 50 % reduziert und gleichzeitig die Latenz um etwa 30 % verbessert. Der verbleibende Overhead wird durch zusätzliche Kernel-Starts verursacht, die torch.compile abmildern kann, wodurch die gesamte Pipeline auf 1,68 s reduziert wird, was einer 1,8-fachen Beschleunigung gegenüber der BF16-Baseline entspricht.

    Bildqualität

    Vergleiche zwischen BF16- und 4-Bit-Outputs mit identischen Seeds und Einstellungen zeigen, dass die Bildqualität nahe am Original bleibt, während die Effizienzvorteile realisiert werden.

    Eigenes Modell quantisieren

    Die Nunchaku Lite Unterstützung in Diffusers ist architekturagnostisch. Das diffuse-compressor Toolkit bietet einen End-to-End-SVDQuant-Workflow für Diffusers-Modelle: kalibrieren, quantisieren, paketieren und veröffentlichen.

    Am Beispiel der Quantisierung von FLUX.2 Klein 4B können die Hauptschritte illustriert werden:

    1. Inspektion des Modells

    Der generische Scanner analysiert das Modell und identifiziert die zu quantisierenden Ziele: Kompatible Lineare innerhalb des wiederholten Transformatoren-Block-Stacks werden zu SVDQ W4A4-Zielen, erkannte Modulations-Lineare werden zu AWQ W4A16-Zielen, und alle anderen bleiben dicht. Es ist ratsam, diesen Bericht vor der Quantisierung zu prüfen, um die korrekte Zuordnung der Ziele sicherzustellen.

    2. Quantisierung durchführen

    Der Befehl zur Ausführung von SVDQuant auf dem Transformer schreibt den quantisierten Checkpoint in ein spezifisches Verzeichnis. Dabei kann zwischen int4 und nvfp4 für die Blackwell-native Gewichtskonfiguration gewählt werden.

    3. Diffusers-Pipeline paketieren

    Der Konverter kombiniert den quantisierten Transformer mit den anderen Komponenten der Basis-Pipeline, schreibt die kompakte nunchaku_lite-Konfiguration in die transformer/config.json und kann optional Text-Encoder in NF4 konvertieren.

    4. Laden, Verifizieren und auf den Hub pushen

    Nachdem die Ausgaben zufriedenstellend sind, kann das Modell über pipe.push_to_hub() auf den Hugging Face Hub hochgeladen werden, wo es von anderen Benutzern über den gleichen from_pretrained()-Mechanismus geladen werden kann.

    Quantisierung von Modellen mit strukturellen Umschreibungen

    Der generische Pfad setzt voraus, dass die Architektur ohne strukturelle Umschreibungen quantisiert werden kann. Für zusätzliche Geschwindigkeitssteigerungen schreibt die ursprüngliche Nunchaku-Engine Gruppen von Diffusers-Layern als Fused-Module um. Der generische Pfad kann diese Änderungen nicht eigenständig inferieren, wie beispielsweise das Kombinieren separater Q-, K- und V-Projektionen in ein Modul oder das Aufteilen einer Fused-Projektion über mehrere Module.

    Ein konkretes Beispiel ist die QKV-Projektion von FLUX.1-dev. Während Diffusers drei separate Module definiert (to_q, to_k, to_v), kombiniert das Nunchaku FLUX-Modul diese Layer zu einem quantisierten to_qkv-Modul. Dies ist erforderlich, da Nunchakus Fused-Operator die QKV-Projektion, Q/K-Normalisierung und Rotations-Embeddings zusammen verarbeitet. Solche strukturellen Umschreibungen werden durch eine modellspezifische Zielkonfiguration während der Quantisierung beschrieben und von einem kleinen Laufzeit-Adapter beim Laden des Checkpoints gehandhabt.

    Vorgefertigte Checkpoints

    Für einen schnellen Einstieg stehen bereits einige Repositories zur Verfügung:

    • rootonchair/ERNIE-Image-Turbo-nunchaku-lite-int4-bnb4-text-encoder: INT4 ERNIE-Image-Turbo mit einem bitsandbytes NF4 Text-Encoder
    • rootonchair/ERNIE-Image-Turbo-nunchaku-lite-nvfp4-bnb4-text-encoder: NVFP4 ERNIE-Image-Turbo mit einem bitsandbytes NF4 Text-Encoder
    • OzzyGT/Krea_2_Turbo_nunchaku_lite_nvfp4: NVFP4 Krea 2 Turbo Checkpoint
    • lite-infer: Weitere Nunchaku Lite Checkpoints und Kollektionen

    Fazit

    Die SVDQuant-Kernel von Nunchaku stellen eine effektive Methode dar, um Diffusionstransformer effizient auf Consumer-Hardware zu betreiben. Ihre native Unterstützung in Diffusers ermöglicht es, vorquantisierte Checkpoints einfach über from_pretrained() zu laden. Das diffuse-compressor Toolkit bietet zudem die Möglichkeit, neue Architekturen selbst zu quantisieren, ohne auf Engine-Unterstützung warten zu müssen. Durch die Quantisierung von Gewichten und Aktivierungen reduziert der W4A4-Pfad den Speicherverbrauch und verbessert gleichzeitig die Denoising-Latenz, wobei die Bildqualität nahe am BF16-Original bleibt. Diese Entwicklungen sind für Unternehmen, die generative KI-Modelle in ihren Workflows implementieren möchten, von besonderer Relevanz, da sie einen effizienteren und kostengünstigeren Betrieb ermöglichen.

    Bibliographie

    • Hugging Face Blog. (2026, July 23). Bringing Nunchaku 4-bit Diffusion Inference to Diffusers. Abgerufen von https://huggingface.co/blog/nunchaku-diffusers
    • GitHub. (n.d.). huggingface/diffusers: 60ec6f7 Add Nunchaku Lite single-file quantization (#14100). Abgerufen von https://github.com/huggingface/diffusers/commit/60ec6f724290fb7640abaf3ca9a2b89bc15e8a8b
    • Nunchaku Documentation. (n.d.). Basic Usage — Nunchaku 1.3.0 documentation. Abgerufen von https://nunchaku.tech/docs/nunchaku/usage/basic_usage.html
    • GitHub. (n.d.). nunchaku-ai/nunchaku: [ICLR2025 Spotlight] SVDQuant .... Abgerufen von https://github.com/nunchaku-ai/nunchaku
    • Nunchaku Documentation. (n.d.). nunchaku.models.transformers.transformer_flux — Nunchaku 1.3.0 documentation. Abgerufen von https://nunchaku.tech/docs/nunchaku/python_api/nunchaku.models.transformers.transformer_flux.html
    • Nunchaku Documentation. (n.d.). Nunchaku 1.3.0 documentation. Abgerufen von https://nunchaku.tech/docs/nunchaku/
    • DeepWiki. (2026, March 7). Python API and Examples | nunchaku-tech/nunchaku | DeepWiki. Abgerufen von https://deepwiki.com/nunchaku-tech/nunchaku/6.1-python-api-and-examples
    • Nunchaku Documentation. (n.d.). Customized LoRAs — Nunchaku 1.3.0 documentation. Abgerufen von https://nunchaku.tech/docs/nunchaku/usage/lora.html
    • Nunchaku Documentation. (n.d.). Qwen-Image-Edit — Nunchaku 1.3.0 documentation. Abgerufen von https://nunchaku.tech/docs/nunchaku/usage/qwen-image-edit.html
    • Nunchaku Documentation. (n.d.). ControlNets — Nunchaku 1.3.0 documentation. Abgerufen von https://nunchaku.tech/docs/nunchaku/usage/controlnet.html

    Artikel jetzt als Podcast anhören

    Kunden die uns vertrauen:
    Arise Health logoArise Health logoThe Paak logoThe Paak logoOE logo2020INC logoEphicient logo
    und viele weitere mehr!

    Bereit für den nächsten Schritt?

    Das Expertenteam von Mindverse freut sich darauf, Ihnen zu helfen.
    Herzlichen Dank! Deine Nachricht ist eingegangen!
    Oops! Du hast wohl was vergessen, versuche es nochmal.

    🚀 Neugierig auf Mindverse Studio?

    Lernen Sie in nur 30 Minuten kennen, wie Ihr Team mit KI mehr erreichen kann – live und persönlich.

    🚀 Demo jetzt buchen