
Von der ersten Idee bis zur voll integrierten KI-Lösung – strukturiert, sicher und mit messbarem Erfolg
Wir analysieren Ihre Geschäftsprozesse und identifizieren konkrete Use Cases mit dem höchsten ROI-Potenzial.
✓ Messbare KPIs definiert
Vollständige Datenschutz-Analyse und Implementierung sicherer Datenverarbeitungsprozesse nach EU-Standards.
✓ 100% DSGVO-konform
Maßgeschneiderte Auswahl der optimalen KI-Lösung – von Azure OpenAI bis zu Open-Source-Alternativen.
✓ Beste Lösung für Ihren Fall
Schneller Proof of Concept mit nahtloser Integration in Ihre bestehende IT-Infrastruktur und Workflows.
✓ Ergebnisse in 4-6 Wochen
Unternehmensweiter Rollout mit umfassenden Schulungen für maximale Akzeptanz und Produktivität.
✓ Ihr Team wird KI-fit
Die Entwicklung von Künstlicher Intelligenz, insbesondere im Bereich der Large Language Models (LLMs), schreitet kontinuierlich voran. Ein zentraler Aspekt bei der Optimierung dieser Modelle ist das Reinforcement Learning (RL), welches die Ausrichtung der Modellantworten an spezifischen Kriterien ermöglicht. Eine aktuelle Entwicklung, die in diesem Kontext besondere Aufmerksamkeit erregt, ist die Einführung der CoRT-Methode (Counterfactual Replay for Token-level credit weighting). Diese Methode stellt einen Paradigmenwechsel in der Art und Weise dar, wie Belohnungssignale auf die einzelnen Komponenten von generierten Texten angewendet werden.
Im Bereich des Reinforcement Learning mit Rubriken, wie es beispielsweise in GRPO-Pipelines (Generative Reinforcement Learning with Policy Optimization) praktiziert wird, besteht eine grundlegende Herausforderung: Detaillierte, auf Rubriken basierende Bewertungen, die Aspekte wie Korrektheit, Formatierung oder semantische Kohärenz einer Antwort umfassen, werden traditionell zu einem einzigen, skalaren Belohnungswert zusammengefasst. Dieser Wert wird anschließend uniform auf alle Tokens der generierten Antwort angewendet. Das bedeutet, dass jedes Wort oder Satzzeichen in einer Antwort den gleichen Anteil an der Gesamtbelohnung erhält, unabhängig davon, welchen spezifischen Beitrag es zu der Erfüllung oder Nichterfüllung der jeweiligen Rubrik-Kriterien leistet.
Dieses Vorgehen birgt eine inhärente Ineffizienz. Wenn beispielsweise ein einziger Formatierungsfehler in einer ansonsten perfekten Antwort zu einer Abwertung führt, wird diese negative Belohnung auf alle Tokens der gesamten Antwort verteilt. Es fehlt an einem expliziten Mechanismus zur Kreditzuweisung innerhalb der Antwort, selbst wenn verschiedene Kriterien an unterschiedliche Textabschnitte, Formatierungsentscheidungen oder semantische Ausdrücke gebunden sind. Dies kann die Lernprozesse des Modells erschweren, da es schwierig wird, präzise zu identifizieren, welche spezifischen Token oder Token-Sequenzen für positive oder negative Bewertungen verantwortlich sind.
Hier setzt die CoRT-Methode an. CoRT schlägt eine Token-Ebene-Kreditgewichtung vor, die speziell für rubrik-konditioniertes GRPO entwickelt wurde. Anstatt ein separates Modell zur Token-Bewertung zu trainieren, nutzt CoRT ein Verfahren namens "Counterfactual Replay". Bei diesem Ansatz wird dieselbe Stichprobenantwort unter zwei verschiedenen Bedingungen neu bewertet:
Durch den Vergleich der Log-Likelihoods der Tokens unter diesen beiden Bedingungen können Token-spezifische Kontraste ermittelt werden. Diese Kontraste dienen als Gewichtungsfaktoren, die anzeigen, inwieweit ein einzelnes Token zur Erfüllung oder Verletzung der Rubrik-Kriterien beiträgt. Im Wesentlichen ermöglicht CoRT dem Modell, zu lernen, welche Teile einer generierten Antwort für welche Aspekte der Rubrik-Bewertung verantwortlich sind.
Die Einführung von CoRT hat zu signifikanten Verbesserungen geführt. Berichte zeigen einen durchschnittlichen Gewinn von 4,4 Prozentpunkten gegenüber den herkömmlichen GRPO-Baselines. Diese Verbesserung wurde über verschiedene instruktionsgesteuerte Modelle und Belohnungsgranularitäten hinweg beobachtet. Die Experimente umfassten Modelle wie Qwen3-4B-Instruct, Qwen2.5-7B-Instruct und Qwen3-14B, die auf verschiedenen Benchmarks wie IFBench, IFEval, MultiDimIF und AdvancedIF getestet wurden. Darüber hinaus wurde die Kompatibilität von CoRT mit bestehenden Reinforcement Learning Frameworks wie DAPO (Direct Advantage Policy Optimization) und GSPO (Generative Sample Policy Optimization) demonstriert.
Diese Ergebnisse deuten darauf hin, dass CoRT eine effektive Methode darstellt, um die Effizienz des Reinforcement Learnings für Sprachmodelle zu steigern, indem es ein präziseres und detaillierteres Feedback auf Token-Ebene ermöglicht. Dies ist insbesondere für B2B-Anwendungen relevant, bei denen die Qualität und Präzision von KI-generierten Inhalten von entscheidender Bedeutung sind.
Für Unternehmen, die auf Large Language Models setzen – sei es für die Content-Erstellung, Kundenkommunikation oder andere innovative Anwendungen – bietet CoRT die Möglichkeit, die Leistungsfähigkeit und Zuverlässigkeit ihrer KI-Systeme weiter zu optimieren. Eine präzisere Kreditzuweisung auf Token-Ebene kann zu folgenden Vorteilen führen:
Die CoRT-Methode repräsentiert somit einen wichtigen Schritt in der Entwicklung von KI-Modellen, die nicht nur in der Lage sind, komplexe Anweisungen zu befolgen, sondern dies auch mit einer bisher unerreichten Präzision auf der Ebene einzelner Sprachelemente tun. Für Anwender und Entwickler im B2B-Bereich bedeutet dies ein höheres Potenzial für maßgeschneiderte und qualitativ hochwertige KI-Lösungen.
Bibliographie
- Zhang, Bo-Wen et al. (2026). CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization. arXiv. - Dufresne, Alexis (2026). CoRT adds token-level credit to GRPO for a 4.4-point gain. AI Weekly. - Guo, Lan-Zhe et al. (2026). CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization. alphaXiv. - Hugging Face (2026). Paper page - CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization. - alphaXiv (2026). CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization.Lernen Sie in nur 30 Minuten kennen, wie Ihr Team mit KI mehr erreichen kann – live und persönlich.
🚀 Demo jetzt buchen