MVEB: Neuer Benchmark für die Bewertung von Video-Embeddings

Kategorien:

No items found.

Freigegeben:

June 16, 2026

kostenlos testen Termin buchen

KI sauber im Unternehmen integrieren: Der 5-Schritte-Plan

Von der ersten Idee bis zur voll integrierten KI-Lösung – strukturiert, sicher und mit messbarem Erfolg

🎯

Strategie & Zieldefinition

Wir analysieren Ihre Geschäftsprozesse und identifizieren konkrete Use Cases mit dem höchsten ROI-Potenzial.

✓ Messbare KPIs definiert

🛡️

Daten & DSGVO-Compliance

Vollständige Datenschutz-Analyse und Implementierung sicherer Datenverarbeitungsprozesse nach EU-Standards.

✓ 100% DSGVO-konform

⚙️

Technologie- & Tool-Auswahl

Maßgeschneiderte Auswahl der optimalen KI-Lösung – von Azure OpenAI bis zu Open-Source-Alternativen.

✓ Beste Lösung für Ihren Fall

🚀

Pilotprojekt & Integration

Schneller Proof of Concept mit nahtloser Integration in Ihre bestehende IT-Infrastruktur und Workflows.

✓ Ergebnisse in 4-6 Wochen

👥

Skalierung & Team-Schulung

Unternehmensweiter Rollout mit umfassenden Schulungen für maximale Akzeptanz und Produktivität.

✓ Ihr Team wird KI-fit

Lassen Sie uns Ihren ersten Schritt planen

Inhaltsverzeichnis

mindverse studio – Ihre Plattform für digitale Effizienz

‍Optimieren Sie Prozesse, automatisieren Sie Workflows und fördern Sie Zusammenarbeit – alles an einem Ort.

Mehr über Mindverse Studio erfahren

Das Wichtigste in Kürze

MVEB (Massive Video Embedding Benchmark) ist ein neuer, umfassender Benchmark zur Bewertung von Video-Embeddings.
Er umfasst 23 Aufgaben, die verschiedene Aspekte des Video-Verständnisses abdecken, darunter Klassifikation, Zero-Shot-Klassifikation, Clustering, Paar-Klassifikation, Retrieval und Video-basiertes Frage-Antwort-System (QA).
Es wurden 33 Modelle evaluiert, wobei festgestellt wurde, dass kein einzelnes Modell in allen Bereichen überlegen ist.
MLLM-basierte Embeddings zeigen Stärken in Klassifikation, Clustering, Paar-Klassifikation und QA, während multimodales Binding bei Retrieval und Zero-Shot-Klassifikation führend ist.
Die Rolle von Audio bei der Videoanalyse variiert stark je nach Art der Datenannotation.
MVEB ist in das MTEB-Ökosystem integriert, um eine einheitliche Bewertung über verschiedene Modalitäten (Text, Bild, Audio, Video) hinweg zu ermöglichen.

MVEB: Eine neue Ära der Video-Embedding-Bewertung

Die rapide Entwicklung im Bereich der Künstlichen Intelligenz, insbesondere bei multimodalen Modellen, hat die Notwendigkeit robuster und umfassender Bewertungsmethoden für verschiedene Datenmodalitäten verstärkt. Im Kontext von Video-Embeddings, die eine entscheidende Rolle für das Verständnis und die Verarbeitung von Videoinhalten spielen, wurde nun ein signifikantes neues Werkzeug vorgestellt: der Massive Video Embedding Benchmark (MVEB). Dieser Benchmark, der 23 verschiedene Aufgaben umfasst und auf einem Pool von 184 Aufgaben basiert, zielt darauf ab, die Leistung von Video-Embedding-Modellen systematisch zu analysieren und zu vergleichen.

Umfassende Aufgabenbereiche für Video-Embeddings

MVEB deckt ein breites Spektrum an Video-Verständnisaufgaben ab, was seine Relevanz für die Forschung und Entwicklung in diesem Feld unterstreicht. Zu den evaluierten Kategorien gehören:

Klassifikation: Die Zuweisung von Videos zu vordefinierten Kategorien.
Zero-Shot-Klassifikation: Die Klassifikation von Videos, für die das Modell zuvor keine spezifischen Beispiele gesehen hat.
Clustering: Die Gruppierung ähnlicher Videos ohne vorherige Label-Informationen.
Paar-Klassifikation: Die Bewertung der Beziehung zwischen zwei Videos oder Videosegmenten.
Retrieval: Das Auffinden relevanter Videos basierend auf einer Abfrage (z.B. Text, Bild oder anderes Video).
Video-zentriertes Frage-Antwort-System (QA): Die Beantwortung von Fragen, die sich auf den Inhalt eines Videos beziehen.

Diese Vielfalt ermöglicht eine detaillierte Analyse der Stärken und Schwächen unterschiedlicher Embedding-Modelle.

Ergebnisse der Modellbewertung: Keine Einheitslösung

Im Rahmen der Einführung von MVEB wurden 33 verschiedene Modelle evaluiert. Die Ergebnisse zeigen deutlich, dass kein einzelnes Modell in allen Aufgabenbereichen dominant ist. Dies unterstreicht die Komplexität der Videoanalyse und die Notwendigkeit spezialisierter Ansätze für unterschiedliche Anwendungsfälle. Die Analyse ergab spezifische Muster:

MLLM-basierte Embeddings: Modelle, die auf Multimodalen Large Language Models (MLLMs) basieren, zeigten herausragende Leistungen in Aufgaben wie Klassifikation, Clustering, Paar-Klassifikation und Video-zentrierten Frage-Antwort-Systemen.
Multimodales Binding: Ansätze, die auf multimodales Binding setzen, erwiesen sich als besonders effektiv bei Retrieval-Aufgaben und der Zero-Shot-Klassifikation.
Generative MLLMs ohne kontrastive Anpassung: Diese Modelle zeigten bei der Bewältigung von Cross-Modal-Aufgaben Einschränkungen, was auf die Bedeutung einer spezifischen Anpassung für diese Art von Interaktionen hindeutet.

Die Rolle von Audio bei Video-Embeddings

Ein weiterer wichtiger Befund der MVEB-Studie betrifft den Einfluss von Audio auf die Leistung von Video-Embeddings. Durch den Vergleich von Video-only-Evaluierungen mit Audio+Video-Evaluierungen wurde festgestellt, dass der Beitrag von Audio stark von der Art der Datenannotation abhängt:

Positive Auswirkung: Audio trägt positiv zur Leistung bei, wenn die Labels der Datensätze aus beiden Modalitäten (Audio und Video) generiert wurden.
Negative Auswirkung: Wenn Labels ausschließlich visuell erzeugt wurden, kann die Integration von Audio die Leistung sogar beeinträchtigen. Dies deutet auf eine Diskrepanz zwischen den Informationen in der Audio-Spur und den primär visuellen Labels hin.

Dieser "Six-Point-Gap" wurde konsistent über verschiedene Modellfamilien hinweg beobachtet und verdeutlicht die Notwendigkeit, die Datenherkunft und -annotation bei der Entwicklung und Bewertung von multimodalen Modellen sorgfältig zu berücksichtigen.

Integration in das MTEB-Ökosystem

MVEB ist nicht als isolierter Benchmark konzipiert, sondern als integraler Bestandteil des etablierten MTEB-Ökosystems (Massive Text Embedding Benchmark). Diese Integration ermöglicht eine vereinheitlichte Bewertung von Embedding-Modellen über verschiedene Modalitäten hinweg, einschließlich Text, Bild, Audio und Video. Eine solche konsistente Bewertungsplattform ist entscheidend für die Entwicklung von Modellen, die ein umfassendes Verständnis der Welt aus heterogenen Datenquellen ableiten können.

Ausblick und Verfügbarkeit

Die Veröffentlichung von MVEB, einschließlich des umfassenden Aufgabensatzes und der zugehörigen Codebasis, stellt einen wichtigen Schritt zur Standardisierung der Bewertung von Video-Embedding-Modellen dar. Die Bereitstellung eines Leaderboards und der Integration in bestehende Frameworks fördert Transparenz und den wissenschaftlichen Fortschritt. Dies ermöglicht es Forschern und Entwicklern, die Leistung ihrer Modelle unter vergleichbaren Bedingungen zu messen und die Entwicklung robusterer und vielseitigerer KI-Systeme voranzutreiben.

Die Erkenntnisse aus MVEB sind von großer Bedeutung für Unternehmen, die auf Videoanalyse und multimodale KI-Anwendungen angewiesen sind. Sie bieten actionable Insights für die Auswahl und Optimierung von Embedding-Modellen, um spezifische Geschäftsziele effizienter zu erreichen.

Bibliography

- El Assadi, A., Solomatin, R., Chung, I., Xiao, C., Shah, D., Dey, M., Sudhakar, S., Bugaud, Z., Siblini, W., Munot, A. S., Devavarapu, Y., Ireddi, R., Yang, M., Kardos, M., Muennighoff, N., & Enevoldsen, K. C. (2026). MVEB: Massive Video Embedding Benchmark. arXiv. https://arxiv.org/abs/2606.14958 - embeddings-benchmark/mteb. (n.d.). benchmarks: add MVEB benchmark suite + leaderboard Video menu (#4763) · b5e03a4 · embeddings-benchmark/mteb. GitHub. https://github.com/embeddings-benchmark/mteb/commit/b5e03a413d6fefb852fe5e64bba9d0a7c8fe5222 - embeddings-benchmark/mteb. (n.d.). mteb/tasks/multichoice/eng/video_mme.py at 9e29c442 · embeddings-benchmark/mteb. GitHub. https://github.com/embeddings-benchmark/mteb/blob/9e29c442/mteb/tasks/multichoice/eng/video_mme.py - Huang, H., Lu, X., Su, M., Zhang, X., Jiang, Z., Nie, P., Zou, K., Pfister, T., Chen, W., Shen, X., & Meng, R. (2026). MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models. arXiv. https://arxiv.org/html/2604.23321 - TIGER-Lab. (n.d.). VLM2Vec - GitHub Pages. https://tiger-ai-lab.github.io/VLM2Vec/ - Computer Vision Foundation. (n.d.). ICCV 2025 Open Access Repository. https://openaccess.thecvf.com/content/ICCV2025/html/Xiao_MIEB_Massive_Image_Embedding_Benchmark_ICCV_2025_paper.html - Guo, Z., Li, M., Zhang, Y., Long, D., Xie, P., & Chu, X. (2025). Towards Universal Video Retrieval: Generalizing Video Embedding via Synthesized Multimodal Pyramid Curriculum. arXiv. https://arxiv.org/html/2510.27571v1 - UNDERCODE NEWS. (2026, June 12). MTEB EMBEDDING LEADERBOARD REBORN: A NEW ERA OF SPEED, TRANSPARENCY, AND MODEL DISCOVERY + Video. https://undercodenews.com/mteb-embedding-leaderboard-reborn-a-new-era-of-speed-transparency-and-model-discovery-video/ - Hugging Face. (n.d.). TIGER-Lab/MMEB_Raw_Video · Datasets at Hugging Face. https://huggingface.co/datasets/TIGER-Lab/MMEB_Raw_Video - Springer Nature Link. (2026, June 6). Mllm-guided hierarchical semantic ensemble with adaptive visual fusion for zero-shot composed video retrieval | Multimedia Systems. https://link.springer.com/article/10.1007/s00530-026-02394-8