← Start

RAG Embedding Modelle

Kuratierte Top-5 Embedding-Modelle für Retrieval-Augmented Generation — mit konkreter RAG-Empfehlung je Modell, MTEB-Scores, Lizenz, EU-Fit und Hosting-Variante. Auswahl-Kriterien: EU-Sovereignty, permissive Lizenz für kommerzielle RAG, DE/Multilingual-MTEB-Performance.

Stand: 20. Juli 2026 · Basis: MTEB Multilingual, MTEB-Code, Provider-Dokumentation, Hugging Face Hub-Statistiken, interner EU-Deep-Research-Report

#1

Qwen3-Embedding-8B

Alibaba
EU-Fit hoch Self-Host Apache 2.0 8B

Top-Tier mehrsprachige RAG + Code-Retrieval auf EU-GPU mit Budget für 8B-Inferenz.

Aktuell stärkstes Open-Source-Embedding-Modell (MTEB Multilingual 70,58, MTEB-Code Top-1). 100+ Sprachen, 32K-Kontext, MRL 32–4096 Dims für Storage-Tradeoffs. Best Choice für RAG-Pipelines mit hohem Qualitätsanspruch und vorhandenem GPU-Budget; Apache-2.0-Lizenz erlaubt unbeschränkte kommerzielle Nutzung trotz CN-Origin, weil Inferenz vollständig in eigener EU-Infrastruktur läuft.

Dims:
4096 Dim (MRL 32–4096)
Kontext:
32.768 Tokens
Sprachen:
100+ (inkl. DE, Code)
MTEB:
Multi 70.58 · Code 70

CN-Origin (Alibaba), aber Apache-2.0-lizenziert — Inferenz läuft vollständig auf eigener EU-GPU, keine Provider-Telemetrie.

Stärken

  • + MTEB Multilingual #1 (70,58) — schlägt OpenAI & Cohere API-Modelle
  • + Apache 2.0 — kommerziell unbeschränkt, Self-Host auf EU-GPU
  • + 32K-Kontext + MRL (32–4096 Dims) für flexible Vektor-Datenbanken

Limitierungen

  • − 8B Parameter → ~16 GB VRAM für FP16-Inferenz
  • − CN-Origin (Alibaba) — Supply-Chain-Audit der HF-Artefakte ratsam
  • − Höherer TCO als 568M-Modelle bei hohem Indexierungsvolumen
#2

BGE-M3

BAAI
EU-Fit hoch Self-Host MIT 568M

DACH-Multilingual-RAG mit nativem Hybrid Dense+Sparse Retrieval auf knapper GPU.

Multilinguales Embedding-Workhorse (568M Parameter, MIT-lizenziert) auf einer einzelnen L4/A10 GPU. Einzigartig: nativer Hybrid-Modus (Dense + Sparse + Multi-Vector) in einem Forward-Pass, ideal wenn Recall in juristischen oder industriellen Dokumenten-Korpora maximiert werden muss. 8K-Kontext, 100+ Sprachen mit starker DE-Performance. Erste Wahl für DACH-RAG auf knappem GPU-Budget.

Dims:
1024 Dim
Kontext:
8.192 Tokens
Sprachen:
100+
MTEB:
Multi 68

CN-Origin (BAAI Peking), MIT-lizenziert — Inferenz auf eigener EU-GPU, weltweit am breitesten in OSS-Vektor-DBs unterstützt.

Stärken

  • + Hybrid Dense + Sparse + Multi-Vector in einem Forward-Pass
  • + MIT-Lizenz + 568M Parameter → läuft auf einzelner L4/A10
  • + 8K Kontext, 100+ Sprachen, starke DE-Performance

Limitierungen

  • − Kein MRL — fixe 1024-Dim-Vektoren
  • − CN-Origin (BAAI Peking) — Supply-Chain-Audit der HF-Artefakte ratsam
  • − Hybrid braucht Vektor-DB-Support (Milvus, Vespa, Qdrant)
#3

Gemini Embedding 2

Google
EU-Fit mittel API proprietär (API) API

Multimodale RAG-Pipelines (PDF/Bild/Audio in einem Vektorraum) ohne Self-Host-Aufwand.

Googles erstes natively multimodales Embedding (text/image/video/audio/PDF in einem 3072-dim Vektorraum), MRL bis 128 Dims runter. MTEB Multilingual 69,9 (Top-API). GA-API gemini-embedding-2 über Vertex AI EU-Region verfügbar, $0.20/Mtok. Best Choice wenn RAG-Quellen heterogen sind (PDFs mit Diagrammen, Audio-Memos) und Self-Host-Komplexität vermieden werden soll.

Dims:
3072 Dim (MRL 128–3072)
Kontext:
8.192 Tokens
Sprachen:
100+ (im MTEB-Benchmark über 250+ Sprachen evaluiert)
MTEB:
Multi 69.9 · Code 84
Preis:
~€0.180 / Mtok

US-Provider; EU-Endpoint über Vertex AI (europe-west1/3/4) verfügbar, Standard-Vertex-DPA gilt.

Stärken

  • + Erstes natively multimodales Embedding (Text/Bild/Video/Audio/PDF)
  • + MTEB Multilingual #1 unter APIs (69,9) + MTEB-Code 84,0
  • + Matryoshka Representation Learning — 128 → 3072 Dims ohne Re-Embed

Limitierungen

  • − GA-Modell-ID gemini-embedding-2 — Alt-Deployments auf -Preview-ID müssen migrieren
  • − US-Provider; Vertex-EU-DPA als rechtliche Grundlage nötig
  • − $0.20/Mtok — höher als Mistral Embed ($0.10) oder Self-Host
#4

Mistral Embed

Mistral AI
EU-Fit hoch API proprietär (API) API

EU-souveräne, schlanke RAG-API mit DSGVO-konformer Datenresidenz für DACH-Behörden und Mittelstand.

mistral-embed-2312 ist Mistrals EU-native (Paris) Embedding-API, 1024 Dim, 8K-Kontext, $0.10/Mtok. MTEB moderat (~55–58), keine 2026er-Refresh-Iteration für Text. Für Code-RAG hat Mistral ergänzend Codestral Embed released (2026) — schlägt Voyage Code 3, Cohere Embed v4 und OpenAI large. Trotzdem die richtige Wahl wenn (a) Datenresidenz in der EU vertraglich gesetzt sein muss, (b) Self-Host-Stack nicht aufgebaut werden kann, (c) RAG-Qualität auf Mittelmaß ausreicht (z. B. interne Wissensbasen ohne Long-Tail-Recall-Anforderung).

Dims:
1024 Dim
Kontext:
8.192 Tokens
Sprachen:
DE/EN/FR/ES/IT (Mistral-Trainings-Sprachen)
MTEB:
Multi 57
Preis:
~€0.092 / Mtok

EU-native (Paris, Frankreich) — DSGVO direkt, keine US-Mutter, kein CLOUD-Act.

Stärken

  • + EU-native (FR), keine CLOUD-Act-Exposition
  • + $0.10/Mtok — günstigste API-Option in dieser Liste
  • + Stabiler Production-Endpoint seit Ende 2023

Limitierungen

  • − MTEB-Score deutlich unter Qwen3/BGE-M3/Gemini (~57 vs 68-70)
  • − Modell von Ende 2023, keine 2026er-Iteration angekündigt
  • − Kein MRL — fixe 1024-Dim-Vektoren
#5

Nemotron-3-Embed-1B

NVIDIA
EU-Fit hoch Self-Host OpenMDW-1.1 1.14B

Effizientes Produktions-Retrieval auf knapper GPU: RTEB 72.4 bei nur 1.14B Parametern und 32K-Kontext.

Neueste Generation (Release 16.07.2026): Effizienz-Spitze der aktuellen Retrieval-Leaderboards. RTEB 72.4 / MMTEB Retrieval 71.0 — 27–28% weniger Fehlerrate als der 1B-Vorgänger. 32K-Kontext, multilingual + Code-Retrieval, sentence-transformers/vLLM/NIM-Support. NVFP4-Schwestervariante für Blackwell (2× Throughput, 99%+ Accuracy-Retention); die 8B-Flagship-Variante führt RTEB overall an (78.5). Open-Source Fine-Tuning- und Distillation-Recipes (NeMo AutoModel) für Domänen-Anpassung. Best Choice für produktive RAG-Pipelines mit Latenz-/Kostendruck, die trotzdem aktuelle Retrieval-Qualität brauchen.

Dims:
2048 Dim
Kontext:
32.768 Tokens
Sprachen:
Multilingual + Code
MTEB:
Multi 71

US-Vendor (NVIDIA), aber offene Gewichte (OpenMDW-1.1) — Inferenz läuft vollständig auf eigener EU-GPU, keine Provider-Telemetrie. Backbone: Mistral Ministral-3 (Apache 2.0).

Stärken

  • + RTEB 72.4 bei 1.14B Parametern — aktuelle Effizienz-Spitze
  • + 32K Kontext + Multilingual + Code-Retrieval in einem Modell
  • + Offene Gewichte + Fine-Tuning-Recipes; NVFP4-Variante für Blackwell

Limitierungen

  • − US-Vendor (NVIDIA) — Supply-Chain-Audit der HF-Artefakte ratsam
  • − OpenMDW-1.1 statt Apache-2.0 — License-Review einplanen
  • − Brandneu (Juli 2026) — wenig Langzeit-Production-Erfahrung in der Community

Auswahlbasis: MTEB Multilingual Leaderboard 2026, Hugging Face Hub, Provider-Dokumentation, interner EU-Deep-Research-Report. Wöchentliche Drift-Prüfung durch refresh-models Cron-Job.