#1
Qwen3-Embedding-8B
Alibaba EU-Fit hoch Self-Host Apache 2.0 8B
Top-Tier mehrsprachige RAG + Code-Retrieval auf EU-GPU mit Budget für 8B-Inferenz.
Aktuell stärkstes Open-Source-Embedding-Modell (MTEB Multilingual 70,58, MTEB-Code Top-1). 100+ Sprachen, 32K-Kontext, MRL 32–4096 Dims für Storage-Tradeoffs. Best Choice für RAG-Pipelines mit hohem Qualitätsanspruch und vorhandenem GPU-Budget; Apache-2.0-Lizenz erlaubt unbeschränkte kommerzielle Nutzung trotz CN-Origin, weil Inferenz vollständig in eigener EU-Infrastruktur läuft.
- Dims:
- 4096 Dim (MRL 32–4096)
- Kontext:
- 32.768 Tokens
- Sprachen:
- 100+ (inkl. DE, Code)
- MTEB:
- Multi 70.58 · Code 70
CN-Origin (Alibaba), aber Apache-2.0-lizenziert — Inferenz läuft vollständig auf eigener EU-GPU, keine Provider-Telemetrie.
Stärken
- + MTEB Multilingual #1 (70,58) — schlägt OpenAI & Cohere API-Modelle
- + Apache 2.0 — kommerziell unbeschränkt, Self-Host auf EU-GPU
- + 32K-Kontext + MRL (32–4096 Dims) für flexible Vektor-Datenbanken
Limitierungen
- − 8B Parameter → ~16 GB VRAM für FP16-Inferenz
- − CN-Origin (Alibaba) — Supply-Chain-Audit der HF-Artefakte ratsam
- − Höherer TCO als 568M-Modelle bei hohem Indexierungsvolumen
EU-Fit hoch Self-Host MIT 568M
DACH-Multilingual-RAG mit nativem Hybrid Dense+Sparse Retrieval auf knapper GPU.
Multilinguales Embedding-Workhorse (568M Parameter, MIT-lizenziert) auf einer einzelnen L4/A10 GPU. Einzigartig: nativer Hybrid-Modus (Dense + Sparse + Multi-Vector) in einem Forward-Pass, ideal wenn Recall in juristischen oder industriellen Dokumenten-Korpora maximiert werden muss. 8K-Kontext, 100+ Sprachen mit starker DE-Performance. Erste Wahl für DACH-RAG auf knappem GPU-Budget.
- Dims:
- 1024 Dim
- Kontext:
- 8.192 Tokens
- Sprachen:
- 100+
- MTEB:
- Multi 68
CN-Origin (BAAI Peking), MIT-lizenziert — Inferenz auf eigener EU-GPU, weltweit am breitesten in OSS-Vektor-DBs unterstützt.
Stärken
- + Hybrid Dense + Sparse + Multi-Vector in einem Forward-Pass
- + MIT-Lizenz + 568M Parameter → läuft auf einzelner L4/A10
- + 8K Kontext, 100+ Sprachen, starke DE-Performance
Limitierungen
- − Kein MRL — fixe 1024-Dim-Vektoren
- − CN-Origin (BAAI Peking) — Supply-Chain-Audit der HF-Artefakte ratsam
- − Hybrid braucht Vektor-DB-Support (Milvus, Vespa, Qdrant)
#3
Gemini Embedding 2
Google EU-Fit mittel API proprietär (API) API
Multimodale RAG-Pipelines (PDF/Bild/Audio in einem Vektorraum) ohne Self-Host-Aufwand.
Googles erstes natively multimodales Embedding (text/image/video/audio/PDF in einem 3072-dim Vektorraum), MRL bis 128 Dims runter. MTEB Multilingual 69,9 (Top-API). GA-API gemini-embedding-2 über Vertex AI EU-Region verfügbar, $0.20/Mtok. Best Choice wenn RAG-Quellen heterogen sind (PDFs mit Diagrammen, Audio-Memos) und Self-Host-Komplexität vermieden werden soll.
- Dims:
- 3072 Dim (MRL 128–3072)
- Kontext:
- 8.192 Tokens
- Sprachen:
- 100+ (im MTEB-Benchmark über 250+ Sprachen evaluiert)
- MTEB:
- Multi 69.9 · Code 84
- Preis:
- ~€0.180 / Mtok
US-Provider; EU-Endpoint über Vertex AI (europe-west1/3/4) verfügbar, Standard-Vertex-DPA gilt.
Stärken
- + Erstes natively multimodales Embedding (Text/Bild/Video/Audio/PDF)
- + MTEB Multilingual #1 unter APIs (69,9) + MTEB-Code 84,0
- + Matryoshka Representation Learning — 128 → 3072 Dims ohne Re-Embed
Limitierungen
- − GA-Modell-ID gemini-embedding-2 — Alt-Deployments auf -Preview-ID müssen migrieren
- − US-Provider; Vertex-EU-DPA als rechtliche Grundlage nötig
- − $0.20/Mtok — höher als Mistral Embed ($0.10) oder Self-Host
#4
Mistral Embed
Mistral AI EU-Fit hoch API proprietär (API) API
EU-souveräne, schlanke RAG-API mit DSGVO-konformer Datenresidenz für DACH-Behörden und Mittelstand.
mistral-embed-2312 ist Mistrals EU-native (Paris) Embedding-API, 1024 Dim, 8K-Kontext, $0.10/Mtok. MTEB moderat (~55–58), keine 2026er-Refresh-Iteration für Text. Für Code-RAG hat Mistral ergänzend Codestral Embed released (2026) — schlägt Voyage Code 3, Cohere Embed v4 und OpenAI large. Trotzdem die richtige Wahl wenn (a) Datenresidenz in der EU vertraglich gesetzt sein muss, (b) Self-Host-Stack nicht aufgebaut werden kann, (c) RAG-Qualität auf Mittelmaß ausreicht (z. B. interne Wissensbasen ohne Long-Tail-Recall-Anforderung).
- Dims:
- 1024 Dim
- Kontext:
- 8.192 Tokens
- Sprachen:
- DE/EN/FR/ES/IT (Mistral-Trainings-Sprachen)
- MTEB:
- Multi 57
- Preis:
- ~€0.092 / Mtok
EU-native (Paris, Frankreich) — DSGVO direkt, keine US-Mutter, kein CLOUD-Act.
Stärken
- + EU-native (FR), keine CLOUD-Act-Exposition
- + $0.10/Mtok — günstigste API-Option in dieser Liste
- + Stabiler Production-Endpoint seit Ende 2023
Limitierungen
- − MTEB-Score deutlich unter Qwen3/BGE-M3/Gemini (~57 vs 68-70)
- − Modell von Ende 2023, keine 2026er-Iteration angekündigt
- − Kein MRL — fixe 1024-Dim-Vektoren
#5
Nemotron-3-Embed-1B
NVIDIA EU-Fit hoch Self-Host OpenMDW-1.1 1.14B
Effizientes Produktions-Retrieval auf knapper GPU: RTEB 72.4 bei nur 1.14B Parametern und 32K-Kontext.
Neueste Generation (Release 16.07.2026): Effizienz-Spitze der aktuellen Retrieval-Leaderboards. RTEB 72.4 / MMTEB Retrieval 71.0 — 27–28% weniger Fehlerrate als der 1B-Vorgänger. 32K-Kontext, multilingual + Code-Retrieval, sentence-transformers/vLLM/NIM-Support. NVFP4-Schwestervariante für Blackwell (2× Throughput, 99%+ Accuracy-Retention); die 8B-Flagship-Variante führt RTEB overall an (78.5). Open-Source Fine-Tuning- und Distillation-Recipes (NeMo AutoModel) für Domänen-Anpassung. Best Choice für produktive RAG-Pipelines mit Latenz-/Kostendruck, die trotzdem aktuelle Retrieval-Qualität brauchen.
- Dims:
- 2048 Dim
- Kontext:
- 32.768 Tokens
- Sprachen:
- Multilingual + Code
- MTEB:
- Multi 71
US-Vendor (NVIDIA), aber offene Gewichte (OpenMDW-1.1) — Inferenz läuft vollständig auf eigener EU-GPU, keine Provider-Telemetrie. Backbone: Mistral Ministral-3 (Apache 2.0).
Stärken
- + RTEB 72.4 bei 1.14B Parametern — aktuelle Effizienz-Spitze
- + 32K Kontext + Multilingual + Code-Retrieval in einem Modell
- + Offene Gewichte + Fine-Tuning-Recipes; NVFP4-Variante für Blackwell
Limitierungen
- − US-Vendor (NVIDIA) — Supply-Chain-Audit der HF-Artefakte ratsam
- − OpenMDW-1.1 statt Apache-2.0 — License-Review einplanen
- − Brandneu (Juli 2026) — wenig Langzeit-Production-Erfahrung in der Community