# searchit — Modellpreisliste

> Ihr Tokenpreis für die Sprachmodelle, die searchit für AI-Extraktion und AI Agent anbietet, für die Einbettung und für die Bildanalyse — außerhalb und innerhalb der EU.

## Sehen Sie jeden Modellpreis.

Diese Liste zeigt Ihren Tokenpreis für die Sprachmodelle, die wir für searchit anbieten — für die AI-Extraktion und den AI Agent —, für die Einbettung der semantischen Suche und für die Bildanalyse.

Stand 25. September 2026

## Sprachmodelle

Eine Auswahl: Sprachmodelle, die sich besonders gut für die AI-Extraktion eignen — also dafür, aus Ihren Dokumenten Zusammenfassung, Entitäten und Beziehungen zu gewinnen. Je Modell der Tokenpreis mit Verarbeitung außerhalb und innerhalb der EU, geordnet nach dem Ergebnis unserer eigenen Extraktionsmessung. Ein Strich heißt: an diesem Ort bieten wir das Modell nicht an.

**Tokenpreise je 1 Mio. Tokens, in Euro ohne Umsatzsteuer**

| Modell | Extraktion | Selbst betreibbar | In der EU: Eingabe | In der EU: Aus dem Cache | In der EU: Ausgabe | Außerhalb der EU: Eingabe | Außerhalb der EU: Aus dem Cache | Außerhalb der EU: Ausgabe |
|---|---:|---|---:|---:|---:|---:|---:|---:|
| GPT-6 astra (OpenAI, aus den USA) | 7,7 | nein | — | — | — | 10,51 € | 1,05 € | 52,54 € |
| DeepSeek V4.1 Flash (DeepSeek, aus China) | 6,8 | nein | — | — | — | 0,3152 € | 0,0063 € | 1,26 € |
| DeepSeek V4 Pro (DeepSeek, aus China) | 6,4 | ja | 1,84 € | — | 3,68 € | 1,00 € | — | 2,01 € |
| Mistral Medium 3.5 (Mistral AI, aus Frankreich) | 6,1 | ja | 1,80 € | — | 7,20 € | 1,50 € | 0,1500 € | 7,68 € |
| Kimi K2.6 (Moonshot AI, aus China) | 6,0 | ja | 0,7920 € | 0,2640 € | 4,50 € | 0,7200 € | — | 3,60 € |
| Qwen3.5-27B (Alibaba Cloud, aus China) | 5,5 | ja | — | — | — | 0,2049 € | — | 1,64 € |
| GLM-5 (Z.ai, aus China) | 4,9 | ja | 1,14 € | — | 3,48 € | 0,6305 € | — | 2,02 € |
| Mistral Large 2.1 (Mistral AI, aus Frankreich) | 4,6 | ja | — | — | — | 2,10 € | — | 6,30 € |
| Qwen3.5-397B-A17B (Alibaba Cloud, aus China) | 4,5 | ja | 0,6050 € | — | 3,63 € | 0,5779 € | — | 3,68 € |
| Gemma 4 31B (Google, aus den USA) | 4,3 | ja | 0,2400 € | — | 0,4200 € | 0,0946 € | — | 0,3573 € |
| Qwen3.7-Plus (Alibaba Cloud, aus China) | 3,3 | nein | — | — | — | 0,4203 € | 0,0420 € | 1,68 € |
| Qwen3.6-35B-A3B (Alibaba Cloud, aus China) | 3,3 | ja | 0,1800 € | — | 0,6000 € | 0,1576 € | — | 1,05 € |
| Qwen3.5-9B (Alibaba Cloud, aus China) | 2,9 | ja | 0,1008 € | — | 0,1513 € | 0,1051 € | — | 0,1576 € |

- Extraktion: Qualitätswert von 0 bis 10 aus unserer eigenen Messung — Mittel der Trefferquoten für erkannte Entitäten und Beziehungen gegen eine unabhängig erstellte Sollfassung, geteilt durch zehn. Er dient dem Vergleich der Modelle untereinander. Gemessen 2026 an acht Beispieldokumenten — er gilt für diese Dokumente, nicht für jeden Bestand.
- Selbst betreibbar: Die Modellgewichte sind frei verfügbar; das Modell lässt sich auch auf eigener Hardware betreiben.
- In der EU: Wir bieten ein Modell dort nur über Anbieter an, die Ihre Daten in der EU verarbeiten und Ihre Ein- und Ausgaben weder speichern noch zum Training verwenden — belegt durch deren Bedingungen. Fehlt dieser Beleg, steht ein Strich.

**Leistungsprofil je Modell**

| Modell | Entitäten erkannt | Beziehungen erkannt | Kontextfenster | Modellgröße |
|---|---:|---:|---|---|
| GPT-6 astra | 8,1 | 7,4 | nicht veröffentlicht | nicht veröffentlicht |
| DeepSeek V4.1 Flash | 7,7 | 5,9 | 1.000.000 Tokens | 763,2 Mrd., davon 16 Mrd. aktiv |
| DeepSeek V4 Pro | 7,5 | 5,2 | 1.048.576 Tokens | 1,6 Bio., davon 49 Mrd. aktiv |
| Mistral Medium 3.5 | 7,0 | 5,3 | 262.144 Tokens | 127,7 Mrd. |
| Kimi K2.6 | 7,5 | 4,5 | 262.144 Tokens | 1 Bio., davon 32 Mrd. aktiv |
| Qwen3.5-27B | 6,7 | 4,3 | 262.144 Tokens | 27,8 Mrd. |
| GLM-5 | 6,0 | 3,8 | 204.800 Tokens | 753,9 Mrd., davon 40 Mrd. aktiv |
| Mistral Large 2.1 | 6,1 | 3,1 | 131.072 Tokens | 123 Mrd. |
| Qwen3.5-397B-A17B | 6,0 | 3,0 | 262.144 Tokens | 403,4 Mrd., davon 17 Mrd. aktiv |
| Gemma 4 31B | 5,5 | 3,1 | 262.144 Tokens | 31 Mrd. |
| Qwen3.7-Plus | 4,3 | 2,3 | 1.000.000 Tokens | 397 Mrd., davon 17 Mrd. aktiv |
| Qwen3.6-35B-A3B | 4,7 | 1,8 | 262.144 Tokens | 36 Mrd., davon 3 Mrd. aktiv |
| Qwen3.5-9B | 4,7 | 1,1 | 262.144 Tokens | 9,7 Mrd. |

- Qualitätswert 0 bis 10 je Teilaufgabe, aus unserer eigenen Extraktionsmessung 2026 an acht Beispieldokumenten.
- Leistungsprofil: Kontextfenster heißt, wie viele Tokens das Modell auf einmal verarbeitet; Modellgröße ist die Zahl seiner Parameter — bei Modellen, die je Token nur einen Teil davon rechnen, steht der aktive Teil dahinter.

## Einbettung

Für die semantische Suche wird jeder Textabschnitt einmal in einen Vektor übersetzt; berechnet wird nur die Eingabe. Welches Modell Ihr Index nutzt, legen wir bei der Einrichtung fest — ein Wechsel heißt, den Index neu aufzubauen. Oben die beiden Standardmodelle, darunter alle weiteren nach Hersteller.

**Tokenpreise der Einbettung je 1 Mio. Tokens Eingabe, in Euro ohne Umsatzsteuer**

| Modell | Suche Deutsch | Selbst betreibbar | In der EU | Außerhalb der EU |
|---|---:|---|---:|---:|
| Qwen3 Embedding 8B (Alibaba Cloud, aus China) — Standard außerhalb der EU | 0,80 | ja | 0,0105 € | 0,0105 € |
| BGE-M3 (BAAI, aus China) — Standard in der EU | 0,69 | ja | 0,0120 € | 0,0105 € |
| Qwen Text Embedding v4 (Alibaba Cloud, aus China) | — | nein | — | 0,0736 € |
| Qwen3-VL Embedding 8B (Alibaba Cloud, aus China) | — | ja | 0,0960 € | — |
| Amazon Titan Text Embeddings V2 (Amazon, aus den USA) | — | nein | 0,2102 € | 0,0210 € |
| BGE Multilingual Gemma2 (BAAI, aus China) | — | ja | 0,0120 € | — |
| Cohere Embed 4 (Cohere, aus Kanada) | 0,81 | nein | — | 0,1261 € |
| Gemini Embedding 2 (Google, aus den USA) | — | nein | — | 0,2102 € |
| E5-Mistral-7B (Microsoft, aus den USA) | 0,72 | ja | 0,0240 € | — |
| Codestral Embed (Mistral AI, aus Frankreich) | — | nein | — | 0,1800 € |
| Mistral Embed (Mistral AI, aus Frankreich) | — | nein | — | 0,1200 € |
| text-embedding-3-large (OpenAI, aus den USA) | 0,75 | nein | — | 0,1366 € |
| text-embedding-3-small (OpenAI, aus den USA) | 0,71 | nein | — | 0,0210 € |
| Voyage 4 (Voyage AI, aus den USA) | 0,83 | nein | — | 0,0630 € |
| Voyage 4 large (Voyage AI, aus den USA) | 0,84 | nein | — | 0,1261 € |
| Voyage 4 lite (Voyage AI, aus den USA) | 0,80 | nein | — | 0,0210 € |

- Suche Deutsch: Mittel der vier deutschen Retrieval-Aufgaben des öffentlichen Benchmarks MTEB (nDCG@10, von 0 bis 1) — je höher, desto besser findet das Modell zu einer Frage die passenden Textabschnitte. Er dient dem Vergleich der Modelle untereinander, nicht als Zusage für Ihren Bestand. Ein Strich: Für das Modell ist kein Wert veröffentlicht.
- Standard außerhalb der EU / Standard in der EU: Dieses Modell setzen wir ein, wenn Sie nichts anderes wählen — ohne bzw. mit durchgängig europäischem Betrieb.
- In der EU: Wir bieten ein Modell dort nur über Anbieter an, die Ihre Daten in der EU verarbeiten und Ihre Ein- und Ausgaben weder speichern noch zum Training verwenden — belegt durch deren Bedingungen. Fehlt dieser Beleg, steht ein Strich.

**Leistungsprofil je Modell**

| Modell | Allgemeine Texte | Gesundheitswesen | Recht | Rechtsfragen | Vektorlänge | Kontextfenster | Modellgröße |
|---|---:|---:|---:|---:|---:|---|---|
| Qwen3 Embedding 8B | 0,97 | 0,88 | 0,70 | 0,67 | 4.096 | 32.768 Tokens | 7,6 Mrd. |
| BGE-M3 | 0,92 | 0,72 | 0,61 | 0,50 | 1.024 | 8.192 Tokens | 568 Mio. |
| Qwen Text Embedding v4 | — | — | — | — | 1.024 | 8.192 Tokens | nicht veröffentlicht |
| Qwen3-VL Embedding 8B | — | — | — | — | 4.096 | 32.768 Tokens | nicht veröffentlicht |
| Amazon Titan Text Embeddings V2 | — | — | — | — | 1.024 | 8.192 Tokens | nicht veröffentlicht |
| BGE Multilingual Gemma2 | — | — | — | — | 3.584 | 8.192 Tokens | 9,2 Mrd. |
| Cohere Embed 4 | 0,95 | 0,85 | 0,73 | 0,72 | 1.536 | 128.000 Tokens | nicht veröffentlicht |
| Gemini Embedding 2 | — | — | — | — | 3.072 | 8.192 Tokens | nicht veröffentlicht |
| E5-Mistral-7B | 0,97 | 0,79 | 0,69 | 0,44 | 4.096 | 4.096 Tokens | 7,1 Mrd. |
| Codestral Embed | — | — | — | — | 1.536 | 8.192 Tokens | nicht veröffentlicht |
| Mistral Embed | — | — | — | — | 1.024 | 8.192 Tokens | nicht veröffentlicht |
| text-embedding-3-large | 0,98 | 0,81 | 0,67 | 0,56 | 3.072 | 8.192 Tokens | nicht veröffentlicht |
| text-embedding-3-small | 0,96 | 0,70 | 0,62 | 0,55 | 1.536 | 8.192 Tokens | nicht veröffentlicht |
| Voyage 4 | 0,98 | 0,88 | 0,75 | 0,71 | 1.024 | 32.000 Tokens | nicht veröffentlicht |
| Voyage 4 large | 0,98 | 0,91 | 0,76 | 0,72 | 1.024 | 32.000 Tokens | nicht veröffentlicht |
| Voyage 4 lite | 0,97 | 0,83 | 0,73 | 0,68 | 1.024 | 32.000 Tokens | nicht veröffentlicht |

- Suchgüte je deutscher Aufgabe des öffentlichen Benchmarks MTEB (nDCG@10, 0 bis 1); ihr Mittel ist der Wert „Suche Deutsch“.
- Leistungsprofil: Kontextfenster heißt, wie viele Tokens das Modell auf einmal verarbeitet; Modellgröße ist die Zahl seiner Parameter — bei Modellen, die je Token nur einen Teil davon rechnen, steht der aktive Teil dahinter.

## Bildmodelle

Für die Bildanalyse liest ein Bildmodell jedes Bild und beschreibt seinen Inhalt. Je Modell der Tokenpreis mit Verarbeitung außerhalb und innerhalb der EU, geordnet nach dem öffentlichen Benchmark MMMU-Pro. Ein Strich heißt: An diesem Ort bieten wir das Modell nicht an.

**Tokenpreise der Bildmodelle je 1 Mio. Tokens, in Euro ohne Umsatzsteuer**

| Modell | MMMU-Pro | Selbst betreibbar | In der EU: Eingabe | In der EU: Ausgabe | Außerhalb der EU: Eingabe | Außerhalb der EU: Ausgabe |
|---|---:|---|---:|---:|---:|---:|
| Kimi K2.6 (Moonshot AI, aus China) | 79,4 % | ja | 0,8400 € | 4,20 € | 0,7200 € | 3,60 € |
| Qwen3.5-397B-A17B (Alibaba Cloud, aus China) | 79,0 % | ja | 0,6050 € | 3,63 € | 0,4098 € | 2,46 € |
| MiniMax M3 (MiniMax, aus China) | 78,1 % | ja | 0,4203 € | 2,10 € | 0,3152 € | 1,26 € |
| Gemma 4 31B (Google, aus den USA) — Standard außerhalb der EU, Standard in der EU | 76,9 % | ja | 0,1200 € | 0,3600 € | 0,0946 € | 0,3573 € |
| Qwen3.6-27B (Alibaba Cloud, aus China) | 75,8 % | ja | 0,5400 € | 0,7800 € | 0,3152 € | 2,10 € |
| Qwen3.6-35B-A3B (Alibaba Cloud, aus China) | 75,3 % | ja | 0,3600 € | 1,44 € | 0,1051 € | 0,9457 € |
| Gemma 4 26B A4B (Google, aus den USA) | 73,8 % | ja | 0,1200 € | 0,6000 € | 0,0736 € | 0,3573 € |
| Qwen3.5-9B (Alibaba Cloud, aus China) | 70,1 % | ja | 0,1008 € | 0,1513 € | 0,1051 € | 0,1576 € |

- MMMU-Pro: öffentlicher Benchmark mit Fragen zu Bildern, Diagrammen und Dokumentseiten; angegeben ist der Anteil richtig gelöster Aufgaben, wie vom jeweiligen Hersteller veröffentlicht. Er dient dem Vergleich der Modelle untereinander, nicht als Zusage für Ihre Bilder.
- Standard außerhalb der EU / Standard in der EU: Dieses Modell setzen wir ein, wenn Sie nichts anderes wählen — ohne bzw. mit durchgängig europäischem Betrieb.
- In der EU: Wir bieten ein Modell dort nur über Anbieter an, die Ihre Daten in der EU verarbeiten und Ihre Ein- und Ausgaben weder speichern noch zum Training verwenden — belegt durch deren Bedingungen. Fehlt dieser Beleg, steht ein Strich.

**Leistungsprofil je Modell**

| Modell | MMMU-Pro | Kontextfenster | Modellgröße |
|---|---:|---|---|
| Kimi K2.6 | 79,4 % | 262.144 Tokens | 1 Bio., davon 32 Mrd. aktiv |
| Qwen3.5-397B-A17B | 79,0 % | 262.144 Tokens | 403,4 Mrd., davon 17 Mrd. aktiv |
| MiniMax M3 | 78,1 % | 1.048.576 Tokens | 427 Mrd., davon 23 Mrd. aktiv |
| Gemma 4 31B | 76,9 % | 262.144 Tokens | 31,3 Mrd. |
| Qwen3.6-27B | 75,8 % | 262.144 Tokens | 27,8 Mrd. |
| Qwen3.6-35B-A3B | 75,3 % | 262.144 Tokens | 36 Mrd., davon 3 Mrd. aktiv |
| Gemma 4 26B A4B | 73,8 % | 262.144 Tokens | 25,8 Mrd., davon 4 Mrd. aktiv |
| Qwen3.5-9B | 70,1 % | 262.144 Tokens | 9,7 Mrd. |

- Anteil richtig gelöster Aufgaben im öffentlichen Benchmark MMMU-Pro, wie vom Hersteller veröffentlicht.
- Leistungsprofil: Kontextfenster heißt, wie viele Tokens das Modell auf einmal verarbeitet; Modellgröße ist die Zahl seiner Parameter — bei Modellen, die je Token nur einen Teil davon rechnen, steht der aktive Teil dahinter.

Alle Preise in Euro zuzüglich Umsatzsteuer.
