Preisliste

KI-Modelle & Preise

Alle Modelle der Apertus-Plattform mit aktuellen Token-Preisen – nutzungsbasiert abgerechnet, über eine OpenAI-kompatible API.

Stand: 29. September 2026

Open-Weight-Modelle
31
Chat, Embedding & Reranking
Neu im letzten Monat
3
u. a. DeepSeek V4.1 Flash, Qwen 3.8 Flash Next
Allrounder ab
0,50 €
DeepSeek V4.1 Flash · pro 1M Input-Token
Kontext bis zu
1M
bei 7 Modellen

Unsere Empfehlungen

Nicht sicher, welches Modell passt? Mit diesen Modellen liegen Sie richtig.

Empfehlung: Allrounder
DeepSeek Logo

DeepSeek V4.1 Flash

DeepSeek

Unser Allrounder für jeden Tag: stark, schnell, multimodal und günstig.

Multimodales MoE-Modell mit 552 Mrd. Parametern und bis zu 1 Mio. Token Kontext – verarbeitet Bilder und Text nativ.

Kontext
1M
Input
0,50 €
Output
1,50 €

pro 1M Token

Favorit: Top-Leistung
Moonshot AI Logo

Kimi K3

Moonshot AI

Frontier-Niveau für anspruchsvolles Coding, Agenten und lange Kontexte.

Frontier-Performance bei Coding und agentischen Aufgaben, 1 Mio. Token Kontext und native multimodale Eingabe (Text, Bild, Video).

Kontext
1M
Input
3,00 €
Output
15,00 €

pro 1M Token

Favorit: Preis-Leistung
Z.ai Logo

GLM 5.3 Flash

Z.ai

Multimodal und leistungsstark – zum Preis eines kleinen Modells.

Erstes nativ multimodales Modell der GLM-5-Serie. Übertrifft GLM 5.2 in Benchmarks und Praxis-Workloads – zu einem Bruchteil des Preises.

Kontext
1M
Input
0,20 €
Output
0,50 €

pro 1M Token

Europäisches Open Source
Swiss AI Logo

SwissAI Apertus 1.5 70B

Swiss AI

Vollständig offenes, mehrsprachiges Modell aus der Schweiz – für souveräne KI in Europa.

Das erste große, offene und mehrsprachige Sprachmodell der Schweiz – ideal für souveräne KI-Anwendungen.

Kontext
65K
Input
0,70 €
Output
2,80 €

pro 1M Token

Chat & Reasoning

Sprachmodelle für Chat, Coding, Agenten, Vision und Dokumentenanalyse.

ModellKontextInput
pro 1M Token
Cached Input
pro 1M Token
Output
pro 1M Token
DeepSeek Logo
DeepSeek V4.1 Flash Empfehlung: Allrounder Neu Vision
deepseek-v4.1-flash · DeepSeek

Multimodales MoE-Modell mit 552 Mrd. Parametern und bis zu 1 Mio. Token Kontext – verarbeitet Bilder und Text nativ.

1M0,50 €0,13 €1,50 €
Qwen (Alibaba) Logo
Qwen 3.8 Flash Next Neu Vision
qwen3.8-flash-next · Qwen (Alibaba)

Hocheffizientes multimodales Modell mit starker Coding-Leistung bei nur 6 Mrd. aktiven Parametern.

250K0,20 €0,05 €0,50 €
Z.ai Logo
GLM 5.3 Flash Favorit: Preis-Leistung Neu Vision
glm-5.3-flash · Z.ai

Erstes nativ multimodales Modell der GLM-5-Serie. Übertrifft GLM 5.2 in Benchmarks und Praxis-Workloads – zu einem Bruchteil des Preises.

1M0,20 €0,05 €0,50 €
Moonshot AI Logo
Kimi K3 Favorit: Top-Leistung Vision
kimi-k3 · Moonshot AI

Frontier-Performance bei Coding und agentischen Aufgaben, 1 Mio. Token Kontext und native multimodale Eingabe (Text, Bild, Video).

1M3,00 €0,75 €15,00 €
Z.ai Logo
GLM 5.2
glm-5.2 · Z.ai

Flaggschiff von Z.ai für langlaufende, mehrstufige Aufgaben – deutlich stärker als GLM 5.1 und mit stabilem 1-Mio.-Token-Kontext.

1M1,50 €0,72 €4,50 €
MiniMax Logo
MiniMax M3 Vision
minimax-m3 · MiniMax

Open-Weight-Modell für Coding, Agenten-Aufgaben mit langem Kontext und multimodale Eingaben.

1M0,40 €0,15 €2,00 €
Google DeepMind Logo
Gemma 4 31B Vision
gemma4-31b · Google DeepMind

Offenes multimodales Modell von Google DeepMind – verarbeitet Text und Bilder und generiert Text.

250K0,20 €–0,40 €
Qwen (Alibaba) Logo
Qwen3.6 27B
qwen3.6-27b · Qwen (Alibaba)

Kompaktes Qwen-Modell der 3.6-Generation für Chat-, Text- und Coding-Aufgaben.

–0,40 €–2,70 €
DeepSeek Logo
DeepSeek V4 Pro 0813
deepseek-v4-pro · DeepSeek

MoE-Modell mit 1,6 Bio. Parametern (49 Mrd. aktiv) und Hybrid Attention – stark bei komplexem Coding, tiefem Reasoning und langlaufenden Agenten-Workflows.

1M2,00 €0,50 €4,00 €
Moonshot AI Logo
Kimi K2.6 Vision
kimi-k2.6 · Moonshot AI

Nativ multimodal, mit Agent Swarm für bis zu 300 spezialisierte Sub-Agenten und 4.000 koordinierte Schritte pro autonomem Durchlauf.

256K1,00 €0,25 €4,00 €
DeepSeek Logo
DeepSeek V4 Flash 0731
deepseek-v4-flash · DeepSeek

Auf denselben Daten wie V4 Pro von Grund auf trainiert. Ideal für hohe Volumina, bei denen Kosten und Geschwindigkeit zählen – Chat, Klassifikation, Zusammenfassung.

1M0,25 €0,08 €0,30 €
Qwen (Alibaba) Logo
Qwen3 VL 235B Vision
Qwen3-VL-235B-A22B-Instruct · Qwen (Alibaba)

Das leistungsstärkste Vision-Language-Modell der Qwen-Serie – für OCR, Dokumentenanalyse, räumliches Grounding und Code aus Bildern.

256K2,00 €–2,00 €
Swiss AI Logo
SwissAI Apertus 1.5 70B Europäisches Open Source
swissai-apertus-70b · Swiss AI

Das erste große, offene und mehrsprachige Sprachmodell der Schweiz – ideal für souveräne KI-Anwendungen.

65K0,70 €–2,80 €
OpenAI Logo
GPT-OSS-120B
gpt-oss-120b · OpenAI

Das leistungsstärkste Open-Weight-Modell von OpenAI.

131K0,48 €–0,48 €
Qwen (Alibaba) Logo
Qwen3 Coder 30B
Qwen3-Coder-30B-A3B-Instruct · Qwen (Alibaba)

Vielseitiges Code-Modell für Programmierung und agentisches Coding.

250K0,264 €–0,264 €
Qwen (Alibaba) Logo
Qwen2.5 VL 72B Instruct Vision
Qwen2.5-VL-72B-Instruct · Qwen (Alibaba)

Großes Vision-Language-Modell von Qwen für Bild- und Dokumentenverständnis.

32K1,092 €–1,092 €
OpenAI Logo
GPT-OSS-20B
gpt-oss-20b · OpenAI

Kompaktes, effizientes Open-Weight-Modell von OpenAI.

131K0,18 €–0,18 €
Mistral AI Logo
Mistral 7B Instruct
Mistral-7B-Instruct-v0.3 · Mistral AI

Kleines, leistungsstarkes Modell von Mistral AI.

127K0,12 €–0,12 €
Meta Logo
Llama 3.3 70B Instruct
Meta-Llama-3_3-70B-Instruct · Meta

Starkes Reasoning, vielseitig und produktionserprobt.

131K0,804 €–0,804 €
Qwen (Alibaba) Logo
Qwen3 32B
Qwen3-32B · Qwen (Alibaba)

Fortgeschrittenes Reasoning, mehrsprachig, ausgewogene Kapazität.

32K0,276 €–0,276 €
Mistral AI Logo
Mistral Small 3.2 24B Instruct
Mistral-Small-3.2-24B-Instruct-2506 · Mistral AI

Schnelle Inferenz, leichtgewichtig, auf Instruktionen optimiert.

125K0,336 €–0,336 €
Mistral AI Logo
Mixtral 8x7B Instruct
Mixtral-8x7B-Instruct-v0.1 · Mistral AI

Mixture-of-Experts mit hoher Qualität und effizientem Routing.

32K0,756 €–0,756 €
Mistral AI Logo
Mistral Nemo Instruct
Mistral-Nemo-Instruct-2407 · Mistral AI

Ausgewogene Performance, mehrsprachig, instruction-tuned.

118K0,156 €–0,156 €
Meta Logo
Llama 3.1 8B Instruct
Llama-3.1-8B-Instruct · Meta

Leichtgewichtig und schnell für allgemeine Aufgaben.

131K0,12 €–0,12 €

Embedding

Vektor-Embeddings für semantische Suche, RAG und Klassifikation.

ModellKontextPreis
pro 1M Token
Qwen (Alibaba) Logo
Qwen3 Embedding 8B
Qwen3-Embedding-8B · Qwen (Alibaba)

Embedding-Modell mit Spitzenwerten in zahlreichen Retrieval- und Downstream-Benchmarks.

8K0,084 €
BAAI Logo
BGE Multilingual Gemma 2
bge-multilingual-gemma2 · BAAI

Mehrsprachiges Embedding-Modell von BGE auf Basis von Gemma 2.

8K0,012 €
BAAI Logo
BGE-M3
BGE-M3 · BAAI

Mehrsprachiges Embedding-Modell (100+ Sprachen) für Dense-, Sparse- und Multi-Vector-Retrieval.

8K0,012 €

Reranking

Relevanz-Sortierung von Suchergebnissen für präzisere RAG-Antworten – aktuell kostenlos.

ModellKontextPreis
pro 1M Token
Qwen (Alibaba) Logo
Qwen3 Reranker 0.6B
qwen3-reranker-0.6b · Qwen (Alibaba)

Mehrsprachiger Reranker mit Unterstützung für über 100 Sprachen.

32KKostenlos
BAAI Logo
BGE Reranker v2 M3
bge-reranker-v2-m3 · BAAI

Leichtgewichtiger, mehrsprachiger Reranker mit schneller Inferenz.

–Kostenlos

Weitere Modelle auf Anfrage

Diese Modelle schalten wir auf Anfrage für Ihr Konto frei. Closed-Source-Modelle in der EU-Region sind ebenfalls auf Anfrage verfügbar.

ModellKontextInput
pro 1M Token
Cached Input
pro 1M Token
Output
pro 1M Token
Mistral AI Logo
Devstral 2 123B
devstral-2-123b-instruct-2512 · Mistral AI

Speziell für agentisches Software-Engineering entwickelt – 72,2 % auf SWE-Bench Verified.

200K2,00 €–2,00 €
Qwen (Alibaba) Logo
Qwen3 235B A22B Instruct 2507
qwen3-235b-a22b-instruct-2507 · Qwen (Alibaba)

Dediziertes Instruct-Modell mit verbessertem Instruction Following, breiter Sprachabdeckung und Langkontext-Verständnis.

250K2,00 €–2,00 €

Preishinweise · Stand: 29. September 2026

  • Alle Preise in Euro pro 1 Million Token, netto zzgl. gesetzlicher MwSt.
  • Cached Input: reduzierter Preis für wiederverwendete Prompt-Bestandteile (Prompt Caching), sofern das Modell dies unterstützt.
  • Monatliche Abrechnung nach tatsächlichem Verbrauch. Verbindlich sind die im Dashboard angezeigten Preise.
  • Alle Modelle sind DSGVO-konform, sofern nicht anders gekennzeichnet.
  • Closed-Source-Modelle in der EU-Region, dedizierte Instanzen, lokale Installationen und Volumenkonditionen auf Anfrage.

Direkt loslegen

Registrieren Sie sich auf der Plattform und nutzen Sie alle Modelle sofort – oder sprechen Sie mit uns über Volumenpreise, dedizierte Instanzen und Modelle auf Anfrage.

Mehr über unsere KI-Modelle