KI-Modelle & Preise
Alle Modelle der Apertus-Plattform mit aktuellen Token-Preisen – nutzungsbasiert abgerechnet, über eine OpenAI-kompatible API.
Stand: 29. September 2026
- Open-Weight-Modelle
- 31
- Chat, Embedding & Reranking
- Neu im letzten Monat
- 3
- u. a. DeepSeek V4.1 Flash, Qwen 3.8 Flash Next
- Allrounder ab
- 0,50 €
- DeepSeek V4.1 Flash · pro 1M Input-Token
- Kontext bis zu
- 1M
- bei 7 Modellen
Unsere Empfehlungen
Nicht sicher, welches Modell passt? Mit diesen Modellen liegen Sie richtig.
DeepSeek V4.1 Flash
DeepSeek
Unser Allrounder für jeden Tag: stark, schnell, multimodal und günstig.
Multimodales MoE-Modell mit 552 Mrd. Parametern und bis zu 1 Mio. Token Kontext – verarbeitet Bilder und Text nativ.
- Kontext
- 1M
- Input
- 0,50 €
- Output
- 1,50 €
pro 1M Token
Kimi K3
Moonshot AI
Frontier-Niveau für anspruchsvolles Coding, Agenten und lange Kontexte.
Frontier-Performance bei Coding und agentischen Aufgaben, 1 Mio. Token Kontext und native multimodale Eingabe (Text, Bild, Video).
- Kontext
- 1M
- Input
- 3,00 €
- Output
- 15,00 €
pro 1M Token
GLM 5.3 Flash
Z.ai
Multimodal und leistungsstark – zum Preis eines kleinen Modells.
Erstes nativ multimodales Modell der GLM-5-Serie. Übertrifft GLM 5.2 in Benchmarks und Praxis-Workloads – zu einem Bruchteil des Preises.
- Kontext
- 1M
- Input
- 0,20 €
- Output
- 0,50 €
pro 1M Token
SwissAI Apertus 1.5 70B
Swiss AI
Vollständig offenes, mehrsprachiges Modell aus der Schweiz – für souveräne KI in Europa.
Das erste große, offene und mehrsprachige Sprachmodell der Schweiz – ideal für souveräne KI-Anwendungen.
- Kontext
- 65K
- Input
- 0,70 €
- Output
- 2,80 €
pro 1M Token
Chat & Reasoning
Sprachmodelle für Chat, Coding, Agenten, Vision und Dokumentenanalyse.
| Modell | Kontext | Input pro 1M Token | Cached Input pro 1M Token | Output pro 1M Token |
|---|---|---|---|---|
DeepSeek V4.1 Flash
Empfehlung: Allrounder
Neu
Vision deepseek-v4.1-flash · DeepSeekMultimodales MoE-Modell mit 552 Mrd. Parametern und bis zu 1 Mio. Token Kontext – verarbeitet Bilder und Text nativ. | 1M | 0,50 € | 0,13 € | 1,50 € |
![]() Qwen 3.8 Flash Next
Neu
Vision qwen3.8-flash-next · Qwen (Alibaba)Hocheffizientes multimodales Modell mit starker Coding-Leistung bei nur 6 Mrd. aktiven Parametern. | 250K | 0,20 € | 0,05 € | 0,50 € |
GLM 5.3 Flash
Favorit: Preis-Leistung
Neu
Vision glm-5.3-flash · Z.aiErstes nativ multimodales Modell der GLM-5-Serie. Übertrifft GLM 5.2 in Benchmarks und Praxis-Workloads – zu einem Bruchteil des Preises. | 1M | 0,20 € | 0,05 € | 0,50 € |
Kimi K3
Favorit: Top-Leistung
Vision kimi-k3 · Moonshot AIFrontier-Performance bei Coding und agentischen Aufgaben, 1 Mio. Token Kontext und native multimodale Eingabe (Text, Bild, Video). | 1M | 3,00 € | 0,75 € | 15,00 € |
GLM 5.2 glm-5.2 · Z.aiFlaggschiff von Z.ai für langlaufende, mehrstufige Aufgaben – deutlich stärker als GLM 5.1 und mit stabilem 1-Mio.-Token-Kontext. | 1M | 1,50 € | 0,72 € | 4,50 € |
MiniMax M3
Vision minimax-m3 · MiniMaxOpen-Weight-Modell für Coding, Agenten-Aufgaben mit langem Kontext und multimodale Eingaben. | 1M | 0,40 € | 0,15 € | 2,00 € |
Gemma 4 31B
Vision gemma4-31b · Google DeepMindOffenes multimodales Modell von Google DeepMind – verarbeitet Text und Bilder und generiert Text. | 250K | 0,20 € | – | 0,40 € |
![]() Qwen3.6 27B qwen3.6-27b · Qwen (Alibaba)Kompaktes Qwen-Modell der 3.6-Generation für Chat-, Text- und Coding-Aufgaben. | – | 0,40 € | – | 2,70 € |
DeepSeek V4 Pro 0813 deepseek-v4-pro · DeepSeekMoE-Modell mit 1,6 Bio. Parametern (49 Mrd. aktiv) und Hybrid Attention – stark bei komplexem Coding, tiefem Reasoning und langlaufenden Agenten-Workflows. | 1M | 2,00 € | 0,50 € | 4,00 € |
Kimi K2.6
Vision kimi-k2.6 · Moonshot AINativ multimodal, mit Agent Swarm für bis zu 300 spezialisierte Sub-Agenten und 4.000 koordinierte Schritte pro autonomem Durchlauf. | 256K | 1,00 € | 0,25 € | 4,00 € |
DeepSeek V4 Flash 0731 deepseek-v4-flash · DeepSeekAuf denselben Daten wie V4 Pro von Grund auf trainiert. Ideal für hohe Volumina, bei denen Kosten und Geschwindigkeit zählen – Chat, Klassifikation, Zusammenfassung. | 1M | 0,25 € | 0,08 € | 0,30 € |
![]() Qwen3 VL 235B
Vision Qwen3-VL-235B-A22B-Instruct · Qwen (Alibaba)Das leistungsstärkste Vision-Language-Modell der Qwen-Serie – für OCR, Dokumentenanalyse, räumliches Grounding und Code aus Bildern. | 256K | 2,00 € | – | 2,00 € |
SwissAI Apertus 1.5 70B
Europäisches Open Source swissai-apertus-70b · Swiss AIDas erste große, offene und mehrsprachige Sprachmodell der Schweiz – ideal für souveräne KI-Anwendungen. | 65K | 0,70 € | – | 2,80 € |
GPT-OSS-120B gpt-oss-120b · OpenAIDas leistungsstärkste Open-Weight-Modell von OpenAI. | 131K | 0,48 € | – | 0,48 € |
![]() Qwen3 Coder 30B Qwen3-Coder-30B-A3B-Instruct · Qwen (Alibaba)Vielseitiges Code-Modell für Programmierung und agentisches Coding. | 250K | 0,264 € | – | 0,264 € |
![]() Qwen2.5 VL 72B Instruct
Vision Qwen2.5-VL-72B-Instruct · Qwen (Alibaba)Großes Vision-Language-Modell von Qwen für Bild- und Dokumentenverständnis. | 32K | 1,092 € | – | 1,092 € |
GPT-OSS-20B gpt-oss-20b · OpenAIKompaktes, effizientes Open-Weight-Modell von OpenAI. | 131K | 0,18 € | – | 0,18 € |
![]() Mistral 7B Instruct Mistral-7B-Instruct-v0.3 · Mistral AIKleines, leistungsstarkes Modell von Mistral AI. | 127K | 0,12 € | – | 0,12 € |
![]() Llama 3.3 70B Instruct Meta-Llama-3_3-70B-Instruct · MetaStarkes Reasoning, vielseitig und produktionserprobt. | 131K | 0,804 € | – | 0,804 € |
![]() Qwen3 32B Qwen3-32B · Qwen (Alibaba)Fortgeschrittenes Reasoning, mehrsprachig, ausgewogene Kapazität. | 32K | 0,276 € | – | 0,276 € |
![]() Mistral Small 3.2 24B Instruct Mistral-Small-3.2-24B-Instruct-2506 · Mistral AISchnelle Inferenz, leichtgewichtig, auf Instruktionen optimiert. | 125K | 0,336 € | – | 0,336 € |
![]() Mixtral 8x7B Instruct Mixtral-8x7B-Instruct-v0.1 · Mistral AIMixture-of-Experts mit hoher Qualität und effizientem Routing. | 32K | 0,756 € | – | 0,756 € |
![]() Mistral Nemo Instruct Mistral-Nemo-Instruct-2407 · Mistral AIAusgewogene Performance, mehrsprachig, instruction-tuned. | 118K | 0,156 € | – | 0,156 € |
![]() Llama 3.1 8B Instruct Llama-3.1-8B-Instruct · MetaLeichtgewichtig und schnell für allgemeine Aufgaben. | 131K | 0,12 € | – | 0,12 € |
Embedding
Vektor-Embeddings für semantische Suche, RAG und Klassifikation.
| Modell | Kontext | Preis pro 1M Token |
|---|---|---|
![]() Qwen3 Embedding 8B Qwen3-Embedding-8B · Qwen (Alibaba)Embedding-Modell mit Spitzenwerten in zahlreichen Retrieval- und Downstream-Benchmarks. | 8K | 0,084 € |
BGE Multilingual Gemma 2 bge-multilingual-gemma2 · BAAIMehrsprachiges Embedding-Modell von BGE auf Basis von Gemma 2. | 8K | 0,012 € |
BGE-M3 BGE-M3 · BAAIMehrsprachiges Embedding-Modell (100+ Sprachen) für Dense-, Sparse- und Multi-Vector-Retrieval. | 8K | 0,012 € |
Reranking
Relevanz-Sortierung von Suchergebnissen für präzisere RAG-Antworten – aktuell kostenlos.
| Modell | Kontext | Preis pro 1M Token |
|---|---|---|
![]() Qwen3 Reranker 0.6B qwen3-reranker-0.6b · Qwen (Alibaba)Mehrsprachiger Reranker mit Unterstützung für über 100 Sprachen. | 32K | Kostenlos |
BGE Reranker v2 M3 bge-reranker-v2-m3 · BAAILeichtgewichtiger, mehrsprachiger Reranker mit schneller Inferenz. | – | Kostenlos |
Weitere Modelle auf Anfrage
Diese Modelle schalten wir auf Anfrage für Ihr Konto frei. Closed-Source-Modelle in der EU-Region sind ebenfalls auf Anfrage verfügbar.
| Modell | Kontext | Input pro 1M Token | Cached Input pro 1M Token | Output pro 1M Token |
|---|---|---|---|---|
![]() Devstral 2 123B devstral-2-123b-instruct-2512 · Mistral AISpeziell für agentisches Software-Engineering entwickelt – 72,2 % auf SWE-Bench Verified. | 200K | 2,00 € | – | 2,00 € |
![]() Qwen3 235B A22B Instruct 2507 qwen3-235b-a22b-instruct-2507 · Qwen (Alibaba)Dediziertes Instruct-Modell mit verbessertem Instruction Following, breiter Sprachabdeckung und Langkontext-Verständnis. | 250K | 2,00 € | – | 2,00 € |
Keine Modelle gefunden. Fragen Sie uns gerne nach weiteren Modellen.
Preishinweise · Stand: 29. September 2026
- Alle Preise in Euro pro 1 Million Token, netto zzgl. gesetzlicher MwSt.
- Cached Input: reduzierter Preis für wiederverwendete Prompt-Bestandteile (Prompt Caching), sofern das Modell dies unterstützt.
- Monatliche Abrechnung nach tatsächlichem Verbrauch. Verbindlich sind die im Dashboard angezeigten Preise.
- Alle Modelle sind DSGVO-konform, sofern nicht anders gekennzeichnet.
- Closed-Source-Modelle in der EU-Region, dedizierte Instanzen, lokale Installationen und Volumenkonditionen auf Anfrage.
Direkt loslegen
Registrieren Sie sich auf der Plattform und nutzen Sie alle Modelle sofort – oder sprechen Sie mit uns über Volumenpreise, dedizierte Instanzen und Modelle auf Anfrage.
Mehr über unsere KI-Modelle

