//Die KI-Plattform für Entwickler & Power-User
Modelle, die
dir gehören.
Chatte mit Qwen, GLM-5.2 und Kimi K2.6 — lokal auf deiner GPU oder in der Cloud. Eine OpenAI-kompatible API, eigene Keys, On-Demand-Compute. Gebaut für Menschen, die ihre Werkzeuge beherrschen.
- ✓ OpenAI-kompatibel
- ✓ Lokal & Cloud
- ✓ EU-Rechenzentren
- ✓ Keine Kreditkarte
Chat
Mehrere Modelle, ein Fenster. Wechsle mitten im Gespräch zwischen lokalem Qwen und Cloud-GLM — Verlauf, Kontext und Kosten immer im Blick.
API
Deine Keys, dein Code. Ein OpenAI-kompatibler Endpoint für alle Modelle. Tausche die Base-URL, behalte deinen Stack.
Compute
GPU-Leistung, wenn du sie brauchst. On-Demand-Karten von der RTX 4090 bis zur H100 — pro Minute, ohne Vertrag.
01 / Modelle
Vergleichbare Daten. Keine Behauptungen.
Kontext, Latenz und Preis pro Million Token — nebeneinander. Lokale Modelle laufen gratis auf deiner Hardware, Cloud-Modelle in EU-Rechenzentren.
| Modell | Kontext | Latenz | Preis / 1M Tok (In / Out) | Deploy |
|---|---|---|---|---|
| Qwen2.5 7B | 32K | ~40 ms | gratis | lokal |
| Qwen3 30B-A3B | 32K | ~55 ms | gratis | lokal |
| GLM-5.2 | 256K | 210 ms | €0,40 / €1,20 | cloud |
| Kimi K2.6 | 256K | 190 ms | €0,50 / €1,50 | cloud |
04 / API
Ein Endpoint.
Deine Keys. Dein Stack.
Voll OpenAI-kompatibel. Tausch die Base-URL, behalte deinen Code — alle lokalen und Cloud-Modelle über einen einzigen, vertrauten Endpoint.
- ✓ Kompatibel mit den OpenAI-SDKs
- ✓ Eigene Keys mit Nutzungslimits
- ✓ Streaming out of the box
from openai import OpenAI
client = OpenAI(
base_url="https://chat.ragnasoftware.net/v1",
api_key="$RAGNA_KEY",
)
resp = client.chat.completions.create(
model="glm-5.2",
messages=[{"role": "user", "content": "Hallo"}],
)
print(resp.choices[0].message.content)02 /Vertrauen & Datenhoheit
Kontrolle ist kein Feature. Sie ist die Grundlage.
Deine Gespräche gehören dir.
Lokale Modelle verlassen dein Gerät nie. Was du auf deiner GPU rechnest, bleibt auf deiner GPU.
Cloud in der EU.
Cloud-Modelle laufen in europäischen Rechenzentren — mit klaren Grenzen, wohin deine Daten fließen.
Kein stilles Training.
Wir trainieren nicht heimlich auf dem, was du schreibst. Deine Prompts sind kein Trainingsmaterial.
03 / Preise
Wähle deine Ebene. Wechsle jederzeit.
Von gratis lokal bis zur H100-Klasse. Mit Monero zahlen = 5 % Rabatt. Jederzeit kündbar.
- ✓Alle lokalen Modelle (bis 32B, MoE)
- ✓500 Nachrichten / Tag
- ✓Eigene API-Keys
- ✓+ GLM-5.2 & Kimi K2.6
- ✓RTX 4090 (5 Std./Mon.)
- ✓3 Mio Cloud-Tokens
- ✓1.500 Nachrichten / Tag
- ✓Alles aus Plus
- ✓RTX 4090 + A6000
- ✓10 Mio Cloud-Tokens
- ✓4.000 Nachrichten / Tag
- ✓Priorität
- ✓Neueste & teuerste Modelle
- ✓A100 + H100-Karten
- ✓25 Mio Cloud-Tokens
- ✓10.000 Nachrichten / Tag
- ✓Alles ohne Kompromisse
- ✓Beste H100-Karten
- ✓75 Mio Cloud-Tokens
- ✓Unbegrenzte Nachrichten
On-Demand-GPU-Minuten inklusive · Faire Nutzung · Kein Vertrag
Bereit für Modelle, die dir gehören?
Keine Kreditkarte · In 60 Sekunden einsatzbereit