//Die KI-Plattform für Entwickler & Power-User

Modelle, die
dir gehören.

Chatte mit Qwen, GLM-5.2 und Kimi K2.6 — lokal auf deiner GPU oder in der Cloud. Eine OpenAI-kompatible API, eigene Keys, On-Demand-Compute. Gebaut für Menschen, die ihre Werkzeuge beherrschen.

Qwen2.5· LokalGLM-5.2· CloudKimi K2.6· Cloud
  • OpenAI-kompatibel
  • Lokal & Cloud
  • EU-Rechenzentren
  • Keine Kreditkarte
ragna://chat · glm-5.2
01

Chat

Mehrere Modelle, ein Fenster. Wechsle mitten im Gespräch zwischen lokalem Qwen und Cloud-GLM — Verlauf, Kontext und Kosten immer im Blick.

02

API

Deine Keys, dein Code. Ein OpenAI-kompatibler Endpoint für alle Modelle. Tausche die Base-URL, behalte deinen Stack.

03

Compute

GPU-Leistung, wenn du sie brauchst. On-Demand-Karten von der RTX 4090 bis zur H100 — pro Minute, ohne Vertrag.

01 / Modelle

Vergleichbare Daten. Keine Behauptungen.

Kontext, Latenz und Preis pro Million Token — nebeneinander. Lokale Modelle laufen gratis auf deiner Hardware, Cloud-Modelle in EU-Rechenzentren.

ModellKontextLatenzPreis / 1M Tok (In / Out)Deploy
Qwen2.5 7B32K~40 msgratislokal
Qwen3 30B-A3B32K~55 msgratislokal
GLM-5.2256K210 ms€0,40 / €1,20cloud
Kimi K2.6256K190 ms€0,50 / €1,50cloud

04 / API

Ein Endpoint.
Deine Keys. Dein Stack.

Voll OpenAI-kompatibel. Tausch die Base-URL, behalte deinen Code — alle lokalen und Cloud-Modelle über einen einzigen, vertrauten Endpoint.

  • Kompatibel mit den OpenAI-SDKs
  • Eigene Keys mit Nutzungslimits
  • Streaming out of the box
from openai import OpenAI

client = OpenAI(
    base_url="https://chat.ragnasoftware.net/v1",
    api_key="$RAGNA_KEY",
)

resp = client.chat.completions.create(
    model="glm-5.2",
    messages=[{"role": "user", "content": "Hallo"}],
)
print(resp.choices[0].message.content)

02 /Vertrauen & Datenhoheit

Kontrolle ist kein Feature. Sie ist die Grundlage.

Deine Gespräche gehören dir.

Lokale Modelle verlassen dein Gerät nie. Was du auf deiner GPU rechnest, bleibt auf deiner GPU.

Cloud in der EU.

Cloud-Modelle laufen in europäischen Rechenzentren — mit klaren Grenzen, wohin deine Daten fließen.

Kein stilles Training.

Wir trainieren nicht heimlich auf dem, was du schreibst. Deine Prompts sind kein Trainingsmaterial.

03 / Preise

Wähle deine Ebene. Wechsle jederzeit.

Von gratis lokal bis zur H100-Klasse. Mit Monero zahlen = 5 % Rabatt. Jederzeit kündbar.

Free
0/Mon.
  • Lokales 7B-Modell
  • 20 Nachrichten / Tag
  • Zum Ausprobieren
Basic
19/Mon.
ⓜ 18.05€ mit Monero
  • Alle lokalen Modelle (bis 32B, MoE)
  • 500 Nachrichten / Tag
  • Eigene API-Keys
Plus
49/Mon.
ⓜ 46.55€ mit Monero
  • + GLM-5.2 & Kimi K2.6
  • RTX 4090 (5 Std./Mon.)
  • 3 Mio Cloud-Tokens
  • 1.500 Nachrichten / Tag
ProBeliebt
99/Mon.
ⓜ 94.05€ mit Monero
  • Alles aus Plus
  • RTX 4090 + A6000
  • 10 Mio Cloud-Tokens
  • 4.000 Nachrichten / Tag
  • Priorität
Elite
199/Mon.
ⓜ 189.05€ mit Monero
  • Neueste & teuerste Modelle
  • A100 + H100-Karten
  • 25 Mio Cloud-Tokens
  • 10.000 Nachrichten / Tag
UltraMax
499/Mon.
ⓜ 474.05€ mit Monero
  • Alles ohne Kompromisse
  • Beste H100-Karten
  • 75 Mio Cloud-Tokens
  • Unbegrenzte Nachrichten

On-Demand-GPU-Minuten inklusive · Faire Nutzung · Kein Vertrag

Bereit für Modelle, die dir gehören?

Keine Kreditkarte · In 60 Sekunden einsatzbereit