Zum Inhalt springen
KNUT // Bring Your Own GPU
Infrastruktur/Lokales Cluster

Deine KI, deine Daten, souverän ohne Cloud.

KNUT bündelt vorhandene Hardware, von NVIDIA bis zu Apple Silicon, im lokalen Netzwerk zu einer Schnittstelle. OpenAI- und Anthropic-kompatibel, im eigenen Haus betrieben, ohne variable Token-Preise.

OpenAI & Anthropic kompatibel100 % LAN-Betrieb
Warum lokale KI

Warum Unternehmen auf lokale & eigene KI-Infrastruktur setzen.

Der produktive Einsatz von künstlicher Intelligenz entfaltet sein volles Potenzial, wenn Betriebsgeheimnisse geschützt bleiben und die laufenden Betriebskosten transparent und planbar kalkuliert werden können.

Datenschutz & Compliance§ 203 StGB & DSGVO

Vertraulichkeit & Berufsgeheimnis

Sensible Dokumente, Mandantenverträge, Patientendaten oder proprietärer Quellcode erfordern höchste Diskretion. Wird lokal gerechnet, bleiben die Eingaben im eigenen Unternehmensnetzwerk, ohne externe Datenweitergabe.

✓ KNUT: Ausführung im eigenen LAN
WirtschaftlichkeitTransparente Fixkosten

Planbare Betriebskosten bei wachsender Nutzung

Bei intensiver Nutzung, automatisierten n8n-Pipelines oder kontinuierlichen RAG-Analysen bieten feste Betriebskosten auf Basis des tatsächlichen Stromverbrauchs eine bessere Planungsgrundlage als variable volumenbasierte Tarife.

✓ KNUT: ab ~0,11 € Strom je 1M Tokens*
RessourceneffizienzBestehende Hardware bündeln

Vorhandene Rechner sinnvoll zusammenführen

In den meisten Betrieben sind bereits leistungsfähige Arbeitsplatzrechner, Workstations oder Macs vorhanden. KNUT verknüpft diese Geräte im Netzwerk zu einem gemeinsamen Pool, sodass auch anspruchsvolle Modelle direkt betrieben werden können.

✓ KNUT: Flexibler Verbund aus CUDA & Metal
Pragmatische Infrastruktur für den Mittelstand

Bündele deine Hardware zum persönlichen KI-Rechenzentrum.

Wie ein fester Netzknoten verbindet KNUT handelsübliche Grafikkarten und Rechner (z. B. NVIDIA RTX-Modelle oder Apple Silicon Macs im Verbund mit PCs) über das lokale Netzwerk zu einem gemeinsamen Rechner. So können Betriebe moderne Sprachmodelle für interne Workflows, sensible Dokumente und Automatisierungen direkt vor Ort betreiben. Das gelingt pragmatisch, ohne Datenabfluss nach außen und auf Basis der bereits vorhandenen Büro- und Entwicklungs-Hardware.

Kalkulierbarer Stromverbrauch
ab ~0,11 € / 1M*
Datensouveränität
im eigenen Haus

Exemplarische Angabe. Gemessen wird die reine Leistungsaufnahme der Grafikkarten unter Inferenzlast (ohne Host-Grundstrom): günstigste gemessene Konfiguration im KNUT-Cluster ist Google Gemma 4 Suite (MoE-26B-A4B-Q4) mit 115,9 t/s bei 180 W GPU-Last. Das sind 0,43 kWh je 1M Tokens. Was das kostet, entscheidet der eigene Arbeitspreis: 0,04 € bei PV-Eigenstrom (0,10 €/kWh), 0,10 € beim KMU-Sondervertrag (0,24 €/kWh), 0,15 € bei regulärem Netzbezug (0,36 €/kWh). Größere Modelle und höhere Quantisierungen liegen darüber; die vollständige Messreihe steht im Abschnitt Benchmarks, eine Gesamtrechnung samt Standby im Kostenvergleich. Reine GPU-Stromkosten, ohne Anschaffung und Abschreibung.

So funktioniert es

Drei Stränge für den perfekten Knoten

KNUT steht für den nordischen Knoten: Wie in der Seefahrt verbindet er einzelne Stränge zu einer belastbaren Einheit. Im LAN bündelt KNUT deine Rechner, ob NVIDIA oder Apple Silicon, zu einem gemeinsamen Pool, angetrieben von llama.cpp mit eigener Verteil- und Messschicht.

Souveränität

Die Daten bleiben im eigenen Netz

Dokumente, Mandatsakten und Patientendaten werden lokal im LAN verarbeitet, ohne externe Auftragsverarbeitung. Das ist die Grundlage für DSGVO- und § 203-konforme Abläufe.

Bündelung

Gemeinsamer Grafikspeicher im Netz

KNUT verbindet NVIDIA-Karten und Macs zu einem gemeinsamen Grafikspeicher: Zwei RTX 5070 Ti und zwei Mac Mini M4 kommen zusammen auf rund 80 GB. Was auf keinem der Geräte einzeln läuft, läuft im Verbund (ab ~0,11 € / 1M Tokens*).

Anschluss

Verknüpfung über Port 9600

Alle Enden laufen an einer Stelle zusammen: Eine Schnittstelle im Standard von OpenAI und Anthropic. n8n-Pipelines, Open WebUI, Cursor und eigene Python-Agenten docken direkt an.

Exemplarische Angabe. Gemessen wird die reine Leistungsaufnahme der Grafikkarten unter Inferenzlast (ohne Host-Grundstrom): günstigste gemessene Konfiguration im KNUT-Cluster ist Google Gemma 4 Suite (MoE-26B-A4B-Q4) mit 115,9 t/s bei 180 W GPU-Last. Das sind 0,43 kWh je 1M Tokens. Was das kostet, entscheidet der eigene Arbeitspreis: 0,04 € bei PV-Eigenstrom (0,10 €/kWh), 0,10 € beim KMU-Sondervertrag (0,24 €/kWh), 0,15 € bei regulärem Netzbezug (0,36 €/kWh). Größere Modelle und höhere Quantisierungen liegen darüber; die vollständige Messreihe steht im Abschnitt Benchmarks, eine Gesamtrechnung samt Standby im Kostenvergleich. Reine GPU-Stromkosten, ohne Anschaffung und Abschreibung.

Benchmarks

Verteilte Inferenz,
praktisch gemessen.

KNUT bündelt Grafikkarten und Apple Silicon* im LAN. An einem Referenzcluster über drei verschiedene CUDA-Generationen hinweg siehst du, welcher Durchsatz und Strombedarf dabei herauskommt.

High-Precision Dense Coding & ReasoningDense + SSM / MTPKontext: 256k

Qwen3.8-27B

Modernste dichte Architektur mit State-Space-Modellierung (SSM) und Multi-Token-Prediction (MTP). Liefert herausragende Reasoning- und Codiereigenschaften im 256k-Kontextfenster bei Unsloth Dynamic Quantization.

⚡ Kernvorteil:Multi-Token-Prediction & SSM Ladder
Referenz-Durchsatz
43,3 Tokens / Sekunde
Reine GPU-Kosten / 1M Tokens*
~0,63bei 276 W GPU-Last

Gemessene Quantisierungs-Stufen (Qwen3.8-27B)

Referenzcluster: Bis zu 3 CUDA-Generationen (RTX 5070 Ti + 4060 Ti + 3060) mit bis zu 44 GB VRAM
QuantisierungDateigrößeDurchsatzGPU-Leistung (W)GPU-Kosten / 1M*
UD-IQ2_XXS9,0 GB65,7 t/s348 W0,53
UD-IQ2_M10,3 GB58,4 t/s330 W0,56
UD-Q3_K_XL13,4 GB43,3 t/s276 W0,63
UD-Q4_K_XL17,9 GB38,2 t/s245 W0,64
UD-Q6_K_XL25,9 GB27,5 t/s232 W0,84
UD-Q8_K_XL31,5 GB19,2 t/s227 W0,87

Gemessen auf einem Referenzcluster über drei verschiedene CUDA-Generationen hinweg: 1× RTX 5070 Ti (Knoten nexus), 1× RTX 4060 Ti (Knoten vector) und 1× RTX 3060 12GB (Knoten wall-e) sowie Apple Silicon. Gegen eine einzelne oder mehrere RTX 5090 oder 3090 gewinnt dieses Setup natürlich keinen reinen Bandbreiten-Sprint. Zusammen jedoch bündeln die drei Karten 44 GB VRAM aus Mittelklasse-Hardware. Modelle bis 35B- und darüber hinaus laufen dadurch flüssig im LAN, statt an Speicherlimits einer Einzelkarte zu scheitern. Die Messwerte basieren auf der reinen GPU-Leistungsaufnahme unter Last bei exemplarischen 0,36 €/kWh.

Kostenvergleich

Extern vs. Eigenbetrieb.

Eine Modellrechnung auf Basis echter Messwerte: Wähle einen der regionalen Referenztarife am Beispiel von Nordfriesland oder passe den Strompreis stufenlos an deinen eigenen Vertrag an – vom PV-Eigenstrom bis zum Gewerbebezug.

ca. 40.000 DIN-A4-Seiten (80 Aktenordner)
25 Mio. Tokens
1M (Test)50M (Team)200M (Agenten)
5,00 € / 1M
0,36/ kWh
Referenztarif (Region Nordfriesland / SH):

Regulärer Arbeitspreis für Büros und Kanzleien in Nordfriesland inkl. Steuern, Umlagen und Netzentgelten Nord.

Monatliche Ersparnis
57/ Monat
~ 684pro Jahr
Cloud-API Kosten / Monat
125
variable Token-Abrechnung
KNUT Stromkosten / Monat
68
reine GPU-Wattwerte im Verbund bei 0,36 €/kWh
Investitionsschutz vorhandener Hardware:
Bestehende Rechner direkt nutzbar
Kosten je 1M Tokens:~2,72 € / 1M
Verarbeitetes Volumen:40.000 DIN-A4-Seiten
Vergleichswert:ca. 80 volle Aktenordner
Leistungsaufnahme:Reine Watt-Werte der GPUs im Verbund
Rechenzeit im Monat:~69 Stunden / Monat
Datenspeicherung:100 % lokal im LAN

Modellrechnung, keine Zusage. Unterstellt sind ein Cluster-Durchsatz von 100 t/s, 700 W reine Leistungsaufnahme der Grafikkarten im Verbund unter Last sowie 140 kWh Grundlast im Monat (Dauerbetrieb der Knoten). 1 Mio. Tokens entsprechen als Faustformel ca. 1.600 DIN-A4-Seiten Fließtext (ca. 600 Tokens je Standardseite inkl. Ein- und Ausgabe; ein regulärer breiter Aktenordner mit 8 cm Rückenbreite fasst ca. 500 Blatt). Der tatsächliche Verbrauch hängt an Modell, Quantisierung und Auslastung; die gemessenen Werte je Modell stehen im Abschnitt Benchmarks. Die Cloud-Seite rechnet mit Größenordnungen für drei Modellklassen, nicht mit den Listenpreisen einzelner Produkte: die Rechnung nimmt jeweils die Mitte der angegebenen Spanne. Stand der Spannen: August 2026. Anschaffung und Abschreibung der eigenen Hardware sind nicht enthalten.

Messbare Fakten

KNUT in Zahlen

Externe API-Kosten
0 €für den Betrieb im eigenen Netz
Stromkosten ab
~0,11 €pro 1M Tokens*
Datensouveränität
100 %der Anfragen laufen im eigenen Netz
Kontextgröße
256k+modellabhängig, skaliert mit dem Pool

Exemplarische Angabe. Gemessen wird die reine Leistungsaufnahme der Grafikkarten unter Inferenzlast (ohne Host-Grundstrom): günstigste gemessene Konfiguration im KNUT-Cluster ist Google Gemma 4 Suite (MoE-26B-A4B-Q4) mit 115,9 t/s bei 180 W GPU-Last. Das sind 0,43 kWh je 1M Tokens. Was das kostet, entscheidet der eigene Arbeitspreis: 0,04 € bei PV-Eigenstrom (0,10 €/kWh), 0,10 € beim KMU-Sondervertrag (0,24 €/kWh), 0,15 € bei regulärem Netzbezug (0,36 €/kWh). Größere Modelle und höhere Quantisierungen liegen darüber; die vollständige Messreihe steht im Abschnitt Benchmarks, eine Gesamtrechnung samt Standby im Kostenvergleich. Reine GPU-Stromkosten, ohne Anschaffung und Abschreibung.

Hardware & Schnittstellen

NVIDIA und Apple Silicon im Verbund.

Vom Mac Mini über die RTX 3060 aus der Schublade bis zur neuen RTX 5070 Ti: KNUT bündelt Generationen und Architekturen zu einem gemeinsamen VRAM-Pool. Beliebige im Büro oder Labor vorhandene Rechner können flexibel als Master oder Worker im Cluster fungieren.

Drop-in API-Schnittstellen

Port 9600 (FastAPI Cluster-Proxy)

POST /v1/chat/completionsOpenAI Kompatibilität

SSE-Streaming-Inferenz, Function Calling / Tool-Calls und JSON-Schema-Validierung.

POST /v1/messagesAnthropic Kompatibilität

Übersetzung von Claude-Tools und Tool-Results in llama-server Aufrufe.

POST /v1/responsesOpenAI Structured Outputs

Ausgaben im vordefinierten JSON-Format für automatisierte Workflows.

GET /api/nodes & /api/pollEchtzeit-Telemetrie

Live-VRAM, Watt-Aufnahme, GPU-Temperatur und Token-Durchsatz über SSE & REST.

Nahtlos in bestehende Tools

Standard-Schnittstellen: Bestehende Endpunkt-URL austauschen

n8n Automatisierung

Anbindung über den OpenAI-Node, in der Regel ohne Code-Änderungen.

Open WebUI

Vollwertiges ChatGPT-Interface im eigenen LAN mit Nutzerverwaltung.

Cursor & Cline

Lokaler Coding-Assistent mit flexiblem Kontextfenster & MTP-Beschleunigung.

LangChain & LlamaIndex

RAG-Pipelines für vertrauliche Dokumente im eigenen Netz.

Zielgruppen

Für Betriebe, bei denen Vertraulichkeit und Wirtschaftlichkeit an erster Stelle stehen.

KNUT wurde für Organisationen entwickelt, die moderne KI-Modelle produktiv einsetzen möchten, ohne die Kontrolle über ihre vertraulichen Daten an externe Plattformen abzutreten.

§ 203 StGB & Mandatsgeheimnis

Kanzleien & Notariate

Verarbeitung sensibler Schriftsätze ohne Drittanbieter-Risiko

Vertragsanalysen, Aktenzusammenfassungen und Mandantenkorrespondenz werden im eigenen Büro-Netzwerk verarbeitet. Eine Weitergabe an externe Rechenzentren entfällt, ebenso die damit verbundenen Fragen zur Auftragsverarbeitung.

Verarbeitung im eigenen Haus • Ohne Cloud-ÜbertragungLAN-Betrieb
Patientendaten & DSGVO Art. 9

Praxen, Labore & Kliniken

Medizinische Gutachten & Dokumentation vor Ort

Analyse von Arztbriefen, Laborbefunden und Fachliteratur auf eigener Hardware. Das schafft eine Grundlage für den Umgang mit besonderen Kategorien personenbezogener Daten nach Art. 9 DSGVO.

Verarbeitung im LAN • Ohne externe ÜbertragungLAN-Betrieb
Planbare Fixkosten & Dauerbetrieb

Digital- & Marketing-Agenturen

Unbegrenzt rechnen für Content, Recherche und Automatisierungen

Ruhig weiterarbeiten, auch bei automatisierten Content-Strecken, Dokumentenrecherche oder Chatbot-Versuchen. Verlässliche und planbare Betriebskosten durch die Bündelung vorhandener Agentur-Hardware.

Planbare Fixkosten • Ohne VolumenabrechnungLAN-Betrieb
Agentic Coding & Lokale APIs

Software- & Tech-Teams

Lokale Coding-Modelle mit großem Kontext für Cursor & Cline

Geistiges Eigentum und proprietäre Codebasen bleiben in der eigenen Entwicklungsumgebung. Schnelle Antworten für Autovervollständigung und größere Umbauten.

Kompatibel mit OpenAI- und Anthropic-APILAN-Betrieb
Waitlist

Bereit für deine eigene, private KI-Infrastruktur?

Zwei Minuten, drei Felder. Du erfährst als Erstes, wenn KNUT für deinen Betrieb bereitsteht, und was dein vorhandener Rechnerbestand dafür hergibt.

Deine Angaben nur für die Waitlist. Kein Spam, Abmeldung jederzeit mit einem Klick.