Deine KI, deine Daten, souverän ohne Cloud.
KNUT bündelt vorhandene Hardware, von NVIDIA bis zu Apple Silicon, im lokalen Netzwerk zu einer Schnittstelle. OpenAI- und Anthropic-kompatibel, im eigenen Haus betrieben, ohne variable Token-Preise.
Warum Unternehmen auf lokale & eigene KI-Infrastruktur setzen.
Der produktive Einsatz von künstlicher Intelligenz entfaltet sein volles Potenzial, wenn Betriebsgeheimnisse geschützt bleiben und die laufenden Betriebskosten transparent und planbar kalkuliert werden können.
Vertraulichkeit & Berufsgeheimnis
Sensible Dokumente, Mandantenverträge, Patientendaten oder proprietärer Quellcode erfordern höchste Diskretion. Wird lokal gerechnet, bleiben die Eingaben im eigenen Unternehmensnetzwerk, ohne externe Datenweitergabe.
Planbare Betriebskosten bei wachsender Nutzung
Bei intensiver Nutzung, automatisierten n8n-Pipelines oder kontinuierlichen RAG-Analysen bieten feste Betriebskosten auf Basis des tatsächlichen Stromverbrauchs eine bessere Planungsgrundlage als variable volumenbasierte Tarife.
Vorhandene Rechner sinnvoll zusammenführen
In den meisten Betrieben sind bereits leistungsfähige Arbeitsplatzrechner, Workstations oder Macs vorhanden. KNUT verknüpft diese Geräte im Netzwerk zu einem gemeinsamen Pool, sodass auch anspruchsvolle Modelle direkt betrieben werden können.
Bündele deine Hardware zum persönlichen KI-Rechenzentrum.
Wie ein fester Netzknoten verbindet KNUT handelsübliche Grafikkarten und Rechner (z. B. NVIDIA RTX-Modelle oder Apple Silicon Macs im Verbund mit PCs) über das lokale Netzwerk zu einem gemeinsamen Rechner. So können Betriebe moderne Sprachmodelle für interne Workflows, sensible Dokumente und Automatisierungen direkt vor Ort betreiben. Das gelingt pragmatisch, ohne Datenabfluss nach außen und auf Basis der bereits vorhandenen Büro- und Entwicklungs-Hardware.
Exemplarische Angabe. Gemessen wird die reine Leistungsaufnahme der Grafikkarten unter Inferenzlast (ohne Host-Grundstrom): günstigste gemessene Konfiguration im KNUT-Cluster ist Google Gemma 4 Suite (MoE-26B-A4B-Q4) mit 115,9 t/s bei 180 W GPU-Last. Das sind 0,43 kWh je 1M Tokens. Was das kostet, entscheidet der eigene Arbeitspreis: 0,04 € bei PV-Eigenstrom (0,10 €/kWh), 0,10 € beim KMU-Sondervertrag (0,24 €/kWh), 0,15 € bei regulärem Netzbezug (0,36 €/kWh). Größere Modelle und höhere Quantisierungen liegen darüber; die vollständige Messreihe steht im Abschnitt Benchmarks, eine Gesamtrechnung samt Standby im Kostenvergleich. Reine GPU-Stromkosten, ohne Anschaffung und Abschreibung.
Drei Stränge für den perfekten Knoten
KNUT steht für den nordischen Knoten: Wie in der Seefahrt verbindet er einzelne Stränge zu einer belastbaren Einheit. Im LAN bündelt KNUT deine Rechner, ob NVIDIA oder Apple Silicon, zu einem gemeinsamen Pool, angetrieben von llama.cpp mit eigener Verteil- und Messschicht.
Souveränität
Die Daten bleiben im eigenen Netz
Dokumente, Mandatsakten und Patientendaten werden lokal im LAN verarbeitet, ohne externe Auftragsverarbeitung. Das ist die Grundlage für DSGVO- und § 203-konforme Abläufe.
Bündelung
Gemeinsamer Grafikspeicher im Netz
KNUT verbindet NVIDIA-Karten und Macs zu einem gemeinsamen Grafikspeicher: Zwei RTX 5070 Ti und zwei Mac Mini M4 kommen zusammen auf rund 80 GB. Was auf keinem der Geräte einzeln läuft, läuft im Verbund (ab ~0,11 € / 1M Tokens*).
Anschluss
Verknüpfung über Port 9600
Alle Enden laufen an einer Stelle zusammen: Eine Schnittstelle im Standard von OpenAI und Anthropic. n8n-Pipelines, Open WebUI, Cursor und eigene Python-Agenten docken direkt an.
Exemplarische Angabe. Gemessen wird die reine Leistungsaufnahme der Grafikkarten unter Inferenzlast (ohne Host-Grundstrom): günstigste gemessene Konfiguration im KNUT-Cluster ist Google Gemma 4 Suite (MoE-26B-A4B-Q4) mit 115,9 t/s bei 180 W GPU-Last. Das sind 0,43 kWh je 1M Tokens. Was das kostet, entscheidet der eigene Arbeitspreis: 0,04 € bei PV-Eigenstrom (0,10 €/kWh), 0,10 € beim KMU-Sondervertrag (0,24 €/kWh), 0,15 € bei regulärem Netzbezug (0,36 €/kWh). Größere Modelle und höhere Quantisierungen liegen darüber; die vollständige Messreihe steht im Abschnitt Benchmarks, eine Gesamtrechnung samt Standby im Kostenvergleich. Reine GPU-Stromkosten, ohne Anschaffung und Abschreibung.
Verteilte Inferenz,
praktisch gemessen.
KNUT bündelt Grafikkarten und Apple Silicon* im LAN. An einem Referenzcluster über drei verschiedene CUDA-Generationen hinweg siehst du, welcher Durchsatz und Strombedarf dabei herauskommt.
Qwen3.8-27B
Modernste dichte Architektur mit State-Space-Modellierung (SSM) und Multi-Token-Prediction (MTP). Liefert herausragende Reasoning- und Codiereigenschaften im 256k-Kontextfenster bei Unsloth Dynamic Quantization.
Gemessene Quantisierungs-Stufen (Qwen3.8-27B)
Referenzcluster: Bis zu 3 CUDA-Generationen (RTX 5070 Ti + 4060 Ti + 3060) mit bis zu 44 GB VRAM| Quantisierung | Dateigröße | Durchsatz | GPU-Leistung (W) | GPU-Kosten / 1M* |
|---|---|---|---|---|
| UD-IQ2_XXS | 9,0 GB | 65,7 t/s | 348 W | 0,53 € |
| UD-IQ2_M | 10,3 GB | 58,4 t/s | 330 W | 0,56 € |
| UD-Q3_K_XL | 13,4 GB | 43,3 t/s | 276 W | 0,63 € |
| UD-Q4_K_XL | 17,9 GB | 38,2 t/s | 245 W | 0,64 € |
| UD-Q6_K_XL | 25,9 GB | 27,5 t/s | 232 W | 0,84 € |
| UD-Q8_K_XL | 31,5 GB | 19,2 t/s | 227 W | 0,87 € |
Gemessen auf einem Referenzcluster über drei verschiedene CUDA-Generationen hinweg: 1× RTX 5070 Ti (Knoten nexus), 1× RTX 4060 Ti (Knoten vector) und 1× RTX 3060 12GB (Knoten wall-e) sowie Apple Silicon. Gegen eine einzelne oder mehrere RTX 5090 oder 3090 gewinnt dieses Setup natürlich keinen reinen Bandbreiten-Sprint. Zusammen jedoch bündeln die drei Karten 44 GB VRAM aus Mittelklasse-Hardware. Modelle bis 35B- und darüber hinaus laufen dadurch flüssig im LAN, statt an Speicherlimits einer Einzelkarte zu scheitern. Die Messwerte basieren auf der reinen GPU-Leistungsaufnahme unter Last bei exemplarischen 0,36 €/kWh.
Extern vs. Eigenbetrieb.
Eine Modellrechnung auf Basis echter Messwerte: Wähle einen der regionalen Referenztarife am Beispiel von Nordfriesland oder passe den Strompreis stufenlos an deinen eigenen Vertrag an – vom PV-Eigenstrom bis zum Gewerbebezug.
Regulärer Arbeitspreis für Büros und Kanzleien in Nordfriesland inkl. Steuern, Umlagen und Netzentgelten Nord.
Modellrechnung, keine Zusage. Unterstellt sind ein Cluster-Durchsatz von 100 t/s, 700 W reine Leistungsaufnahme der Grafikkarten im Verbund unter Last sowie 140 kWh Grundlast im Monat (Dauerbetrieb der Knoten). 1 Mio. Tokens entsprechen als Faustformel ca. 1.600 DIN-A4-Seiten Fließtext (ca. 600 Tokens je Standardseite inkl. Ein- und Ausgabe; ein regulärer breiter Aktenordner mit 8 cm Rückenbreite fasst ca. 500 Blatt). Der tatsächliche Verbrauch hängt an Modell, Quantisierung und Auslastung; die gemessenen Werte je Modell stehen im Abschnitt Benchmarks. Die Cloud-Seite rechnet mit Größenordnungen für drei Modellklassen, nicht mit den Listenpreisen einzelner Produkte: die Rechnung nimmt jeweils die Mitte der angegebenen Spanne. Stand der Spannen: August 2026. Anschaffung und Abschreibung der eigenen Hardware sind nicht enthalten.
KNUT in Zahlen
- Externe API-Kosten
- 0 €für den Betrieb im eigenen Netz
- Stromkosten ab
- ~0,11 €pro 1M Tokens*
- Datensouveränität
- 100 %der Anfragen laufen im eigenen Netz
- Kontextgröße
- 256k+modellabhängig, skaliert mit dem Pool
Exemplarische Angabe. Gemessen wird die reine Leistungsaufnahme der Grafikkarten unter Inferenzlast (ohne Host-Grundstrom): günstigste gemessene Konfiguration im KNUT-Cluster ist Google Gemma 4 Suite (MoE-26B-A4B-Q4) mit 115,9 t/s bei 180 W GPU-Last. Das sind 0,43 kWh je 1M Tokens. Was das kostet, entscheidet der eigene Arbeitspreis: 0,04 € bei PV-Eigenstrom (0,10 €/kWh), 0,10 € beim KMU-Sondervertrag (0,24 €/kWh), 0,15 € bei regulärem Netzbezug (0,36 €/kWh). Größere Modelle und höhere Quantisierungen liegen darüber; die vollständige Messreihe steht im Abschnitt Benchmarks, eine Gesamtrechnung samt Standby im Kostenvergleich. Reine GPU-Stromkosten, ohne Anschaffung und Abschreibung.
NVIDIA und Apple Silicon im Verbund.
Vom Mac Mini über die RTX 3060 aus der Schublade bis zur neuen RTX 5070 Ti: KNUT bündelt Generationen und Architekturen zu einem gemeinsamen VRAM-Pool. Beliebige im Büro oder Labor vorhandene Rechner können flexibel als Master oder Worker im Cluster fungieren.
Drop-in API-Schnittstellen
Port 9600 (FastAPI Cluster-Proxy)
SSE-Streaming-Inferenz, Function Calling / Tool-Calls und JSON-Schema-Validierung.
Übersetzung von Claude-Tools und Tool-Results in llama-server Aufrufe.
Ausgaben im vordefinierten JSON-Format für automatisierte Workflows.
Live-VRAM, Watt-Aufnahme, GPU-Temperatur und Token-Durchsatz über SSE & REST.
Nahtlos in bestehende Tools
Standard-Schnittstellen: Bestehende Endpunkt-URL austauschen
Anbindung über den OpenAI-Node, in der Regel ohne Code-Änderungen.
Vollwertiges ChatGPT-Interface im eigenen LAN mit Nutzerverwaltung.
Lokaler Coding-Assistent mit flexiblem Kontextfenster & MTP-Beschleunigung.
RAG-Pipelines für vertrauliche Dokumente im eigenen Netz.
Für Betriebe, bei denen Vertraulichkeit und Wirtschaftlichkeit an erster Stelle stehen.
KNUT wurde für Organisationen entwickelt, die moderne KI-Modelle produktiv einsetzen möchten, ohne die Kontrolle über ihre vertraulichen Daten an externe Plattformen abzutreten.
Kanzleien & Notariate
Verarbeitung sensibler Schriftsätze ohne Drittanbieter-Risiko
Vertragsanalysen, Aktenzusammenfassungen und Mandantenkorrespondenz werden im eigenen Büro-Netzwerk verarbeitet. Eine Weitergabe an externe Rechenzentren entfällt, ebenso die damit verbundenen Fragen zur Auftragsverarbeitung.
Praxen, Labore & Kliniken
Medizinische Gutachten & Dokumentation vor Ort
Analyse von Arztbriefen, Laborbefunden und Fachliteratur auf eigener Hardware. Das schafft eine Grundlage für den Umgang mit besonderen Kategorien personenbezogener Daten nach Art. 9 DSGVO.
Digital- & Marketing-Agenturen
Unbegrenzt rechnen für Content, Recherche und Automatisierungen
Ruhig weiterarbeiten, auch bei automatisierten Content-Strecken, Dokumentenrecherche oder Chatbot-Versuchen. Verlässliche und planbare Betriebskosten durch die Bündelung vorhandener Agentur-Hardware.
Software- & Tech-Teams
Lokale Coding-Modelle mit großem Kontext für Cursor & Cline
Geistiges Eigentum und proprietäre Codebasen bleiben in der eigenen Entwicklungsumgebung. Schnelle Antworten für Autovervollständigung und größere Umbauten.
Bereit für deine eigene,
private KI-Infrastruktur?
Zwei Minuten, drei Felder. Du erfährst als Erstes, wenn KNUT für deinen Betrieb bereitsteht, und was dein vorhandener Rechnerbestand dafür hergibt.