# KNUT — Bring Your Own GPU > KNUT verbindet vorhandene Hardware (NVIDIA-Grafikkarten und Macs mit Apple-Chip) im lokalen Netzwerk zu einem privaten, verteilten LLM-Inference-Cluster mit OpenAI- und Anthropic-kompatibler API (Port 9600). Ohne Cloud-Abo, ohne variable Token-Preise, ohne Datenabflüsse. Open-Source auf Basis von llama.cpp. ## Hauptabschnitte - [Warum lokale KI](https://knut.network/#warum): Begründung, warum Unternehmen auf eigene, lokale KI-Infrastruktur setzen - [So funktioniert es](https://knut.network/#ansatz): Die drei Grundprinzipien, der Name „KNUT" (nordisch für „Knoten") und die Verknüpfung über Port 9600 - [Benchmarks](https://knut.network/#benchmarks): Gemessene Durchsätze (t/s), Leistungsaufnahme (W) und Stromkosten je 1M Tokens pro Modell und Quantisierung im KNUT-Cluster; Vergleichstabelle zu Cloud-API-Preisen (Stand: August 2026) - [Zahlen](https://knut.network/#zahlen): Kernwerte auf einen Blick - [Kostenvergleich](https://knut.network/#rechner): Kostenrechner — Modellrechnung lokaler Betrieb gegen Cloud-API bei eigenen Tarifannahmen - [Hardware](https://knut.network/#hardware): Unterstützte Hardware, Drop-in-API-Schnittstellen und Anbindung (n8n, Open WebUI, Cursor) - [Zielgruppen](https://knut.network/#zielgruppen): Für wen sich KNUT lohnt - [Waitlist](https://knut.network/#waitlist): Anmeldung per E-Mail (Double Opt-In, Brevo) ## Modelle im Referenzcluster Messwerte aus dem KNUT-Referenzcluster (Dauerlast, inkl. 120 W Host-Overhead): - Qwen3.8-27B — Dense + SSM/MTP, 256k Kontext, bis 65,7 t/s - Qwen3.6-35B-A3B — Hybrid MoE + MTP, 256k Kontext, bis 148 t/s, multimodal (Vision) - Google Gemma 4 Suite — Dense 12B/31B & MoE 26B-A4B, 128k Kontext, günstigste gemessene Konfiguration der Seite (MoE-26B-A4B Q4) - Ornith-1.5-35B-A3B — spezialisiertes MoE-Modell für agentic Coding und deutsche Geschäftslogik, bis 145,2 t/s - Muse-Glimmer-30B — MoE mit dflash-Spekulativ-Drafting für kreatives Schreiben, bis 121 t/s ## Technische Fakten - Inferenz-Engine: llama.cpp (Open Source) mit eigener Verteilungs- und Messschicht - API: OpenAI- und Anthropic-kompatibel, Structured Outputs, Port 9600 (FastAPI-Cluster-Proxy) - Hardware: NVIDIA-GPUs und Apple Silicon, mischbar im selben Cluster - Betrieb: eigenes LAN, 100 % lokal (kein Cloud-Transfer); reine Stromkosten, Anschaffung/Abschreibung nicht enthalten - Günstigste gemessene Konfiguration: Google Gemma 4 MoE-26B-A4B (Q4), 115,9 t/s bei 180 W — 0,43 kWh je 1M Tokens, je nach Arbeitspreis 0,04 € (PV-Eigenstrom, 0,10 €/kWh) bis 0,16 € (regulärer Netzbezug, 0,36 €/kWh) ## Weitere Quellen - [Sitemap](https://knut.network/sitemap.xml) - [Impressum & Datenschutz](https://knut.network/) (im Footer der Seite)