Die verbreitetste Prozessorarchitektur der Welt hat sich mit einem Prinzip durchgesetzt: viel Rechenleistung bei wenig Energie. Genau dieses Prinzip gilt heute für KI im Unternehmen. Wer ein kleines KI Modell selbst hosten will, braucht kein Rechenzentrum. Er braucht die richtige Aufgabe, das richtige Modell und einen Workflow drumherum.
Dieser Artikel ist die Praxisfortsetzung zu Domänenspezifische KI erklärt. Dort steht das Konzept, hier steht der Aufbau: Hardware, Modell, Ollama, n8n und ein Beispielworkflow, den ihr nachbauen könnt.
KI Assistenten selbst hosten: Wir bringen kleine Modelle mit Ollama auf euren Server, bauen den n8n Workflow dazu und sorgen dafür, dass kein Byte das Haus verlässt. Für Teams, die KI nutzen wollen, ohne Daten rauszugeben. Zur Beratung KI Assistenten selbst hosten
Warum Effizienz wichtiger ist als Größe
Große Modelle brauchen GPU Server, laufen in fremden Rechenzentren und kosten pro Anfrage. Kleine Modelle laufen auf dem Server, der schon im Haus steht, oder auf einem Mini PC. Nach der Einrichtung kostet eine Anfrage fast nichts mehr, nur Strom.
Der Preis dafür: Ein kleines Modell kann nicht alles. Es kann eine klar umrissene Aufgabe. Das ist aber genau das, was die meisten Prozesse im Unternehmen brauchen. Niemand sortiert Rechnungen mit Weltwissen. Was sich dabei wirtschaftlich rechnet, steht im Glossar unter Lokale KI wirtschaftlich.
Welche Hardware reicht
Die ehrliche Antwort: weniger, als die meisten denken. Die Zahlen stammen aus den Modellkarten der Hersteller auf Hugging Face.
| Modell | Speicherbedarf | Hardware | Typische Aufgabe |
|---|---|---|---|
| Ministral 3B | Rund 8 Gigabyte, quantisiert rund 2 | Laptop, Mini PC, Edge Gerät | Klassifikation, Vorsortierung |
| Ministral 8B | Rund 12 Gigabyte | Laptop mit GPU, Mac mit Apple Silicon | Extraktion, kurze Zusammenfassung |
| Ministral 14B | Unter 24 Gigabyte quantisiert | Workstation oder Server mit einer GPU | Anspruchsvollere Texte, einfache Agenten |
| Mistral Small, vorige Generation | Rund 24 Gigabyte quantisiert | Server mit einer GPU | Arbeitsmodell für Workflows |
Ein Server mit einer Grafikkarte mit 24 Gigabyte Speicher deckt damit viele Aufgaben aus dem Alltag ab. Wie Quantisierung den Speicherbedarf drückt, ohne die Qualität zu ruinieren, erklärt unsere Seite zur GGUF Quantisierung.
Schritt 1 bringt das Modell mit Ollama zum Laufen
Ollama ist der einfachste Weg, ein offenes Modell auf einem Linux Server zu betreiben. Installation, Modell laden, fertig. Das Modell antwortet dann über eine lokale Schnittstelle, die n8n direkt ansprechen kann. Den kompletten Aufbau auf Linux beschreibt unser Ollama Praxis Guide, eine Übersicht gibt der Glossareintrag zu Ollama.
Zwei Dinge sind wichtig: Die Schnittstelle darf nur aus dem eigenen Netz erreichbar sein, und das Modell bekommt eine feste Version, keinen Alias auf die neueste. Sonst verhält sich euer Workflow nach dem nächsten Update anders, ohne dass jemand etwas geändert hat.
Schritt 2 bindet das Modell in n8n ein
n8n läuft bei uns ebenfalls auf eigenem Server. Das Modell wird dort ein Knoten wie jeder andere: Eingabe rein, Antwort raus. Entscheidend ist der Prompt. Für ein kleines Modell gilt:
- Eine Aufgabe pro Aufruf. Sortieren und Extrahieren sind zwei Knoten, nicht einer.
- Festes Ausgabeformat. Das Modell antwortet in einem Schema, das der nächste Knoten lesen kann, nicht in Prosa.
- Beispiele im Prompt. Drei bis fünf echte, anonymisierte Beispiele machen mehr aus als jede Anweisung.
- Unsicherheit erlauben. Das Modell darf unklar sagen. Diese Fälle gehen an einen Menschen oder ein größeres Modell.
Wie n8n Workflows grundsätzlich aufgebaut sind und warum sie Webprojekten gut tun, zeigt n8n und Vue.js. Wer beim Testen stolpert, findet Hilfe in n8n Workflow Debugging.
Schritt 3 zeigt den Beispielworkflow Rechnungseingang
Ein Prozess, der in fast jedem Unternehmen existiert und sich fast immer lohnt:
- Eingang: n8n überwacht das Rechnungspostfach und holt neue Mails mit Anhang ab.
- Prüfung: Das kleine Modell schaut auf den Anhang und entscheidet: Rechnung, Mahnung, Angebot oder etwas anderes. Bilder versteht es dabei direkt, auch Scans.
- Extraktion: Ein zweiter Aufruf zieht Lieferant, Rechnungsnummer, Datum, Betrag und Fälligkeit in ein festes Schema.
- Ablage: n8n legt die Rechnung mit den Daten im Dokumentensystem ab, etwa in Paperless, und erzeugt den Vorgang für die Buchhaltung.
- Eskalation: Alles, was das Modell als unsicher markiert, landet in einer Warteschlange für einen Menschen.
Der ganze Workflow läuft im eigenen Netz. Keine Rechnung, kein Lieferant, kein Betrag verlässt das Unternehmen. Das ist für viele der eigentliche Grund, ein kleines Modell zu betreiben, nicht die Kosten. Was das für Berufsgeheimnis und DSGVO bedeutet, erklärt Lokale KI für Compliance.
Schritt 4 holt ein großes Modell nur, wenn klein nicht reicht
Irgendwann kommt der Fall, den das kleine Modell nicht schafft: ein ungewöhnliches Dokument, eine lange Vertragsklausel, eine Anfrage mit fünf Fragen auf einmal. Dafür bauen wir eine Kaskade: Das kleine Modell markiert den Fall als unsicher, n8n schickt ihn an ein mittleres Modell über einen europäischen Anbieter, und nur die wirklich harten Fälle gehen an ein Flaggschiff wie Mistral Large.
So bleibt der Großteil der Daten im Haus, die Kosten bleiben niedrig, und das große Modell arbeitet nur dort, wo es einen Unterschied macht. Ein LLM Routing übernimmt die Verteilung automatisch, ein LLM Gateway hält jedes Modell austauschbar.
Was sich in der Praxis immer wieder zeigt
Drei Punkte zeigen sich bei kleinen Modellen immer wieder. Erstens scheitern Projekte meist an zu breiten Aufgaben. Zweitens ist der Prompt mit echten Beispielen wichtiger als jede Modellwahl. Drittens: Wer das Modell von Anfang an austauschbar baut, kann sich auf die nächste Generation freuen.
Häufige Fragen zum Selbst Hosten kleiner KI Modelle
Welche Hardware brauche ich, um ein kleines KI Modell selbst zu hosten?
Für ein Modell mit drei bis acht Milliarden Parametern reicht ein Laptop mit GPU, ein Mac mit Apple Silicon oder ein Mini PC. Für vierzehn Milliarden Parameter oder die vorige Generation von Mistral Small reicht ein Server mit einer Grafikkarte mit 24 Gigabyte Speicher. Ein Rechenzentrum braucht ihr nicht.
Wie bekomme ich ein KI Modell in einen n8n Workflow?
Mit Ollama auf dem Server betreiben, dann in n8n als Knoten ansprechen. Wichtig sind eine Aufgabe pro Aufruf, ein festes Ausgabeformat, Beispiele im Prompt und die Möglichkeit, dass das Modell unsichere Fälle markiert. Diese gehen dann an einen Menschen oder ein größeres Modell.
Ist ein kleines Modell gut genug?
Für klar umrissene, wiederkehrende Aufgaben ja: Sortieren, Extrahieren, kurze Zusammenfassungen, Bildprüfung. Für freie Texte, komplexes Reasoning und lange Agentenketten nicht. Deshalb bauen wir eine Kaskade: klein zuerst, mittel bei Bedarf, groß nur für die harten Einzelfälle.
Welches kleine Modell eignet sich für den Einstieg?
Ministral von Mistral AI in der Größe acht Milliarden Parameter ist ein guter Start: offene Gewichte, versteht Text und Bilder, läuft auf normaler Hardware und kommt aus Europa. Für anspruchsvollere Aufgaben auf einem Server die vorige Generation von Mistral Small. Beide stehen mit Details im Glossar KI Modelle.
Was kostet der Betrieb eines eigenen Modells?
Nach der Einrichtung im Wesentlichen Strom und etwas Wartung. Die Gewichte sind kostenlos, Ollama und n8n sind Open Source. Der Hauptaufwand liegt am Anfang: Aufgabe eingrenzen, Prompt mit Beispielen bauen, Workflow testen. Das sind meist Tage, keine Monate.
Bringt euer erstes Modell ins eigene Netz
Wir setzen Ollama und n8n auf eurem Server auf, bauen den ersten Workflow mit euch und zeigen eurem Team, wie es weitergeht. Kein Byte verlässt das Haus. Das Vorgespräch ist kostenlos.
