Wie Sie Sprachmodelle auf Ihrer Eigenen Infrastruktur Betreiben Ohne von OpenAI Abhängig zu Sein
Jedes Mal, wenn Sie die API von OpenAI aufrufen, zahlen Sie pro Token. Jedes Mal, wenn Sie ein Dokument an Claude senden, übertragen Sie Daten an einen Server, den Sie nicht kontrollieren. Jedes Mal, wenn Sie Gemini nutzen, verarbeitet Google Ihre Informationen auf seiner Infrastruktur.
Für viele Unternehmen ist das ein doppeltes Problem: Kosten (APIs sind bei hohem Volumen teuer) und Datenschutz (Daten werden auf Servern Dritter verarbeitet). Die gute Nachricht: Sie müssen nicht mehr von diesen Anbietern abhängen. Open-Source-Sprachmodelle haben ein Qualitätsniveau erreicht, das sie für die meisten Unternehmensaufgaben geeignet macht.
Der aktuelle Stand offener Modelle
Vor zwei Jahren war der Unterschied zwischen GPT-4 und den besten offenen Modellen enorm. Heute hat sich diese Lücke deutlich geschlossen, besonders für strukturierte Unternehmensaufgaben.
Qwen (Alibaba) bietet Modelle von 0,5B bis 72B Parameter. Das 9B-Parameter-Qwen ist besonders relevant, da es auf eine GPU mit 16GB VRAM passt und Kontexte von bis zu 128K Token verarbeiten kann — genug, um komplette lange Dokumente zu verarbeiten.
Llama (Meta) bietet Modelle von 1B bis 405B Parameter. Die mittleren Versionen sind hervorragend für Reasoning- und Instruction-Following-Aufgaben.
Mistral bietet effiziente Modelle, die Leistung pro Parameter priorisieren. Gut für Umgebungen mit begrenzter Hardware.
Diese Modelle sind kostenlos zum Herunterladen und Ausführen. Keine Lizenzgebühren, keine Token-Kosten, kein monatliches Abonnement.
Welche Hardware Sie benötigen
Die Hauptanforderung ist eine GPU mit genügend VRAM (Videospeicher) zum Laden des Modells. Sprachmodelle werden quantisiert (in der Präzision reduziert), um auf kleinere GPUs zu passen, ohne signifikanten Qualitätsverlust.
Zum Einstieg (16GB VRAM): Eine NVIDIA RTX 4070 Ti, RTX A4000 oder RTX 4090 kann 7-9B-Parameter-Modelle quantisiert (Q4_K_M) mit Kontexten bis 128K Token ausführen. Typische Geschwindigkeit: 40-60 Token pro Sekunde. Investition: 800-2.000 EUR für die GPU.
Für Produktion (24-48GB VRAM): Zwei GPUs mit je 24GB ermöglichen den Betrieb größerer Modelle oder die Bedienung mehrerer gleichzeitiger Anfragen mit Tensor-Parallelismus. Typische Geschwindigkeit: 100-300+ Token pro Sekunde.
Der Server: Er muss nicht Enterprise-Klasse sein. Eine Workstation mit modernem Prozessor, 64GB RAM und einer dedizierten GPU reicht aus. Sie können vorhandene Geräte nutzen oder ein dediziertes kaufen. Das Betriebssystem ist Linux (Ubuntu ist die häufigste Wahl).
Die Gesamtkosten eines privaten KI-Servers sind vergleichbar mit 3-6 Monaten kommerzieller API-Nutzung bei Unternehmensvolumen. Danach sind die Betriebskosten im Wesentlichen Strom.
Wie die Modelle ausgeführt werden
Die Software zum lokalen Ausführen von Sprachmodellen ist kostenlos und Open Source:
llama.cpp — Die vielseitigste Option. Läuft auf CPU, GPU oder beidem. Unterstützt Quantisierung zur Reduzierung des Speicherverbrauchs. Hat einen eingebauten HTTP-Server, der eine OpenAI-kompatible API bereitstellt, was bedeutet, dass Anwendungen, die für die OpenAI-API entwickelt wurden, ohne Code-Änderungen auf Ihren lokalen Server zeigen können.
vLLM — Optimiert für hohen Durchsatz. Besser für Produktionsumgebungen, in denen mehrere Benutzer gleichzeitig Anfragen stellen. Benötigt mehr VRAM, ist aber deutlich schneller bei der Bedienung gleichzeitiger Anfragen.
Ollama — Die einfachste Option zum Einstieg. Lädt Modelle mit einem einzigen Befehl herunter und führt sie aus. Weniger konfigurierbar, aber ideal für Prototypen und Tests.
Die typische Installation dauert Stunden, nicht Wochen. Ein Team mit Linux-Erfahrung kann einen Inferenz-Server an einem Tag zum Laufen bringen.
Welche Aufgaben diese Modelle bewältigen können
Modelle mit 7-9B Parametern sind für die meisten Unternehmensaufgaben mehr als ausreichend:
Datenextraktion aus Dokumenten. Einen Vertrag lesen und Parteien, Daten, Beträge, Schlüsselklauseln extrahieren. Einen Ausweis lesen und Name, Steuer-ID, Adresse extrahieren.
Notizen- und Zusammenfassungserstellung. SOAP-Notizen aus medizinischen Transkriptionen erstellen, Besprechungsprotokolle zusammenfassen, Berichte aus strukturierten Daten erstellen.
Textklassifizierung. Dokumente nach Typ, E-Mails nach Priorität, Support-Tickets nach Kategorie klassifizieren.
Fragebeantwortung über Daten. Eine Datenbank abfragen und Ergebnisse in natürlicher Sprache präsentieren. Das ist es, was KI-Agenten tun.
Übersetzung. Mehrsprachige Modelle können zwischen Spanisch, Englisch und anderen Sprachen mit einer Qualität übersetzen, die mit kommerziellen Diensten vergleichbar ist.
Für anspruchsvollere Aufgaben (komplexes mathematisches Reasoning, hochwertige kreative Generierung, umfangreiche Code-Analyse) haben größere Modelle oder kommerzielle Dienste noch einen Vorteil. Aber für 80% der Unternehmensaufgaben zur Informationsverarbeitung reicht ein lokales Modell aus.
Wann APIs Sinn machen
Private KI ist nicht die Antwort auf alles. Es gibt Szenarien, in denen kommerzielle APIs mehr Sinn machen:
Sehr geringes Volumen. Wenn Sie 10 Dokumente pro Monat verarbeiten, rechtfertigt das keinen dedizierten Server. Die API ist praktischer.
Aufgaben, die Frontier-Modelle erfordern. Komplexes mehrstufiges Reasoning, kreative Generierung auf Publikationsniveau, Analysen, die aktuelles Weltwissen erfordern.
Schnelles Prototyping. Wenn Sie mit einer Idee experimentieren und nicht wissen, ob KI sie lösen kann. Testen Sie mit einer API, validieren Sie, und migrieren Sie dann lokal, wenn es funktioniert.
Kein technisches Team. Wenn Sie niemanden haben, der einen Linux-Server mit GPU warten kann, ist die kommerzielle API tragfähiger. Obwohl die Auslagerung der Serveradministration eine Option ist.
Die optimale Strategie für viele Unternehmen ist ein Hybridmodell: private Verarbeitung für sensible Daten und hohe Volumen, kommerzielle APIs für generische Aufgaben und Prototyping. Mit automatischem Fallback zwischen beiden zur Gewährleistung der Verfügbarkeit.
Leeuwwolk-Produkte: alle laufen lokal
Bei Leeuwwolk sind alle unsere Produkte für den Betrieb mit Sprachmodellen mit Leeuwwolks Datenschutzgarantie konzipiert. Fullkro, Scriba, Medicus und The Manager nutzen Qwen und Llama als primäre Modelle, mit llama.cpp als Inferenz-Runtime.
Die Hardwareinvestition amortisiert sich schnell gegenüber den äquivalenten Kosten kommerzieller APIs, und Leeuwwolk garantiert den Datenschutz: verschlüsselte Daten, die nie mit Dritten geteilt werden.
→ Erfahren Sie mehr über unsere privaten KI-Lösungen
Leeuwwolk ist ein mexikanisches Unternehmen, das Lösungen für künstliche Intelligenz mit Open-Source-Modellen und Datenschutzgarantie implementiert.