Warum lokale Modelle heute praxistauglich sind
Offene Modelle wie Qwen, Mistral oder Llama erreichen inzwischen ein Niveau, das für die meisten Unternehmensaufgaben ausreicht. Damit wird souveräne KI ohne externe Anbieter realistisch.
Wir wählen das Modell passend zu Aufgabe, Hardware und Budget - nicht nach Hype - und betreiben es effizient quantisiert auf vorhandener oder moderater neuer Infrastruktur.
Datenschutz als Architektur, nicht als Versprechen
Wenn KI vollständig im eigenen Netz läuft, verschiebt sich das Gespräch von Rechtfertigung zu Möglichkeit. DSGVO und EU AI Act erfüllen Sie dann durch Aufbau, nicht durch Haftungsausschlüsse.
Wir dokumentieren Datenflüsse, Modelle und Zugriffe sauber, damit Compliance prüfbar bleibt und Vertrauen entsteht.
Was wir liefern
Auswahl und Benchmarking offener Modelle, lokale Inferenz-Infrastruktur, Anbindung an RAG und interne Systeme sowie Betrieb und Wartung.
Auf Wunsch verbinden wir lokale Modelle mit selektiver Cloud-Nutzung dort, wo es unkritisch ist - ein pragmatischer Hybrid statt Dogma.
On-Premise oder Cloud: die Entscheidungskriterien
Nicht jedes Unternehmen braucht ein lokales Modell. On-Premise lohnt sich, wenn Daten das Haus nicht verlassen dürfen, wenn Latenz und Verfügbarkeit planbar sein müssen oder wenn laufende Cloud-Kosten bei hohem Volumen aus dem Ruder laufen. Cloud-KI bleibt sinnvoll für schwankende Last, schnelle Experimente und Anwendungsfälle ohne sensible Daten.
Wir treffen diese Entscheidung mit Ihnen anhand von vier Fragen: Wie sensibel sind die Daten? Wie planbar ist die Last? Wie streng sind Ihre Compliance-Vorgaben? Und wie hoch ist das erwartete Anfragevolumen? Aus den Antworten ergibt sich die Architektur, nicht eine Produktpräferenz.
KI-Betrieb mit EU-Datenresidenz: die 12-Punkte-Checkliste
Souveränität entsteht nicht durch ein Versprechen, sondern durch nachweisbare technische und organisatorische Maßnahmen. Diese zwölf Punkte arbeiten wir bei jedem On-Premise-Projekt ab:
Datenresidenz: Modell und Daten liegen ausschließlich in Ihrer Infrastruktur oder in einem EU-Rechenzentrum Ihrer Wahl.
Keine Datenabflüsse: Eingaben werden nicht an Dritte gesendet und nicht zum Training fremder Modelle verwendet.
Zugriffskontrolle: rollenbasierte Rechte, damit nur berechtigte Nutzer auf Modell und Wissensbasis zugreifen.
Protokollierung: nachvollziehbare Logs über Anfragen und Antworten für Audits.
Verschlüsselung: Daten im Ruhezustand und bei der Übertragung verschlüsselt.
Datensparsamkeit: nur die für den Anwendungsfall nötigen Dokumente werden indexiert.
Löschkonzept: definierte Aufbewahrungs- und Löschfristen für Eingaben und Embeddings.
Auftragsverarbeitung: klare Verträge (AVV) und dokumentierte Verantwortlichkeiten.
EU AI Act: Einordnung des Anwendungsfalls in die Risikoklassen und die passenden Pflichten.
Menschliche Kontrolle: kritische Entscheidungen bleiben beim Menschen, das Modell unterstützt.
Quellenbelege: Antworten verweisen nachprüfbar auf die zugrunde liegenden Dokumente.
Betriebssicherheit: Updates, Monitoring und ein Notfallkonzept für den produktiven Betrieb.
Welche Modelle wir einsetzen
Wir setzen auf offene, kommerziell nutzbare Modelle wie Qwen, Mistral und Llama, die lokal laufen und keine Bindung an einen Cloud-Anbieter erzwingen. Die Modellgröße richtet sich nach Aufgabe und Hardware: kompakte Modelle für Klassifikation und Extraktion, größere für anspruchsvolle Dialoge und Zusammenfassungen.
Entscheidend ist nicht das größte Modell, sondern das passende. Wir testen Kandidaten an Ihren echten Daten und wählen die kleinste Variante, die Ihre Qualitätsanforderung erfüllt. Das senkt Hardwarebedarf und Betriebskosten.
Hardware und Infrastruktur
Ein produktives Offline-LLM braucht keinen Großrechner. Für viele Mittelstandsfälle genügt ein Server mit einer modernen GPU. Wir dimensionieren die Hardware nach Modellgröße, Nutzerzahl und Antwortzeit und betreiben die Lösung wahlweise on-premise, in Ihrem Rechenzentrum oder in einer EU-Private-Cloud.
Auf Wunsch übernehmen wir Aufbau, Integration in Ihre Systeme und den laufenden Betrieb. Sie behalten die volle Kontrolle über Modell, Daten und Infrastruktur.













