ON-PREMISE · OFFLINE-LLM

Offline-LLM: leistungsfähige KI, die Ihr Netz nie verlässt

Cloud-KI ist für viele Unternehmen keine Option – aus Datenschutz, Geheimhaltung oder Branchenvorgaben. iiterate Technologies setzt offene Sprachmodelle lokal auf Ihrer Hardware oder in Ihrer privaten Cloud auf, sodass sensible Daten Ihre Umgebung nie verlassen.

VERTRAUT VON TEAMS, DIE KI ERNST NEHMEN
  • Fourcore — project by iiterate Technologies, AI and XR studio
  • Techeroes — project by iiterate Technologies, AI and XR studio
  • GSG ForE4rth — client of iiterate Technologies
  • Eatopia — client of iiterate Technologies
  • Space Era — project by iiterate Technologies, AI and XR studio
  • Portrait of an iiterate team member or client
  • DigiMit2 — client of iiterate Technologies
  • VisaFlow — project by iiterate Technologies, AI and XR studio
  • NomadX — client of iiterate Technologies
  • Prominent builders — client of iiterate Technologies
  • RecruLight — client of iiterate Technologies
  • Look Insite — project by iiterate Technologies, AI and XR studio
  • Gründungsstipendium Rheinland-Pfalz, startup grant awarded to iiterate
  • ratLab — client of iiterate Technologies

0

Cloud nötig

100% lokal

auf Ihrer Hardware

DSGVO

durch Architektur

Modelloffen

kein Vendor-Lock-in

Warum lokale Modelle heute praxistauglich sind

Offene Modelle wie Qwen, Mistral oder Llama erreichen inzwischen ein Niveau, das für die meisten Unternehmensaufgaben ausreicht. Damit wird souveräne KI ohne externe Anbieter realistisch.

Wir wählen das Modell passend zu Aufgabe, Hardware und Budget – nicht nach Hype – und betreiben es effizient quantisiert auf vorhandener oder moderater neuer Infrastruktur.

Datenschutz als Architektur, nicht als Versprechen

Wenn KI vollständig im eigenen Netz läuft, verschiebt sich das Gespräch von Rechtfertigung zu Möglichkeit. DSGVO und EU AI Act erfüllen Sie dann durch Aufbau, nicht durch Haftungsausschlüsse.

Wir dokumentieren Datenflüsse, Modelle und Zugriffe sauber, damit Compliance prüfbar bleibt und Vertrauen entsteht.

Was wir liefern

Auswahl und Benchmarking offener Modelle, lokale Inferenz-Infrastruktur, Anbindung an RAG und interne Systeme sowie Betrieb und Wartung.

Auf Wunsch verbinden wir lokale Modelle mit selektiver Cloud-Nutzung dort, wo es unkritisch ist – ein pragmatischer Hybrid statt Dogma.

On-Premise oder Cloud: die Entscheidungskriterien

Nicht jedes Unternehmen braucht ein lokales Modell. On-Premise lohnt sich, wenn Daten das Haus nicht verlassen dürfen, wenn Latenz und Verfügbarkeit planbar sein müssen oder wenn laufende Cloud-Kosten bei hohem Volumen aus dem Ruder laufen. Cloud-KI bleibt sinnvoll für schwankende Last, schnelle Experimente und Anwendungsfälle ohne sensible Daten.

Wir treffen diese Entscheidung mit Ihnen anhand von vier Fragen: Wie sensibel sind die Daten? Wie planbar ist die Last? Wie streng sind Ihre Compliance-Vorgaben? Und wie hoch ist das erwartete Anfragevolumen? Aus den Antworten ergibt sich die Architektur, nicht eine Produktpräferenz.

DSGVO-konformer KI-Betrieb: die 12-Punkte-Checkliste

Souveränität entsteht nicht durch ein Versprechen, sondern durch nachweisbare technische und organisatorische Maßnahmen. Diese zwölf Punkte arbeiten wir bei jedem On-Premise-Projekt ab:

  • Datenresidenz: Modell und Daten liegen ausschließlich in Ihrer Infrastruktur oder in einem EU-Rechenzentrum Ihrer Wahl.

  • Keine Datenabflüsse: Eingaben werden nicht an Dritte gesendet und nicht zum Training fremder Modelle verwendet.

  • Zugriffskontrolle: rollenbasierte Rechte, damit nur berechtigte Nutzer auf Modell und Wissensbasis zugreifen.

  • Protokollierung: nachvollziehbare Logs über Anfragen und Antworten für Audits.

  • Verschlüsselung: Daten im Ruhezustand und bei der Übertragung verschlüsselt.

  • Datensparsamkeit: nur die für den Anwendungsfall nötigen Dokumente werden indexiert.

  • Löschkonzept: definierte Aufbewahrungs- und Löschfristen für Eingaben und Embeddings.

  • Auftragsverarbeitung: klare Verträge (AVV) und dokumentierte Verantwortlichkeiten.

  • EU AI Act: Einordnung des Anwendungsfalls in die Risikoklassen und die passenden Pflichten.

  • Menschliche Kontrolle: kritische Entscheidungen bleiben beim Menschen, das Modell unterstützt.

  • Quellenbelege: Antworten verweisen nachprüfbar auf die zugrunde liegenden Dokumente.

  • Betriebssicherheit: Updates, Monitoring und ein Notfallkonzept für den produktiven Betrieb.

Welche Modelle wir einsetzen

Wir setzen auf offene, kommerziell nutzbare Modelle wie Qwen, Mistral und Llama, die lokal laufen und keine Bindung an einen Cloud-Anbieter erzwingen. Die Modellgröße richtet sich nach Aufgabe und Hardware: kompakte Modelle für Klassifikation und Extraktion, größere für anspruchsvolle Dialoge und Zusammenfassungen.

Entscheidend ist nicht das größte Modell, sondern das passende. Wir testen Kandidaten an Ihren echten Daten und wählen die kleinste Variante, die Ihre Qualitätsanforderung erfüllt. Das senkt Hardwarebedarf und Betriebskosten.

Hardware und Infrastruktur

Ein produktives Offline-LLM braucht keinen Großrechner. Für viele Mittelstandsfälle genügt ein Server mit einer modernen GPU. Wir dimensionieren die Hardware nach Modellgröße, Nutzerzahl und Antwortzeit und betreiben die Lösung wahlweise on-premise, in Ihrem Rechenzentrum oder in einer EU-Private-Cloud.

Auf Wunsch übernehmen wir Aufbau, Integration in Ihre Systeme und den laufenden Betrieb. Sie behalten die volle Kontrolle über Modell, Daten und Infrastruktur.

So arbeiten wir

Transparent, iterativ und in Ihrem Tempo – vom ersten Gespräch bis zum Betrieb.

01

Potenzialanalyse

Wir identifizieren, wo KI in Ihrem Unternehmen echten, messbaren Wert schafft.

02

Prototyp

Ein schlanker Prototyp an Ihren echten Daten zeigt den Nutzen in Wochen.

03

Produktiver Betrieb

Wir bringen die Lösung sicher in Ihre Infrastruktur – on-premise oder hybrid.

Was unsere Kunden sagen

Partnerschaften, die auf Vertrauen und messbaren Ergebnissen beruhen.

  • Ich habe einen Auftrag zur Programmierung eines RAG für einen LiveAvatar ausgeschrieben. Das Angebot der iiterate GmbH war das beste und ich habe diese Wahl nie bereut. Die Aufgabe wurde zu 100% zu meiner Zufriedenheit erlegt. Das Preis-Leistungsverhältnis von iiterate in diesem Auftrag war exzellent. Ich kann jedem anderen Unternehmen die Zusammenarbeit mit iiterate mit besten Gewissen empfehlen.

    Klaus Buttenhauser
    Founder
    Eatopia — client of iiterate Technologies
  • We approached iiterate with the concept of a scalable AR application with numerous features. The team at iiterate is very resourceful and worked with us to find the AR solution that best suits our needs. From designing the UI to delivering the final application, they ensured a high level of quality and flexibility at each stage.

    We are excited to launch this application and we believe that this application will help position our brand successfully within our niche. We confidently recommend iiterate to anyone seeking customized AR solutions.

    Elmar Thyen & Kaif Ali
    CEO
    Space Era — project by iiterate Technologies, AI and XR studio
  • We just wanted to take a moment to express our appreciation for the outstanding work you have done in developing our platform at E4RTH. From the very beginning, your team has demonstrated a high level of professionalism, dedication, and expertise.

    We were particularly impressed by your proactive approach—bringing in your own creative ideas and solutions, which significantly enhanced the final outcome. It was a pleasure to collaborate with a team that not only executes but also actively contributes to making the project even better.

    We are very satisfied with your service and look forward to continuing our collaboration in the future. Thank you for your excellent work!

    Emilio Gonzalez & Moritz Maximilian Simon
    CEO & CSO
    GSG ForE4rth — client of iiterate Technologies
  • Working with the team at iiterate on the AI avatar was really a positive and successful experience. Our aim was to develop a life like video avatar who would deliver a script within an automotive training environment surrounded by a number of different media devices such as laptops and mobiles etc. demonstrating different examples of Look.Insite’s training solution.

    I would say that the great strength of iiterate is the open mindedness and ability to explore this rapidly shifting technology. It takes quick wits as well as patience to make successful headway but that's what we achieved and the results are in evidence.

    So my recommendation is if you're looking for someone to guide you in ground breaking technical/visual endeavour I would really recommend working with these guys because they have the skills to not only provide great service but to develop new techniques as required.

    Nico Clark
    Founder
    Look Insite — project by iiterate Technologies, AI and XR studio

Häufige Fragen

Welche Hardware braucht ein Offline-LLM?

Das hängt von Modellgröße und Last ab. Viele Anwendungsfälle laufen bereits auf einer einzelnen leistungsfähigen GPU. Wir dimensionieren die Hardware nach Ihrem konkreten Bedarf, nicht nach Maximalannahmen.

Sind offene Modelle gut genug für den Geschäftseinsatz?

Für Wissensabfragen, Textarbeit, Klassifikation und viele Assistenzaufgaben ja. Wir benchmarken Kandidaten an Ihren echten Aufgaben, bevor wir uns festlegen.

Können wir später das Modell wechseln?

Ja. Wir bauen die Lösung modular, sodass das Sprachmodell austauschbar bleibt und Sie nicht an einen Anbieter gebunden sind.

Was kostet ein On-Premise-LLM im Vergleich zur Cloud?

Die Cloud verursacht laufende Kosten pro Anfrage, die bei hohem Volumen schnell steigen. On-Premise bedeutet eine einmalige Investition in Hardware plus Betrieb. Ab einem gewissen Nutzungsvolumen ist die lokale Lösung günstiger und planbarer. Wir rechnen das vor der Entscheidung gemeinsam durch.

Ist ein Offline-LLM wirklich DSGVO-konform?

Ja, wenn Daten und Modell Ihre Infrastruktur nicht verlassen und die organisatorischen Maßnahmen stimmen. Genau dafür arbeiten wir die 12-Punkte-Checkliste ab und ordnen den Anwendungsfall in den EU AI Act ein.

Wie schnell ist ein Offline-LLM einsatzbereit?

Ein erster nutzbarer Prototyp an Ihren Daten entsteht in wenigen Wochen. Der produktive Betrieb folgt nach Test und Integration, abhängig von Datenlage und IT-Umgebung.

Souveräne KI, ganz ohne Cloud-Zwang.

Vereinbaren Sie ein unverbindliches Erstgespräch – wir zeigen Ihnen den ersten Anwendungsfall, der sich rechnet.

Arthur C. Clarke

“Any sufficiently advanced technology is indistinguishable from magic.”

Deutschland
Mittelbachstraße 66, 53518 Adenau

Tel. +49 (0) 176 74709826

© iiterate Technologies GmbH
All rights reserved
Social Links

Arthur C. Clarke

“Any sufficiently advanced technology is indistinguishable from magic.”

Deutschland
Mittelbachstraße 66, 53518 Adenau

Tel. +49 (0) 176 74709826

© iiterate Technologies GmbH
All rights reserved
Social Links

Arthur C. Clarke

“Any sufficiently advanced technology is indistinguishable from magic.”
Deutschland
Mittelbachstraße 66, 53518 Adenau

Tel. +49 (0) 176 74709826

© iiterate Technologies GmbH
All rights reserved
Social Links