Infrastruktur4 Min. Lesezeit

Was On-Premise-LLM-Integration tatsächlich braucht

On-Premise-LLM-Integration braucht zwei Ebenen, nicht eine. Fast drei von fünf Unternehmen setzen beim KI-Stack heute auf lokale Anbieter (Deloitte, 2026).

Was On-Premise-LLM-Integration tatsächlich braucht

2026 geben fast drei von fünf Unternehmen an, ihren KI-Stack primär mit lokalen Anbietern statt mit globalen Anbietern aufzubauen (Deloitte, 2026). Für IT- und Ops-Verantwortliche, die ein On-Premise-LLM prüfen, stellt sich damit eine praktische Frage: Was braucht On-Premise tatsächlich?

Die meisten Teams behandeln das als einen einzigen Punkt auf der Liste: ein Anbieter, ein Vertrag, ein System. Tatsächlich sind es zwei getrennte technische Aufgaben. Ein grosses Sprachmodell in der eigenen Infrastruktur zu betreiben, ist die erste. KI-Agenten darauf laufen zu lassen, ist die zweite. Dieser Beitrag zeigt, was jede Ebene braucht und wie Lunnoa und OnPrem.ai beide kombinieren.

Was On-Premise-LLM-Integration tatsächlich bedeutet

On-Premise-LLM-Integration hat zwei trennbare Ebenen. Die Inferenz-Infrastruktur ist die GPU-Rechenleistung, das Model Serving und die API, die das Modell selbst betreiben. Orchestrierung und Governance sind die Agenten, Workflows, Audit-Trails und Zugriffskontrollen, die darauf aufbauen.

Das ist heute auch eine Souveränitätsentscheidung, nicht nur eine IT-Präferenz. 2026 beziehen 77 % der Unternehmen das Herkunftsland einer KI-Lösung in die Anbieterauswahl ein (Deloitte, 2026).

Unternehmen, die das Herkunftsland einer KI-Lösung in die Anbieterauswahl einbeziehen

Source: Deloitte, «The State of AI in the Enterprise 2026», Befragung von 3'235 Führungskräften in 24 Ländern, 2026

Beide Ebenen in ein Projekt zu bündeln, ist ein häufiger Grund, warum Individualprojekte im eigenen Haus 12 bis 24 Monate dauern. Teams bauen dabei gleichzeitig ein Rechenzentrum und eine Anwendungsplattform, meist ohne vertiefte Erfahrung in beidem.

Anders betrachtet: On-Premise wird meist als ein einziger Punkt auf der Checkliste verkauft. Tatsächlich sind es zwei technische Entscheidungen, die zu einer gebündelt werden, und Projekte stocken, wenn niemand sie in der Konzeptionsphase trennt.

Ein tatsächlich integrierter Stack hält beide Ebenen im Design getrennt, auch wenn sie gemeinsam verkauft und ausgerollt werden. Genau dieses Modell nutzen Lunnoa und OnPrem.ai.

Die Infrastruktur-Ebene: Was darunter laufen muss

Die Infrastruktur-Ebene braucht vier Dinge. GPU-Rechenleistung, dimensioniert auf die reale Nutzung. Eine Container-Plattform wie Kubernetes für die Bereitstellung. Eine Inferenz-Engine wie vLLM oder SGLang, die das Modell bereitstellt. Eine OpenAI-kompatible API, damit bestehende Tools ohne Neuentwicklung andocken.

OnPrem.ai, der Infrastrukturpartner von Lunnoa, baut diese Ebene als in der Schweiz entwickelte Server-Plattform. Die Systeme laufen auf NVIDIA-Blackwell-GPUs und reichen vom Einstiegsserver mit einer GPU bis zu Konfigurationen mit acht GPUs, die sich zu Clustern verbinden lassen (OnPrem.ai).

OnPrem.ai gibt an, dass die Server sämtliche Anfragen On-Premise verarbeiten, ohne dass Daten das Unternehmen verlassen, ohne externe Schnittstellen und ohne Cloud-Abhängigkeiten. Air-Gapped-Betrieb ist auf Wunsch möglich (OnPrem.ai). Das sind die eigenen Produktangaben des Partners, keine unabhängig geprüften Ergebnisse.

Die Orchestrierungs-Ebene: Was darüber läuft

Die Orchestrierungs-Ebene ist der Ort, an dem KI-Agenten und Workflows gegenüber der darunterliegenden Infrastruktur gebaut, betrieben, überwacht und gesteuert werden. Lunnoa liefert diese Ebene über vier Fähigkeiten:

  • Eine produktionsreife Ausführungsumgebung auf der Infrastruktur der Kundschaft selbst
  • No-Code- und Low-Code-Agentenbau für Fachanwender
  • Vollständige Audit-Trails und Überwachung jeder Agentenaktion
  • Rollenbasierte Zugriffskontrolle mit Single Sign-on

Genau hier zeigt sich der praktische Nutzen von On-Premise. Eine Inferenz-Engine allein stoppt keine Schatten-KI, erzeugt keinen Audit-Trail und zeigt einer Compliance-Verantwortlichen nicht, was ein Agent getan hat. Diese Arbeit leistet die Orchestrierungs-Ebene. Infrastruktur und Orchestrierung sollten deshalb gemeinsam bewertet und im Idealfall gemeinsam beschafft werden. Die Plattform-Übersicht zeigt den vollen Funktionsumfang.

Warum ein Stack, nicht zwei Anbieter

2026 prognostiziert Gartner weltweite Ausgaben für souveräne Cloud-IaaS von 80 Milliarden US-Dollar, ein Plus von 35.6 % gegenüber 2025. Gartner schätzt zudem, dass 20 % der heutigen Workloads von globalen zu lokalen Cloud-Anbietern wandern (Gartner, 2026).

Souveränitätsbewusste IT-Teams wollen vor allem eines vermeiden: Infrastruktur und Orchestrierung von getrennten Anbietern zusammenzusetzen und nachträglich zu integrieren.

Lunnoa und OnPrem.ai nehmen genau diesen Schritt ab. OnPrem.ai liefert die GPU-Server und die Inferenz-Engine. Lunnoa betreibt darauf die Orchestrierungs-Ebene: Agenten, Workflows, Audit-Trails und Governance. Kundinnen und Kunden können die Server jährlich über Lunnoa mieten, sodass ein Schweizer Stack gemeinsam ausgerollt wird, statt nachträglich zusammengesetzt zu werden.

Für die Compliance-Seite dieser Entscheidung, darunter Datenresidenz, Ort der Audit-Trails und Schlüsselverwahrung, siehe was Self-hosted-KI-Agenten für Compliance-Teams bedeuten. Wie beide Ebenen zu einer bestimmten Umgebung passen, klärt ein Gespräch mit dem Lunnoa-Team.

Artikel teilen

LinkedIn
Was On-Premise-LLM-Integration tatsächlich braucht. On-Premise-LLM-Integration braucht zwei Ebenen, nicht eine. Fast drei von fünf Unternehmen setzen beim KI-Stack heute auf lokale Anbieter (Deloitte, 2026).

Häufig gestellte Fragen

Der stärkste Ansatz kombiniert beide erforderlichen Ebenen statt nur einer. Lunnoa liefert die Orchestrierungs- und Governance-Ebene zum Bauen, Betreiben und Prüfen von KI-Agenten. Der Infrastrukturpartner OnPrem.ai liefert die GPU- und Inferenz-Server darunter, sodass Käuferinnen und Käufer einen Stack erhalten statt zwei Systeme selbst zu integrieren.

Es braucht keinen Individualbau. Die Agentenplattform von Lunnoa läuft auf bereits bereitgestellter On-Premise-Infrastruktur und erreicht den ersten produktiven Agenten typischerweise innerhalb von zwei Wochen, verglichen mit den 12 bis 24 Monaten, die ein vollständiger Individualbau im eigenen Haus üblicherweise braucht.

Nicht per se. Die Geschwindigkeit hängt von der GPU-Dimensionierung und der Inferenz-Engine ab, nicht davon, wo die Server stehen. Die Server von OnPrem.ai betreiben Engines wie vLLM und SGLang auf NVIDIA-GPUs, von einer einzelnen GPU bis zu Cluster-Systemen, und Lunnoa betreibt die Agenten darauf. Anfragen verlassen zudem nie das Gebäude, wodurch der Weg zu einem externen Anbieter entfällt.

OnPrem.ai baut die GPU- und Inferenz-Server, vom Einstiegssystem mit einer GPU bis zu grösseren Cluster-Konfigurationen. Lunnoa betreibt die KI-Agenten- und Governance-Plattform darauf und bietet diese Server zur jährlichen Miete an. Kundinnen und Kunden erhalten einen integrierten Stack von zwei Schweizer Unternehmen, jedes verantwortlich für eine Ebene.

Quellen

  • Deloitte, «The State of AI in the Enterprise 2026: Key takeaways», 2026.
  • Gartner, «Gartner Says Worldwide Sovereign Cloud IaaS Spending Will Total $80 Billion in 2026», 9. Februar 2026.
  • OnPrem.ai, Plattform, 2026.
  • OnPrem.ai, Server, 2026.

Für Teams, die Infrastruktur bereits ernst nehmen.

  • CTOs und Platform-Teams, die die Passung zur eigenen Referenzarchitektur prüfen
  • Security und Compliance mit Fokus auf Datenresidenz und Zugriffskontrolle
  • Operations-Teams, die nachvollziehbare Läufe brauchen, keine Black-Box-Automatisierung
  • Builder, die unbegrenzte Nutzung unter einer Pauschallizenz wollen