Zum Hauptinhalt springen
Zurück zum Blog
Strategie7 Min. Lesezeit05.10.2026Sophera Consulting

KI self-hosted oder Cloud? Fünf Fragen, nach denen Sie entscheiden

KI self-hosted oder Cloud? Fünf Fragen entscheiden: Daten, Lastspitzen, Menge, Betreuung und Modellwechsel. Durchgespielt an einer Spedition.

Dieser Beitrag wurde mit KI erstellt. Kennzeichnung gemäß Art. 50 EU AI Act. Verantwortlich für die Veröffentlichung: Sophera Consulting.

"Läuft die KI dann bei uns oder in der Cloud?" Hinter der Frage steht eine Sorge mit zwei Seiten. Entweder gehen Kundendaten an einen Konzern in Übersee, oder jemand muss einen Server kaufen und sich um ihn kümmern. Beides muss nicht so sein. Ob Sie KI self-hosted oder in der Cloud betreiben, entscheiden Sie für jeden Ablauf einzeln, und dafür reichen fünf Fragen, die Sie besser beantworten können als jeder Anbieter.

KI self-hosted oder Cloud: in Wirklichkeit drei Orte

Mit Cloud ist beim KI-Agenten die Schnittstelle eines Modellanbieters gemeint. Der Agent schickt einen Text hin und bekommt die Antwort zurück, bezahlt wird je Aufruf. Hardware und Grundgebühr gibt es keine. Datenschutzrechtlich kommt es darauf an, wo der Anbieter rechnet und welchen Vertrag er unterschreibt. Wir setzen auf europäische Infrastruktur, den Vertrag zur Auftragsverarbeitung bringen wir mit.

Self-hosted zerfällt in zwei Wege. Beim gemieteten Server läuft das Modell auf dedizierter Hardware in einem europäischen Rechenzentrum, nur für Sie und gegen eine feste Monatsmiete. Bei eigener Hardware steht die Maschine in Ihrem Serverraum. Die Daten verlassen Ihr Netz dann nicht, dafür zahlen Sie Anschaffung, Strom und die Zeit Ihrer IT.

Der Agent selbst ist auf allen drei Wegen derselbe. Er liest dieselben Systeme, ordnet nach denselben Regeln zu, setzt dieselben Fälle auf die Klärliste und legt dieselben Entwürfe zur Freigabe vor. Anders ist nur der Ort, an dem das Sprachmodell rechnet.

Zwei Agenten in einer Spedition, als Beispiel

Das folgende Beispiel ist konstruiert. Es soll die Abwägung an einem greifbaren Fall zeigen.

Angenommen, eine Spedition mit 40 Lkw will zwei Abläufe automatisieren. Der erste ist die Auftragserfassung: Kunden schicken Transportaufträge per Mail, der Agent liest sie aus und legt im Transportmanagementsystem einen Entwurf an, den die Disposition freigibt. Der zweite ist die Prüfung der Fahrerabrechnung. Hier gleicht der Agent Tachografendaten, Spesenbelege und Tourenberichte ab und markiert Abweichungen, bevor die Lohnbuchhaltung abrechnet.

Beide Agenten laufen durch dieselben fünf Fragen.

1. Was steht in den Daten?

In einer Auftragsmail stehen Firmennamen, Ladeadressen, Palettenzahl, Gewicht und meist der Name eines Ansprechpartners. Das sind Geschäftsdaten mit wenig Personenbezug. Eine Modellschnittstelle auf europäischer Infrastruktur mit Vertrag zur Auftragsverarbeitung ist dafür die naheliegende Wahl.

In der Fahrerabrechnung stehen Lenk- und Ruhezeiten, Spesen und Abwesenheiten einzelner Mitarbeiter. Ob solche Daten das Haus verlassen, legen Sie mit Ihrem Datenschutzbeauftragten fest und, wenn es einen gibt, mit dem Betriebsrat. Lautet die Antwort "nur bei uns", läuft dieser Agent self-hosted. Das klären wir vorher gemeinsam im Automations-Check, es verlängert den Bau nicht.

2. Wann kommt die Arbeit?

In einem reinen Preisvergleich fehlt diese Frage, im Alltag merkt man sie zuerst. Transportaufträge kommen nicht gleichmäßig. Nehmen wir an, montags zwischen sieben und neun Uhr treffen 150 Mails ein und über den restlichen Tag noch einmal 100.

Über eine Modellschnittstelle werden die 150 Mails parallel verarbeitet, nach wenigen Minuten liegen alle Entwürfe in der Disposition. Eine eigene Maschine schafft so viel, wie sie beim Kauf an Leistung mitbekommen hat. Braucht sie 20 Sekunden je Mail und bearbeitet vier gleichzeitig, wartet die letzte Mail der Montagsspitze gut zwölf Minuten. Für die Auftragsannahme ist das verkraftbar. Soll auch der letzte Auftrag nach zwei Minuten bereitliegen, brauchen Sie rund sechsmal so viel Leistung, und die steht den Rest der Woche fast still.

Die Fahrerabrechnung läuft dagegen nachts vor dem Abrechnungslauf, und auf sie wartet niemand. Eine kleine Maschine braucht dafür etwas länger, das stört keinen.

3. Wie viel kommt insgesamt zusammen?

Die Schnittstelle kostet je Aufruf, der Server kostet fest. Unterhalb einer bestimmten Menge am Tag ist deshalb die Schnittstelle günstiger, darüber die feste Maschine. Wo dieser Punkt liegt, haben wir an einem Beispiel mit Zahlen durchgerechnet, in unserem Artikel über Klinik-Prozesse und die drei Rechenorte. Mit den dortigen Annahmen tragen 250 Auftragsmails am Tag allein keinen eigenen Server.

Läuft die Fahrerabrechnung aber ohnehin auf einer eigenen Maschine, kann die Auftragserfassung sie mitbenutzen, sofern die Leistung für den Montagmorgen reicht. Darum rechnen wir die Frage für alle Abläufe eines Betriebs zusammen und nicht für jeden einzeln.

4. Wer kümmert sich um die Maschine?

Bei der Schnittstelle niemand aus Ihrem Haus. Beim gemieteten Server kümmert sich das Rechenzentrum um die Hardware. Bei eigener Hardware liegt alles bei Ihnen: das defekte Netzteil, das fällige Treiberupdate, der Serverraum, der im Juli zu warm wird.

Den Betrieb überwacht auf allen drei Wegen der Wartungsagent, der zu jeder unserer Automatisierungen gehört. Er prüft Ein- und Ausgang der Schnittstellen auf Änderungen und schickt, was er nicht selbst lösen kann, als Ticket an Ihre IT. Wer keine eigene IT hat, die ein Ticket am selben Tag bearbeitet, fährt mit Schnittstelle oder gemietetem Server besser.

5. Wer bestimmt, wann das Modell wechselt?

Modellanbieter entwickeln ihre Modelle weiter und stellen ältere Versionen irgendwann ein. Über die Schnittstelle bekommen Sie Verbesserungen, ohne etwas dafür zu tun, aber auch Änderungen, die Sie nicht bestellt haben. Self-hosted läuft das Modell, das installiert wurde, bis Sie es austauschen. In beiden Fällen testet der Wartungsagent ein neues Modell gegen alte Fälle und begleitet den Wechsel.

Dazu kommt die Auswahl. Nicht jedes Modell lässt sich auf eigene Hardware holen, einige der leistungsfähigsten gibt es nur über die Schnittstelle ihres Anbieters. Ob ein Modell für Ihren Ablauf reicht, zeigt der Test mit echten Fällen.

Was für die Beispiel-Spedition herauskommt

Die Antwort fällt geteilt aus. Die Auftragserfassung läuft über eine Modellschnittstelle auf europäischer Infrastruktur, weil die Daten wenig Personenbezug haben, weil der Montagmorgen Spitzen bringt und weil keine Fixkosten anfallen. Die Fahrerabrechnung läuft auf einem gemieteten Server oder im eigenen Haus, weil der Betrieb Mitarbeiterdaten bei sich behalten will und ein nächtlicher Lauf mit wenig Leistung auskommt.

Ein späterer Umzug ist kein Neubau. Wächst die Zahl der Auftragsmails so weit, dass sich eine feste Maschine trägt, zieht das Modell um. Regeln, Zuordnungen und Klärliste bleiben, wie sie sind.

Sophera Consulting baut Agenten für alle drei Wege, für jeden Betrieb einzeln, zum Festpreis und ohne Abo. Ein Agent ist in ein bis zwei Tagen aufgebaut, der Test mit echten Fällen läuft in derselben Woche. Auf Wunsch laufen die Modelle lokal auf Ihrer Hardware, dann verlassen die Daten das Haus nicht. Laufend zahlen Sie die Nutzung der Modelle oder die Maschine, auf der sie rechnen, eine Betriebspauschale kommt nicht dazu. Welcher Rechenort zu welchem Ihrer Abläufe passt, klären wir im kostenlosen Automations-Check.

Unsere Empfehlung

Fangen Sie mit der Schnittstelle an, wenn ein Ablauf Geschäftsdaten verarbeitet und niemand im Haus einen Server betreuen soll. Planen Sie self-hosted ein, wenn in den Daten etwas steht, das Ihr Haus nicht verlassen soll, oder wenn so viel Arbeit gleichmäßig über den Tag kommt, dass eine feste Maschine ausgelastet ist. Und entscheiden Sie je Ablauf. Wer alles in die Cloud gibt oder alles im eigenen Serverraum betreibt, trifft für einen Teil seiner Abläufe die schlechtere Wahl.

Dieser Artikel wurde mit Hilfe von KI erstellt.

#Self-Hosting#Cloud#KI-Agenten#Datenschutz#Spedition#Rechenort#Festpreis