Früher war Software nach der Entwicklung im Betrieb praktisch kostenlos. Ein paar Server, etwas Strom, fertig. Heute lässt sich der Energieverbrauch einer Anwendung in Tokens abrechnen. Für Dimitri Blatner, Experte für Software- und Enterprise-Architektur bei ITech Progress, ist das ein echter Umbruch, und einer, den viele Teams unterschätzen.
Dabei ist Blatner kein KI-Skeptiker. Bei allem, was mit Sprache zu tun hat, also Übersetzen, Formulieren oder das Erstellen von Vorlagen, sind Sprachmodelle schnell und hilfreich. Das gilt in der Softwareentwicklung genauso wie in der Architekturdokumentation. Allerdings verbringt man viel Zeit damit, die Ergebnisse zu prüfen und nachzubessern. Man merke deutlich, so Blatner, ob Modell-Output ungefiltert irgendwo abgelegt oder tatsächlich überarbeitet wurde.
Das eigentliche Kostenproblem liege woanders. Wir lassen Modelle zunehmend autonom arbeiten und vertrauen ihnen viel, teils aus Bequemlichkeit, teils aus psychologischen Gründen. Und wir greifen dabei gern zu den großen, teuren Modellen. Solange das ein Einzelner ab und zu tut, ist das verkraftbar. Wird KI aber Teil der Unternehmensprozesse oder gar des Endprodukts, landen einfache, systematische Aufgaben plötzlich bei einer kostspieligen, nicht deterministischen Inferenz.
KI skaliert mit der Architektur
Genau hier setzt Cost-aware Architecture an. Die Grundfrage lautet: Für welche Aufgabe brauche ich überhaupt ein KI-System? Und wo genügt es, mir von der KI helfen zu lassen, ein Skript oder einen festen Prozess zu bauen, der danach ohne Modell läuft? Viele Abläufe lassen sich statisch implementieren und bei Bedarf anpassen. Einer KI dauernd über die Schulter schauen zu müssen, ist dann schlicht überflüssig.
Kommt KI zum Einsatz, lohnt sich eine zweite Unterscheidung. Komplexe Aufgaben mit Tiefenanalyse oder planerischem Anteil rechtfertigen ein großes Modell. Für Systematisches reichen kleinere, effizientere Varianten. Im Einzelfall wirkt der Unterschied marginal. Bei 100 oder 1.000 Mitarbeitern oder bei KI-Bausteinen im Produkt reden wir aber schnell über Hunderttausende Anfragen pro Stunde. Blatners Kernsatz dazu: Ein KI-basiertes System skaliert nicht linear, sondern mit seiner Architektur. Wer die Architektur nicht bewusst gestaltet, riskiert unkontrolliert wachsende Betriebskosten.
Inference Pipelines: klingt komplex, ist es nicht
Das Werkzeug dafür nennt Blatner Inference Pipeline. Gemeint ist das klassische Pipes-and-Filters-Prinzip, bei dem ein Sprachmodell ein Glied der Prozesskette ist. Statt ein Modell für alles einzusetzen, wählst Du pro Schritt das passende aus. Das muss nicht kompliziert sein, es muss nur einmal durchdacht werden.
Sein erstes Beispiel ist eine Dokumentverarbeitung, auf die ein Fachverfahren mit menschlicher Beteiligung folgt. Ein großes multimodales Modell erledigt alles in einem Rutsch. Automatisiert im Prozess verankert, wird das in der Skalierung aber sehr teuer. Die Alternative: ein spezialisiertes, effizientes Verarbeitungsmodell für die Dokumente und kleinere Sprachmodelle für die systematischen Folgeschritte. Dann, sagt Blatner, sprechen wir von ganz anderen Kosten.
Der größte Hebel sitzt nicht im Code
Zum Schluss erinnert Blatner an den Eliza-Effekt: Wir vertrauen technischen Systemen schnell, sobald sie menschlich wirken. Für ein Sprachmodell gibt es aber kein Richtig oder Falsch, nur Wahrscheinlichkeiten für das nächste Wort. Eine solche unsichere Inferenzmaschine für einfache Aufgaben einzusetzen, sei der größte Kostentreiber. Für diese Aufgaben hat die Softwareentwicklung längst bessere Werkzeuge: Automatisierung, CI/CD-Pipelines, Workflow-Engines.
Den wirksamsten Hebel sieht Blatner deshalb in der Schulung. Wer KI einführt, sollte Mitarbeiter und Management darin fit machen, die Grenzen der Technologie zu kennen, und KI zuerst dort einsetzen, wo sie den größten Nutzen bringt. Alles andere lieber in Ruhe evaluieren oder sich Know-how ins Haus holen. LLMs seien noch eine frühe Technologie. Jedem Hype hinterherzulaufen und dieselben teuren Erfahrungen zu machen wie alle anderen, kostet am Ende deutlich mehr Zeit und Geld.