Die KI-Rechnung und der Router, der sie kleiner macht

Die Pilotphase ist vorbei. Und jetzt kommt die Rechnung.

Immer mehr Unternehmen stoßen auf dasselbe: Aus den KI-Pilotprojekten sind endlich echte Rollouts geworden, mit echter Wirkung aufs Geschäft. Das ist logisch, denn inzwischen ist klar, dass KI wirklich Wert schaffen kann, und zwar in weit größerem Maßstab als frühere Automatisierungswellen.

Und genau deshalb wird jetzt sichtbar, was die ganze Zeit schon da war, aber zu klein, um aufzufallen: Skalierte KI kann ziemlich teuer werden. Das Handelsblatt hat diese Woche darüber geschrieben.

Vor allem bei agentischer KI geht es schnell. Eine einzige Frage eines Nutzers löst im Hintergrund Dutzende bis Hunderte Modellaufrufe aus. Ein Agent, der eine Stunde lang selbstständig arbeitet, lässt den Zähler kräftig laufen.

Zum Glück geht die Entwicklung in der KI-Welt rasend schnell, und das derzeit heißeste Thema ist zugleich die Lösung für dieses Problem. Nicht jeder Aufruf braucht das teuerste Modell. Innerhalb einer einzigen Modellfamilie liegt schnell ein Faktor 18 bis 100 Preisunterschied zwischen dem kleinsten und dem größten Modell. Und das meiste, was ein Agent tut, ist Routinearbeit: zusammenfassen, formatieren, ein Tool aufrufen. Dafür braucht man kein Frontier-Modell.

Auftritt: der Model Router.

Ein Model Router ist ein kleines KI-Modell, das wie ein Verkehrsposten arbeitet und pro Aufruf entscheidet, welches Modell gut genug ist. Einfache Aufgabe? Kleines, günstiges Modell. Schwierige Analyse? Das große Geschütz. ChatGPT macht das intern schon seit GPT-5, Microsoft hat inzwischen ein eigenes Produkt dafür, und mit Open-Source-Werkzeugen wie LiteLLM bauen Sie sich so eine Schicht zwischen Anwendung und Modellen selbst.

Anbieter behaupten Einsparungen von 40 bis 70 %.

Einschränkungen (ja, die auch):

  • Diese Prozentzahlen kommen von den Verkäufern der Router. Nehmen Sie eine kräftige Prise Salz dazu.
  • Der Router ist selbst ein Modell und kann sich also auch verschätzen. Ohne Qualitätsmessung wissen Sie nicht, was Ihre Ersparnis Sie kostet.
  • Günstigere Tokens entbinden Sie nicht von der Frage: Was bringt uns dieser KI-Workflow eigentlich ein? Kosten drücken, ohne den Ertrag zu kennen, ist Buchhaltung mit nur einer Spalte.

Genau das ist aus unserer Sicht bei BrA1n das eigentliche Signal. Unternehmen, die das systematisch angehen, Kosten und Wert pro Workflow, sind die Unternehmen, in denen KI erwachsen wird. Dafür haben wir den BrA1nScan entwickelt.

Weiß Ihre Organisation, was ihre KI-Workflows kosten? Und was sie einbringen?

Dieser Beitrag erschien zuerst auf LinkedIn.

Mehr Einblicke