Warum KI oft teurer wird als geplant, und was sich in wenigen Tagen ändern lässt
Ein Drittel der Unternehmen sagt: KI ist teurer als geplant. Fast jedes zweite sagt gleichzeitig: Prozesse sind schneller geworden. Beides stimmt, und beides lässt sich mit den richtigen Hebeln in Einklang bringen.
Laut aktueller Bitkom-Erhebung berichtet ein Drittel der Unternehmen, die KI aktiv einsetzen, von höheren Kosten als geplant, während fast jedes zweite gleichzeitig schnellere Prozesse meldet. Viele Unternehmen kalkulieren KI wie Software, bezahlen sie aber wie Strom: Statt eines planbaren Preises pro Nutzer und Monat entsteht eine Rechnung nach Verbrauch, die mit dem Erfolg des Projekts mitwächst. Die verbreitete Reaktion darauf, die Nutzung zu deckeln, ist betriebswirtschaftlich die schlechteste Option, denn damit wird auch der Nutzen gekappt. Unsere sieben Hebel setzen bei den eigentlichen Kostentreibern an, sortiert nach Wirkung pro Aufwand.
Hebel 1: das richtige Modell für die richtige Aufgabe
Zwischen dem kleinsten und dem größten KI-Modell eines Anbieters liegt je nach Generation ein Preisfaktor von 10 bis 30, und der überwiegende Teil dessen, was im Unternehmen tatsächlich passiert, braucht das teuerste Modell nicht. Eine einfache Faustregel hilft bei der Auswahl: Muss eine Aufgabe nur umgeformt werden, etwa eine E-Mail zusammengefasst, eine Support-Anfrage kategorisiert oder Daten aus einer Rechnung extrahiert, reicht meist ein kleines Modell völlig aus. Muss dagegen abgewogen, geschlussfolgert oder mehrstufig geplant werden, etwa bei einer Vertragsanalyse mit Risikobewertung oder einer echten Recherche, lohnt sich das große Modell, ohne schlechtes Gewissen. Es ist die Logik, die beim Personal schon lange angewandt wird: Niemand schickt den Seniorberater los, um eine Terminbestätigung zu überbringen.
Hebel 2 und 3: Lizenz-Hygiene und Ausgabengrenzen
Beide Hebel lassen sich ohne Entwicklerteam umsetzen. Lizenz-Hygiene bedeutet, regelmäßig zu prüfen, ob bezahlte Zugänge in den letzten 30 Tagen überhaupt genutzt wurden, sowohl pro Zugang als auch pro gebuchter Paketgröße, und ungenutzte Lizenzen konsequent zu kündigen. Ausgabengrenzen und Alarme sind bei den großen Anbietern inzwischen auf Projekt- oder Team-Ebene direkt konfigurierbar: ein Limit pro Projekt und eine Benachrichtigung bei etwa 70 Prozent des Kontingents verhindern, dass übers Wochenende unbemerkt Kosten auflaufen.
Hebel 4: Kontext zwischenspeichern
Wenn ein Assistent bei jeder Anfrage dieselben Kontextinformationen mitgeschickt bekommt, etwa eine Dokumentation zu einem Ablauf, wird dieser Text vielleicht tausende Male im Monat übertragen. Die großen Anbieter bieten dafür Zwischenspeicherung an: Der unveränderliche Teil wird gespeichert und beim nächsten Aufruf nur noch zu einem Bruchteil der Kosten verarbeitet. Praktisch heißt das: Alles, was selten wechselt, etwa eine Rollenbeschreibung, ein Regelwerk oder das gewünschte Ausgabeformat, gehört an den Anfang, in den sogenannten Systemprompt. Alles, was sich von Anfrage zu Anfrage ändert, etwa Kundendaten oder die aktuelle Frage, gehört ans Ende, in den Userprompt.
Hebel 5 und 6: nur Relevantes schicken, kürzer antworten lassen
Statt unzählige Seiten Text mitzuschicken, lohnt es sich, vorab nur die tatsächlich relevanten Informationen herauszusuchen, etwa über ein Suchverfahren. Das spart nicht nur Kosten. Die Antworten werden ebenfalls besser, weil das Modell weniger Ballast mitschleppen muss. Ähnlich beim Output: Ausgabetokens sind bei den meisten Anbietern deutlich teurer als Eingabetokens, oft um ein Vielfaches. Trotzdem lassen viele das Modell in langen Fließtexten antworten, obwohl die nachgeschaltete Software nur wenige Werte daraus zieht. Ein knappes, strukturiertes Ergebnis reicht in solchen Fällen, und ausführliche Denkmodi lassen sich dort abschalten, wo eine einfache Klassifikationsaufgabe keinen mehrseitigen Gedankengang braucht.
Hebel 7: Stapelverarbeitung für alles, was nicht eilt
Praktisch alle Anbieter bieten einen Batch-Modus für Aufgaben, die nicht sofort beantwortet werden müssen, meist zum halben Preis. Wöchentliche Support-Ticket-Auswertungen, Entwürfe für Social-Media- oder Blogbeiträge, das Verschlagworten interner Dokumente: Bei all diesen Aufgaben wartet niemand auf das sofortige Ergebnis. Der Batch-Modus läuft über dieselbe Schnittstelle wie normale Anfragen und liefert spätestens innerhalb von 24 Stunden, sobald beim Anbieter Kapazitäten frei sind.
Hebel null: Braucht es hier überhaupt KI?
Der günstigste Token ist aber immer noch der, der gar nicht erst verschickt wird. Lässt sich das Ergebnis einer wiederkehrenden Anfrage zwischenspeichern, statt dieselbe Frage hunderte Male zu stellen? Reicht anstelle der KI ein einfacher Algorithmus mit einem Bruchteil der Kosten? Oder genügt ein kleineres, gezielt trainiertes Modell? Viele scheuen den Wechsel auf ein günstigeres Modell aus einem nachvollziehbaren Grund: Sie können die Qualität nicht messen und bleiben sicherheitshalber beim teuersten. Der pragmatische Weg: 50 reale Vorgänge aus dem laufenden Betrieb nehmen, das jeweils richtige Ergebnis dazuschreiben, und dann jedes Modell gegen diese Testfälle laufen lassen. Löst das kleine Modell 47 von 50 Fällen richtig und das große 48 von 50, kostet das große aber das 10- bis 20-Fache, ist die Entscheidung schnell getroffen.
Wer diese Hebel kombiniert, muss intern nicht länger für Einsparungen werben, sondern kann für bessere Ergebnisse zu geringeren Kosten argumentieren. Der Zielkonflikt zwischen Kosten und Qualität löst sich damit größtenteils von selbst auf.
You are currently viewing a placeholder content from Default. To access the actual content, click the button below. Please note that doing so will share data with third-party providers.
More Information
Transcript
Anke:
Ein Drittel der deutschen Unternehmen, die KI aktiv einsetzen, sagt inzwischen, es ist teurer als geplant. Das ist die Zahl aus der aktuellen Bitkom Erhebung. Und sie ist deshalb bemerkenswert, finde ich, weil gleichzeitig fast jeder Zweite berichtet, dass Prozesse schneller geworden sind. Also funktioniert das und kostet aber mehr als gedacht. Andreas, wie geht das zusammen?
Andreas:
weil wahrscheinlich viele Unternehmen KI kalkulieren wie Software und bezahlen wie Strom. Also Software hat üblicherweise einen Preis pro Nutzer pro Monat. Es ist planbar. Aber sobald ihr eigene Anwendungen baut, zahlt ihr pro Verbrauch. Und der Verbrauch skaliert mit dem Erfolg. Das heißt, je besser euer KI-Projekt läuft, desto höher die Rechnung.
Anke:
Das interessante ist, die meisten reagieren darauf mit Deckelung, benutzen es halt weniger. Betriebswirtschaftlich klingt das wie die schlechteste Option, weil sie den Nutzen ja irgendwie mit abschaltet, oder?
Andreas:
Ja genau, deshalb machen wir heute etwas anderes. Ich habe uns 7 Hebel mitgebracht, sortiert nach Wirkungen pro Aufwand. Die ersten 3 kann jemand ohne Entwicklerteam umsetzen, die anderen 4 brauchen jemand, programmiert. Aber keine Wochen, sondern alles realisierbar in wenigen Tagen.
Anke:
Fangen wir also bei denen an, die der Geschäftsführer selber anstoßen kann. Hebel eins.
Andreas:
Ja, Hebel 1 ist das richtige Model für die richtige Aufgabe auszuwählen. Das ist der größte Einzelhebel überhaupt und er wird am häufigsten übersehen. Zwischen dem kleinsten und dem größten KI-Model eines Anbieters liegt, je nach Generation, je nach Hersteller ein Preisfaktor von 10 bis 30.
Und der überwiegende Teil dessen, was im Unternehmen tatsächlich passiert, braucht das teuerste Model überhaupt nicht.
Anke:
Gib uns mal eine Art Trennlinie. Woran erkenne ich als Nicht-Technikerin, welche Aufgabe welches Model braucht?
Andreas:
ich würde sagen, es gibt eine ganz einfache Faustregel. Heißt die Aufgabe umformen oder entscheiden? Umformen heißt, die Information ist schon da. Sie muss nur anders aussehen. Zum Beispiel eine E-Mail zusammenfassen, eine Support-Anfrage in verschiedene Kategorien einsortieren. Aus einer Rechnung
Datum, Betrag, Lieferant, herausziehen. All das kann auch ein kleines KI-Model oft völlig ausreichend lösen. Ja, also das war umverpacken. Entscheiden heißt, es muss abgewogen werden. Es muss geschlussfolgert werden. Es muss vielleicht auch mehrstufig geplant werden. Zum Beispiel angenommen wir machen eine Vertragsanalyse mit einer Risikobewertung, machen eine Fehlersuche im Programmcode, wir machen eine echte tiefgreifende Recherche oder wir nutzen auch KI als eine beratende Instanz als Sparingpartner. Da empfiehlt es sich für gewöhnlich das große KI-Model zu verwenden und zwar auch ohne schlechtes Gewissen einfach deshalb, weil ihr es euch dann auch leisten könnt.
Anke:
Das klingt für mich nach derselben Logik wie beim Personal. Du lässt ja auch nicht den Seniorberater die Terminbestätigung rausschicken.
Andreas:
Genau, nur ist es eben bequem im KI-Umfeld das teuerste Model zu nehmen. Auch weil vielleicht das Model vom Anbieter am lautesten beworben wird.
Anke:
Den zweiten Hebel hast du mir im Vorgespräch ja schon erklärt. Es geht da Lizenz Hygiene.
Also wurden die bezahlten Zugänge in den letzten 30 Tagen überhaupt benutzt, weil es ja in jedem Unternehmen eine Quote ungenutzter Lizenzen gibt. Jemand war davon mal begeistert und dann sind sie im Tagesgeschäft einfach verschwunden.
Andreas:
Genau. Die Frage ist immer dieselbe. Wird das, wofür wir zahlen, tatsächlich genutzt? Und zwar auf zwei Ebenen. Einmal auf einer Pro-Zugangsebene und auf einer Pro-Paketgröße-Ebene.
Anke:
Und da gilt es dann zu sortieren und gegebenenfalls zu kündigen. Was ist der dritte Hebel, Andreas?
Andreas:
Genau, beim dritten Hebel geht es Ausgabengrenzen und zu definierende Alarme. Die großen Anbieter haben alle inzwischen die Möglichkeit, BG-Obergrenzen auf einer Projekt- auch auf einer Team-Ebene breitgestellt. Anthropic zum Beispiel hat das auch direkt in der Unternehmensversion vorgesehen. ja, setzt ein Limit pro Projekt.
und eine Benachrichtigung bei vielleicht 70 % des Kontingents. Das ist dann eine Konfiguration und kein langwieriges Projekt, was man hierfür umsetzen müsste.
Anke:
Das verhindert dann auch, dass übers Wochenende aus Versehen irgendwas durchläuft und man montags bei der Rechnung Stress kriegt. Das hat wahrscheinlich jeder schon mal erlebt.
Andreas:
Genau.
Anke:
Jetzt die vier Hebel, für die man jemanden braucht, der programmiert. Aber du sagst Tage, keine Wochen.
Andreas:
Richtig. Wenn wir uns Hebel 4 anschauen, der lautet “Kontext Zwischenspeichern”. Und das ist ein großer noch wichtiger Hebel.
Andreas:
Typische Situation, ihr habt einen Assistenten, der eine Dokumentation zu einem Handlungsablauf kennen soll, dann entsprechend eine gute Antwort zu liefern. Also schickt ihr bei jeder einzelnen Anfrage, bei jedem Prompt, dieselben Kontextinformationen mit. Das sind häufig viele, viele Seitentext. Wenn ihr diese Anfrage nun mehrfach am Tag stellt, kann diese Information tausende Male im Monat übermittelt werden.
Die großen Anbieter bieten inzwischen eine Zwischenspeicherung an. Das heißt, das System merkt sich den unveränderten Teil, also der Teil, wiederkehrend ist, und ihr zahlt dann dafür nur noch einen Bruchteil der Kosten.
Anke:
Kannst du das für mich als Anwenderin nochmal konkret übersetzen bitte?
Also der Hebel heißt letztendlich Wiederverwendung. Alles was sich in einem Prompt, Antikai, selten ändert, zum Beispiel eine Rollenbeschreibung, ein Regelwerk, Sicherheitsvergaben, das Format in dem du die Ausgabe haben möchtest und so weiter, das gehört, weil es stabil ist und in jedem Prompt wiederkehrend ist, an den Anfang, also in den sogenannten Systemprompt.
Genau diese wiederkehrenden Teile kann nämlich das System zwischenspeichern, caching und verarbeitet sie beim nächsten Aufruf dann entsprechend günstiger. Die eigentliche Aufgabe, also der Teil der je Anfrage variabel ist, jetzt sagen wir ja Kundendaten, einzelne Dokumente, die aktuelle Frage, ja all dies gehört in den Userprompt am Ende des eigentlichen Prompts. weil sich eben dieser von Anfrage zu Anfrage ändert.
Andreas:
Das heißt, wenn man es jetzt kurz herunter bricht, die eigentliche Faustregel lautet dann alles Statische an Regeln an den Anfang setzen, alles was dynamisch ist, alles was variabel ist, nach hinten an das Ende setzen.
Anke:
Das heißt, bei jeder Anfrage seine Promptstruktur umbaut, verschenkt Geld und wer einen Teil davon beibehält, spart. Macht Sinn.
Genau.
Anke:
Hebel Nummer 5.
Andreas:
Hebel 5 knüpft eigentlich nahtlos an den vorherigen an und zwar geht es darum nur das zu schicken was auch wirklich gebraucht wird. Also besser als diese unzähligen Seiten Tax billig zu schicken ist es natürlich nur die Informationen die relevant sind an die KI zu schicken und zu ermitteln. Da gibt es verschiedene Ansätze. Es gibt zum Beispiel Suchverfahren eben die entsprechenden relevanten Stellen vorab heraus zu suchen. Und das spart dann nicht nur Geld, die Antworten werden dann auch besser, weil das Model weniger ballast, weniger unscherfe Mitschlemmen
Anke:
Den Punkt kann man, finde ich, unterstreichen, weil dann der Zielkonflikt zwischen den Kosten und der Qualität weg ist. Mehrere Hebel verbessern, also wenn ich dich richtig verstehe, beides gleichzeitig. Und dann kann ich es natürlich intern auch viel besser verkaufen. Ich muss nicht mehr sagen, ihr sollt sparen, sondern ich kann sagen, wir brauchen bessere Ergebnisse.
Andreas:
Gut, schauen wir uns den nächsten Hebel an. Kürzere Ausgaben. Und zwar geht es Folgendes. Eine KI teilt sich auf in Input und Output. Und dieser Input definiert sich durch Tokens. Ein Wort besteht aus mehreren Tokens und dabei fällt es sich so, dass diese Ausgabentokens, also das was zu einer KI zurückkommt, bei den meisten Anbietern deutlich teurer ist als die Eingabetokums, also das, was wir an das System, an die KI übergeben. Und dieser Unterschied ist oftmals ein Vielfaches. Dennoch lassen wir oft bei der Interaktion mit KI das Model in schönen langen Verlies-Texten antworten, obwohl die Software, die vielleicht danach geschaltet ist, nur drei, vier Werte daraus zieht. Deshalb gerne auch hier immer überprüfen, ist denn der Output
das was wir von dem Model verlangen, wirklich passend zu dem wie wir es benötigen. Ansonsten könnte man auch sagen Antworten in einem knappen, strukturierten Ergebnis und eben gerade nicht in einem langen Aufsatz. Und darauf noch aufbauend schaltet auch gerne die ausführlichen Denkmodi ab, dort wo sie nichts bringen. Also bei einer einfachen Klassifikationsaufgabe braucht niemand einen dreiseitigen Gedankenvorgang.
Anke:
Macht total Sinn. bin gespannt auf den siebten Hebel.
Andreas:
Hebel Nummer 7 darauf, dass das was nicht eilt, das was nicht dringend ist, also all die Abläufe die auch nicht synchron stattfinden, dass man die nachts laufen lässt zu einem vergünstigten Preis. Was heißt das konkret? Also praktisch alle Anbieter haben einen Batch-Modus, einen Stapelverarbeitungsmodus für Aufgaben, für all diejenigen die Aufgaben, nicht sofort beantwortet werden müssen. das ist typischerweise dann auch in etwa nur halb so teuer. Und dieser Stapelverarbeitungsmodus, der passt auch auf erstaunlich viele Unternehmensaufgaben. Sei es alle Supporttickets der Woche auszuwerten, sei es zahlreiche Entwürfe von Beiträge für Social Media für den Blog zu erzeugen oder sei es irgendwelche internen Dokumente zu analysieren zu verschlagworten.
Bei diesen Vorgängen steht niemand daneben und wartet auf das Endergebnis. Wenn ihr also solche Aufgaben synchron laufen lässt, dann verschenkt ihr viel Geld.
dieser Badge-Modus, der etwa die Hälfte kostet, der läuft über die gleiche Schnittstelle wie auch die normalen KI-Abfragen und verhält sich identisch. Allerdings wird diese Aufgabe nur dann verarbeitet, wenn beim Anbieter quasi Kapazitäten frei sind. Allerdings spätestens innerhalb von 24 Stunden. Und all das macht es eben für Unternehmen sehr attraktiv,
Zeit unkritische Tätigkeiten durchzuführen, weil man damit eben circa die Hälfte der Kosten sparen kann.
Anke:
macht total Sinn. Ich würde sogar gerne noch einen Nultenhebel hinterher schieben, Nullterwelle, nicht technisch ist, aber vielleicht total unterschätzt, nämlich prüft, ob ihr für die Aufgabe, die es gerade geht, überhaupt KI braucht.
Andreas :
Ja guter Punkt, den hätte ich auch jetzt fast vergessen. Man könnte fast sagen, der günstigste Token ist ja nicht der Token, den man überhaupt nicht verschickt. Da lässt sich anknüpfend sagen, braucht es diese Abfrage, braucht es diesen Prompt wirklich. Es gibt verschiedene Lösungsansätze allgemein, eine Anfrage auch grundsätzlich vielleicht obsolet zu machen.
Andreas:
Beispielsweise kann ich mich fragen, kann ich das Ergebnis der KI zwischen speichern, statt dieselbe Frage, denselben Prompt hunderte mal an die KI zu stellen? Oder kann ich anstelle der KI auch einen einfachen Algorithmus einsetzen, der einen Bruchteil oder fast gar keine Kosten verursacht? Oder kann ich es vielleicht auch mit einem kleineren KI-Model lösen, meine Aufgabe? Ein KI-Model, was kleiner ist, weniger Ressourcen benötigt, aber ganz exakt auf meine Problemstellung trainiert
Anke:
Andreas, wenn das alles so einfach ist, wie es jetzt klingt. Warum macht es nicht jeder?
Andreas:
Ja, das mag zum Teil daran liegen, dass sich viele nicht trauen, auf ein günstigeres Model zu wechseln. Und das auch aus einem nachvollziehbaren Grund. Also viele können nicht messen, ob die Qualität vielleicht schlechter wird mit Einsatz eines kleineren, eines günstigeren Modells. Also bleiben sie sicherheitshalber am teuersten. Im Endeffekt ist also hier Angst, der eigentliche Kostentreiber.
Anke:
Was ist die Lösung?
Andreas:
Ja, tatsächlich im Endeffekt testen und die Daten erheben, die es braucht, eine Vergleichbarkeit herzustellen. Wie könnte man es ganz pragmatisch umsetzen? Sagen wir, ihr nehmt aus dem laufenden Betrieb 50 reale Vorgänge. Echte Kundenanfragen, echte Rechnungen, echte Angebotstexte. Und schreibt dann dazu, was das richtige Ergebnis gewesen wäre.
Andreas:
In Summe ist das vielleicht ein Nachmittag oder einen Tag Arbeit. Aber dann könnt ihr jede Änderung durchlaufen lassen und seht in Minuten kleines Model 47 von 50, Testfälle richtig, großes Model 48 von 50 fällen richtig. Aber das große kostet dann eventuell auch das 10 bis 20-Fache. Und mit dieser einfachen Vergleichbarkeit trifft sich dann auch eine Entscheidung von ganz alleine.
Anke:
Vielen Dank. Ich fasse kurz zusammen sieben Hebeln. Passende Modell je Aufgabe ist der erste. Der zweite Lizenzhygiene. Drittens Ausgaben Grenzen setzen. Viertens Kontext zwischenspeichern, wo er sich wiederholt. Fünftens nur Relevantes an die KI schicken. Sechstens kürzere Ausgaben.
Siebtens Stapelverarbeitung für alles, was nicht alt plus. Die Vorfrage braucht es KI in diesem Fall wirklich.
Anke:
Das war KI fürs Business in zehn Minuten. Vielen Dank, dass ihr dabei wart. Wenn es euch gefallen hat, lasst uns ein Like da oder empfehlt uns weiter. Wir hören uns nächste Woche.



One comment
Pingback: KI selbst betreiben, einkaufen und Fine-Tuning. Wann lohnt es sich? – GATE5 GmbH
Comments are closed.