Neural Step

← Alle Einblicke

· von Sven Duve

Brauchen Sie wirklich ein Frontier Model für agentische Routinearbeit?

Die häufigsten Arbeitschritte eines KI-Agenten sind reine Routine. Dafür bei jedem Schritt auf top Sprachmodelle zurückzugreifen zahlt sich nicht aus — so wählen sie das passende Modell entsprechend dem Schwierigkeitsgrad der Aufgabe und beurteilen die tatsächlichen Kosten.

Das Wichtigste in Kürze: KI-Agenten rufen Sprachmodelle nicht nur einmal auf, sondern oft mehrfach für diverse Aufgaben — die meisten dieser Aufrufe sind Routine. Routinearbeit erfordert so gut wie nie das leistungsstärkste Modell am Markt. Die Zuverlässigkeit eines Agenten leidet in der Regel nicht wenn man einfachere Modelle nutzt, insbesondere für wiederkehrende Aufgaben die tausendfach am Tag erledigt werden müssen. Bauen Sie Ihren Agenten so, dass kleinere Modell die Masse der Aufgaben übernimmt und behalten sie anspruchsvolle Tasks den frontier Modellen vor — dann sinken Ihre laufenden Kosten spürbar. Achten Sie weniger auf den Preis pro Aufruf, sondern subsumieren sie Tokenkosten pro Aufgabe.

Wie die Preise zustande kommen

Der Preis für einen agentischen Aufruf errechnet sich natürlich nicht nur durch die Anzahl der Tokens die sichtbar gesendet und empfangen werden, dies wären oft nur Centbeträge. Das wirkt harmlos.

Ein Agent hat im Hintergrund jedoch viel zu tun — und das macht den Unterschied. Nehmen Sie eine eingehende Kunden-E-Mail. Bevor der Kunde eine Antwort erhält, liest der Agent die Nachricht, ordnet sie ein, zieht die Auftragsnummer heraus, sucht den Kunden im System, prüft den Lagerbestand, formuliert eine Antwort, bringt sie ins richtige Format und kontrolliert das Ergebnis. Das sind schnell zehn Modellaufrufe für eine einzige E-Mail. Kommen noch Prüfungen auf Halluzinationen hinzu, wächst der Ablauf weiter. Multiplizieren Sie das mit jeder E-Mail, jedem Tag, jedem Arbeitstag im Jahr — und aus den harmlosen paar Cent wird eine signifakante Position in Ihrem KI-Budget.

Die Frage lautet also nicht: „Was kostet das Modell?“ Sondern: „Was kostet das Modell bei dem Volumen, das ich für den gesamten Prozess tatsächlich benötige?“

Wofür benötigt ein üblicher Agent nun die Tokens?

Schauen Sie sich die Schritte oben noch einmal an. Für sich genommen ist keiner davon besonders anspruchsvoll:

  • Einordnen — ist das eine Bestellung, eine Reklamation oder eine Lieferanfrage?
  • Herausziehen — Auftragsnummer, Datum, Artikel finden.
  • Weiterleiten — an das richtige System oder die richtige Person.
  • Formatieren — das Ergebnis in die Struktur bringen, die Ihr ERP-System erwartet.
  • Werkzeug aufrufen — eine Datenbank abfragen, ein Dokument abrufen.

Das sind überschaubare, wiederkehrende Aufgaben mit eindeutigen Antworten. Entscheidend für den Erfolg solcher Agenten ist hier Verlässlichkeit: dieselbe Eingabe ruft identisches Verhalten hervor. Spitzenintelligenz — die Fähigkeit, ein offenes, unbekanntes Problem zu durchdenken — wird im Ablauf des Agenten nur an wenigen Stellen gebraucht, wenn überhaupt.

Für jeden dieser Schritte Spitzenpreise zu zahlen, ist, als ließen Sie Ihren erfahrensten Ingenieur die Eingangspost sortieren.

Weniger Parameter, gleiche Verlässlichkeit?

Ein kleines Sprachmodell hat deutlich weniger interne Parameter als die Spitzenmodelle — typischerweise einige Milliarden statt Hunderte Milliarden. In der Praxis bedeutet das dreierlei:

  1. Es läuft auf bescheidener Hardware. Ein einzelner Server, manchmal eine sehr gute Workstation — kein Rechenzentrum.
  2. Es ist schnell und günstig im Betrieb. Weniger Rechenaufwand pro Antwort heißt kürzere Antwortzeiten und weniger Kosten.
  3. Es ist am stärksten bei einer eng umrissenen Aufgabe. Für eine Aufgabe trainiert oder angepasst, kann es dort mit deutlich größeren Modellen mithalten. Bei allgemeineren Tasks jedoch weniger.

Spezialist statt Generalist.

Wie viel günstiger — und wie gut?

Forscher von NVIDIA haben es im vergangenen Jahr in einem Positionspapier deutlich formuliert: Ein Modell mit 7 Milliarden Parametern zu betreiben, ist 10- bis 30-mal günstiger — bei Antwortzeit, Energieverbrauch und Rechenaufwand — als ein Modell mit 70 bis 175 Milliarden Parametern (Belcák et al., 2025). Dasselbe Papier untersucht drei quelloffene Agentensysteme und schätzt, dass rund 40 bis 70 % ihrer Modellaufrufe von deutlich kleineren Modellen übernommen werden könnten.

Gilt das Ende 2026 noch? Die Modelle haben sich verändert, ganz klar — die Logik aber nicht. Ein Modell, das pro Wort weniger Rechenaufwand braucht, arbeitet deutlich wirtschaftlicher. Viele der heutigen großen Modelle aktivieren pro Wort nur einen Teil ihrer selbst; das verkleinert den Abstand etwas. Die aktuellen Preislisten (siehe unten) zeigen aber das Offensichtliche: Er beträgt noch immer mindestens den Faktor zehn. Auch die Praxis spiegelt das wider: Laut dem Sommerbericht 2026 von Hugging Face entfielen nur 3 % der diesjährigen Downloads auf der Plattform auf Modelle mit mehr als 70 Milliarden Parametern (Hugging Face, August 2026). Die meiste KI, die tatsächlich im Betrieb läuft, ist klein und hoch spezialisiert auf ihre Aufgaben.

Bei eng umrissenen Aufgaben stimmt auch die Qualität. In einer im März 2026 überarbeiteten Studie erreichte ein Modell mit nur 350(!) Millionen Parametern, gezielt für den Aufruf von Werkzeugen trainiert, eine Erfolgsquote von 77,6 % im Benchmark ToolBench — weit vor den größeren Modellen, mit denen die Autoren es verglichen haben (Jhandi et al., überarb. 2026). Eine Einschränkung gehört dazu: Die Vergleichsmodelle stammen aus älteren Generationen, und die Autoren sagen selbst, dass ihr Modell auf genau diesen einen Benchmark optimiert war. Lesen Sie das Ergebnis also als Beleg für ein Prinzip, nicht als Rangliste gegen die heutige Spitze. Am Ende zählt hier aber das Prinzip: Ein kleines Modell, das für eine klar definierte Aufgabe trainiert wurde, kann diese Aufgabe sehr gut erledigen — und die einzelnen Nodes im Graphen eines Agenten sind ohnehin von vornherein klar definiert und eng umrissen.

Der Preisunterschied kann man sehr leicht den Preislisten der API Anbieter sehen. Zum Zeitpunkt dieses Beitrags listet ein großer Anbieter seine Spitzenmodelle mit 10 US-Dollar pro Million Eingabe-Token und 50 US-Dollar pro Million Ausgabe-Token, seine kleine Modellklasse mit 1 und 5 US-Dollar — der Faktor zehn innerhalb derselben Produktfamilie (Anthropic, Preisliste, September 2026). Quelloffene kleine Modelle, die Sie selbst betreiben oder bei einem europäischen Anbieter mieten, können noch günstiger sein.

Wie finde ich das passende Modell?

Es gibt drei Wege; sie bauen aufeinander auf und lassen sich ohne Weiteres kombinieren.

  1. Die kleine Modellklasse eines großen Anbieters nutzen. Der einfachste Einstieg: kein Training, keine eigene Hardware, eine Schnittstelle. Gut geeignet im normalen regulären Einsatz, aber sowohl im Prototyping.
  2. Einen fertigen Spezialisten auswählen. Hugging Face, die größte offene Plattform für KI-Modelle, zählt inzwischen knapp 3 Millionen davon (Hugging Face, August 2026). Viele sind bereits für spezielle Tasks trainiert — Dokumente einordnen, Felder auslesen, übersetzen, ähnliche Texte finden. Der Haken: Die Qualität schwankt stark, und die Lizenzen unterscheiden sich. Nicht jedes Modell darf kommerziell genutzt werden, und nicht jedes wird gepflegt. Die richtige Auswahl ist Expertenarbeit.
  3. Einem offenen Modell Ihre Aufgabe beibringen. Das nennt sich Fine-Tuning — eine Form des Transferlernens. Sie nehmen ein leistungsfähiges kleines Modell, das Sprache bereits versteht, und trainieren es mit Beispielen aus Ihrem eigenen Prozess weiter: Ihre Bestell-E-Mails, Ihre Produktbezeichnungen, Ihre Antwortformate. Moderne Verfahren wie LoRA (Hu et al., 2021) passen nur einen kleinen Teil des Modells an; das läuft deshalb oft auf einer einzigen Grafikkarte statt in einem Rechenzentrum. Die Trainingsdaten können im Haus bleiben — ein echter Vorteil mit Blick auf den Datenschutz. (Randbemerkung: Der Autor dieses Beitrags hat damit sehr gute Erfahrungen gemacht, etwa bei der Instanzsegmentierung und Objekterkennung in medizinischen Bildern; das Labelling der Bilder braucht allerdings Zeit und fachgebunden Arbeitseinsatz. Sprachmodelle weiter zu trainieren ist erheblich einfacher.)

Welcher Weg sich letztlich rechnet, hängt vom Volumen ab welches verarbeitet werden muss sowie der benötigten Stabilität. Fine-Tuning rechnet sich, wenn eine Aufgabe tausendfach am Tag anfällt und sich nicht ständig angepasst werden muss (Concept Drift). Bei einem Prozess, der noch Form annimmt, beginnen Sie mit Weg 1 und gehen die Liste weiter, sobald die Zahlen es rechtfertigen. Über den Erfolg von Weg 3 entscheidet weniger das Verfahren als die Ground Truth Daten: Ein Modell lernt eine Aufgabe in Abhängikeit mit der Qualität der Trainingsdaten .

Ein durchgerechnetes Beispiel

Im Folgenden ein Beispiel mit einem mittelständischen Großhändler. Die Zahlen sind beispielhaft, kein Kundenfall — die Rechnung allerdings ist nichtsdestotrotz nachvollziebar und leicht auf jede Unternehmensgröße skalierbar.

  • 2.000 eingehende Kunden-E-Mails pro Arbeitstag
  • etwa 10 API Aufrufe pro E-Mail
  • etwa 3.000 Token Eingabe und 300 Token Ausgabe pro Aufruf
  • 250 Arbeitstage im Jahr

Das sind 20.000 API Aufrufe am Tag, oder 60 Millionen Eingabe-Token und 6 Millionen Ausgabe-Token.

  • Jeder Schritt auf einem Spitzenmodell (10 $ / 50 $): 900 $ pro Tag, rund 225.000 $ pro Jahr
  • Jeder Schritt auf einem kleinen Modell (1 $ / 5 $): 90 $ pro Tag, rund 22.500 $ pro Jahr
  • Gemischt — 9 von 10 Schritten klein, 1 Schritt Spitzenmodell: 171 $ pro Tag, rund 43.000 $ pro Jahr

Der gemischte Aufbau kostet weniger als ein Fünftel verglichen mit der Hochpreisvariante. Zwischenspeicherung (Caching) und Rabatte für Stapelverarbeitung verschieben die absoluten Zahlen, aber nicht die Logik.

Wer hier aufhört zu lesen, könnte schließen: „Dann eben überall das kleine Modell.“ Das wäre jedoch voreilig und sogar ein Fehler.

Der wichtige Teil: Entscheidend sind die Kosten pro erledigter Aufgabe

Ein günstiges Modell, das Fehler macht, ist nicht günstig. Jeder Fehler muss von einem Menschen erkannt und korrigiert werden — und menschliche Arbeitszeit kostet weit mehr als jeder Modellaufruf.

Eine sinnvollere Kennzahl sind deshalb die Gesamtkosten pro erledigter Aufgabe: die Modellkosten plus die Kosten für die Korrektur etwaiger Fehler. Erweitern wir das Beispiel. Nehmen wir an, wiederum rein zur Veranschaulichung, dass die Korrektur eines fehlerhaften Ergebnisses eine Sachbearbeiterin zehn Minuten kostet, bei einem Vollkostensatz von 50 US-Dollar pro Stunde — rund 8,30 US-Dollar pro Fehler.

  • Nur Spitzenmodell: 0,45 $ Modellkosten, 1,5 % Fehler → rund 0,58 $ pro erledigter E-Mail
  • Nur kleines Modell: 0,045 $ Modellkosten, 8 % Fehler → rund 0,71 $ pro erledigter E-Mail
  • Gemischt: 0,086 $ Modellkosten, 2 % Fehler → rund 0,25 $ pro erledigter E-Mail

Unter diesen realistischeren Annahmen ist das günstigste Modell der teuerste Weg, die Arbeit zu erledigen — und die Mischvariante gewinnt deutlich. Natürlich sind die hier gezeigten Fehlerquoten nicht allgemein übertragbar. Entscheidend ist die Methode: Messen Sie, was die korrekte Erledigung der Aufgabe kostet — nicht, was ein einzelner Aufruf kostet.

Deshalb setzen gut gebaute Agenten auf eine heterogene Architektur:

  • Kleine Modelle für die Masse — einordnen, herausziehen, formatieren, Werkzeuge aufrufen.
  • Ein Spitzenmodell für echtes Reasoning — für den wirklich schwierigen Schritt: die mehrdeutige Reklamation, die ungewöhnliche Vertragsklausel, die Ermessensentscheidung.
  • Eine Weiche oder Prüfung dazwischen — sie entscheidet, welches Modell eine Anfrage braucht, oder gibt ab, wenn das kleine Modell unsicher ist.

In der Forschung ist dieser Ansatz gut belegt. Forscher der Stanford University zeigten bereits 2023, dass eine Kette aus günstigeren und teureren Modellen die Leistung des besten Einzelmodells erreichen kann — in ihren Tests bei bis zu 98 % geringeren Kosten (Chen, Zaharia & Zou, FrugalGPT). Eine Studie aus Berkeley von 2024 fand, dass ein konditionelles Routing zwischen einem starken und einem schwächeren Modell die Kosten in manchen Szenarien mehr als halbierte, ohne dass die Antwortqualität litt (Ong et al., RouteLLM).

Ein zweiter Vorteil zählt gerade in Deutschland: Kleine offene Modelle lassen sich auf eigener Hardware oder bei einem europäischen Anbieter betreiben. Das macht es leichter, sensible Daten dort zu halten, wo Ihre Datenschutzpflichten es verlangen.

Was bedeutet das für Sie?

Wenn Sie einen KI-Agenten prüfen — selbst gebaut oder zugekauft —, stellen Sie diese Fragen:

  1. Welches Modell übernimmt welchen Schritt? „Wir nehmen für alles das beste Modell“ ist keine Aussage über Qualität. Es ist eine Aussage über Kosten.
  2. Was kostet eine erledigte Aufgabe — einschließlich der Fehler, die korrigiert werden müssen?
  3. Können Sie diese Kosten sehen? Pro Prozess, pro Monat — nicht nur als eine Rechnung des Modellanbieters.
  4. Lässt sich das Modell austauschen? Preise und Modelle ändern sich alle paar Monate. Wer an ein Modell gebunden ist, ist an einen Preis gebunden.

Die Aufgabe eines guten Partners ist es, das Modell passend zur Aufgabe zu wählen — nicht standardmäßig das größte. Das größte Modell ist manchmal die richtige Antwort. Für jeden Schritt ist es das selten.

Wie wir NeSt Agents bauen

Genau so gestalten wir NeSt Agents standardmäßig. Wir beginnen mit einem konkreten Prozess und einem messbaren Ergebnis. Wir zerlegen jeden Schritt, weisen ihm das kleinste Modell zu, das ihn verlässlich erledigt, und halten ein Spitzenmodell für die Schritte bereit, die es wirklich brauchen. Wo das Volumen es rechtfertigt, wählen wir ein spezialisiertes offenes Modell aus oder trainieren eines mit Ihren eigenen Beispielen. Dann messen wir die Kosten pro erledigter Aufgabe — und justieren nach.

Das Ergebnis ist ein Agent, der sich in die Werkzeuge einfügt, mit denen Sie ohnehin arbeiten, Ihre Daten unter Kontrolle hält und so viel kostet, wie die Arbeit wert ist.

Wenn Sie einen wiederkehrenden Prozess im Blick haben und wissen möchten, was ein Agent dafür tatsächlich kosten würde — vereinbaren Sie ein kostenloses 30-minütiges Gespräch.

Weiterlesen: Was KI wirklich für Ihr Unternehmen leistet · KI-Agenten, erklärt für Menschen, die ein Unternehmen führen


Quellen

  • Belcák, P. et al. (2025). Small Language Models are the Future of Agentic AI. NVIDIA Research. arXiv:2506.02153
  • Jhandi, P., Kazi, O., Subramanian, S., Sendas, N. (2025, überarbeitet März 2026). Small Language Models for Efficient Agentic Tool Calling: Outperforming Large Models with Targeted Fine-tuning. arXiv:2512.15943
  • Yakefu, A. et al. (August 2026). State of Open Models: Summer 2026. Hugging Face. huggingface.co
  • Hu, E. J. et al. (2021). LoRA: Low-Rank Adaptation of Large Language Models. arXiv:2106.09685
  • Chen, L., Zaharia, M., Zou, J. (2023). FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance. arXiv:2305.05176
  • Ong, I. et al. (2024). RouteLLM: Learning to Route LLMs with Preference Data. arXiv:2406.18665
  • Anthropic. Preisliste der Modelle (abgerufen am 16. September 2026). platform.claude.com
Kostenloses KI-Potenzialgespräch