Zum Hauptinhalt springen
Softwarekosten senken API vs. lokal

KI-API-Kosten vs. lokale Inferenz: ab wann rechnet sich eigene Hardware?

Die verbreitete Annahme lautet, lokale Modelle sparten API-Kosten. Rechnet man öffentliche Tokenpreise gegen eine konkrete Anschaffung, kippt die Aussage: Der Break-even liegt bei einem Volumen, das die meisten Unternehmen nie erreichen. Lokale Inferenz bleibt sinnvoll – nur selten aus Kostengründen.

Kurzantwort: Bei den öffentlichen Listenpreisen von deepseek-v4-flash (0,14 US-Dollar je Million Input-Token, 0,28 US-Dollar je Million Output-Token) amortisiert sich ein Gerät der DGX-Spark-Klasse für 5.699 Euro erst bei rund 1,2 Milliarden Input-Token pro Monat, also etwa 40 Millionen Token pro Tag – Strom eingerechnet, Personalaufwand noch nicht. Unterhalb dieses Volumens ist die API auf reiner Kostenbasis günstiger. Der belastbare Grund für lokale Inferenz ist deshalb meist nicht der Preis, sondern Geheimnisschutz, Preisrisiko oder Kontrolle über Verfügbarkeit und Modellwechsel.

Fachlich und quellenbezogen geprüft: 2026-08-06

Geschäftsführungen, die eine Investitionsentscheidung für KI-Hardware prüfen
IT-Verantwortliche mit Anforderungen an Datenhaltung und Verarbeitungsort
Unternehmen mit planbar hohem Verarbeitungsvolumen
Teams, die eine bestehende API-Nutzung gegen Eigenbetrieb abwägen

Stufe 1 · Quick Win vor jedem Umbau

Erst Shelfware und Seat-Sprawl aus der Rechnung nehmen.

Ein Seat-Sprawl-Agent gleicht freigegebene Personal- oder Identitätsdaten, Vendor-Exporte, Aktivität, Rechnungen und Verlängerungen ab. Er legt verwaiste Seats, Doppeltools, falsche Editionen und Zombie-Abos in eine Review Queue – ohne Zugänge oder Verträge autonom zu ändern.

Beide Seiten müssen auf dieselbe Basis.

Ein Vergleich zwischen API und Eigenbetrieb wird häufig unfair geführt: Auf der einen Seite steht ein Tokenpreis, auf der anderen nur der Kaufpreis der Hardware. Vollständig wird die Rechnung erst, wenn auf der lokalen Seite Anschaffung, Strom, Betrieb, Ersatzbeschaffung und Ausfallabsicherung stehen – und auf der API-Seite das tatsächliche Volumen statt einer Schätzung.

Das tatsächliche Volumen ist messbar, bevor investiert wird. Wer heute eine API nutzt, hat die Zahlen bereits in der Abrechnung. Wer noch nicht nutzt, misst sie in einem begrenzten Piloten. Eine Hardwareentscheidung vor dieser Messung ist eine Wette.

  • Input- und Output-Token getrennt erfassen, nicht summieren
  • Anteil der Cache-Treffer prüfen – er senkt den Preis erheblich
  • Lastspitzen und Gleichzeitigkeit dokumentieren, nicht nur Monatssummen
  • Betriebsaufwand für Updates, Modellwechsel und Monitoring benennen

Der Break-even liegt bei einem Volumen, das die meisten nicht erreichen.

DeepSeek weist für deepseek-v4-flash 0,14 US-Dollar je Million Input-Token bei Cache-Miss und 0,28 US-Dollar je Million Output-Token aus. Bei Cache-Treffern sinkt der Input-Preis auf 0,0028 US-Dollar. Gegen ein Gerät der DGX-Spark-Klasse für 5.699 Euro inklusive Mehrwertsteuer gerechnet, ergibt sich ein Break-even im Bereich von gut einer Milliarde Input-Token pro Monat.

Zur Einordnung: Das entspricht etwa 40 Millionen Token pro Tag, dauerhaft. Eine Kanzlei, die täglich Dokumente prüft, erreicht das nicht. Ein Team von sieben Personen in der Wissensarbeit erreicht es ebenfalls nicht. Erreicht wird es von Verarbeitungsstrecken – etwa fortlaufender Massenklassifikation oder umfangreicher Dokumentenextraktion im Dauerbetrieb.

Was nach dem Wegfall des Kostenarguments übrig bleibt, ist die eigentliche Entscheidung.

Drei Gründe tragen eine lokale Architektur auch dann, wenn sie rechnerisch teurer ist. Erstens Geheimnisschutz: Wo Berufsgeheimnisse oder Gesundheitsdaten verarbeitet werden, ist der Verarbeitungsort keine Optimierungsfrage, sondern eine Pflichtenfrage. Zweitens Preisrisiko: DeepSeek behält sich in der eigenen Dokumentation ausdrücklich doppelte Preise während definierter Spitzenzeiten vor. Drittens Kontrolle über Verfügbarkeit, Latenz und den Zeitpunkt eines Modellwechsels.

Diese Gründe sind belastbar und begründen Investitionen. Das Kostenargument ist es bei aktuellen Listenpreisen in aller Regel nicht. Wer die Entscheidung auf ersparte Tokenkosten stützt, baut sie auf die instabilste der vier Größen.

Hybrid ist der Normalfall, nicht der Kompromiss.

In der Praxis führt die Datenklasse zur Aufteilung, nicht die Rechnung. Sensible Inhalte bleiben auf einem kontrollierten Endpunkt, unkritische Aufgaben nutzen eine API, und für beide Wege gelten dieselben Qualitätskriterien. Das begrenzt die Investition auf den Teil, der sie wirklich benötigt.

Wichtig ist die dokumentierte Zuordnung je Prozess. Ohne sie entsteht kein Hybridbetrieb, sondern ein unübersichtlicher Parallelbetrieb mit doppelten Kosten und unklarer Verantwortung.

Vergleich auf derselben Basis

KriteriumKI-APILokale Inferenz
KostenstrukturVariabel je Token, keine VorabinvestitionVorabinvestition plus Strom und Betrieb, danach volumenunabhängig
Break-evenBis rund 1,2 Mrd. Input-Token pro Monat günstigerErst oberhalb dieses Volumens rechnerisch im Vorteil
PreisrisikoAnbieter behält Preisänderungen und Spitzenzeitenaufschlag vorKosten nach Anschaffung weitgehend bekannt
VerarbeitungsortVertraglich zu regeln, abhängig von Anbieter und UnterauftragnehmernIm eigenen Verantwortungsbereich
ModellstandAnbieter entscheidet über Wechsel und AbkündigungZeitpunkt selbst bestimmbar, Pflege liegt im Haus
BetriebsaufwandGering, im Preis enthaltenUpdates, Monitoring, Backup, Ersatzbeschaffung dauerhaft eigene Aufgabe
LastspitzenElastischDurch vorhandene Hardware begrenzt, Warteschlange bei Gleichzeitigkeit

Die Break-even-Angabe folgt der Beispielrechnung auf dieser Seite und gilt für die dort genannten Annahmen. Andere Modelle, Cache-Quoten, Wechselkurse oder Hardwarepreise verschieben den Wert erheblich.

Beispielrechnung mit Annahmen

Break-even zwischen API-Nutzung und eigener Inferenz-Hardware

Zeitraum: 36 Monate

Annahmen

  • Gerät der DGX-Spark-Klasse zu 5.699 Euro inklusive Mehrwertsteuer laut Preisvergleich vom 6. August 2026
  • Nutzungsdauer drei Jahre, kein Restwert angesetzt
  • Durchschnittliche Leistungsaufnahme 150 Watt im Dauerbetrieb bei 240 Watt Netzteilleistung
  • Gewerbestrompreis 27,15 Cent je Kilowattstunde
  • Tokenpreise deepseek-v4-flash: 0,14 US-Dollar je Million Input-Token bei Cache-Miss, 0,28 US-Dollar je Million Output-Token
  • Angenommenes Verhältnis von Output zu Input: 1 zu 10
  • Umrechnungskurs 1 Euro entspricht 1,08 US-Dollar
  • Personalaufwand für Betrieb, Updates und Modellpflege ist bewusst nicht monetarisiert

Rechenweg

  1. 1. Anschaffung: 5.699 Euro
  2. 2. Strom: 0,150 kW × 24 h × 365 Tage = 1.314 kWh pro Jahr × 0,2715 Euro = rund 357 Euro pro Jahr
  3. 3. Strom über drei Jahre: rund 1.070 Euro
  4. 4. Summe über drei Jahre: rund 6.769 Euro, das entspricht rund 7.310 US-Dollar
  5. 5. Monatlicher Vergleichswert: rund 203 US-Dollar
  6. 6. Gleichung: 203 = 0,14 × I + 0,28 × (I ÷ 10) = 0,168 × I
  7. 7. Aufgelöst: I entspricht rund 1.208 Millionen Input-Token pro Monat

Der rechnerische Break-even liegt bei rund 1,2 Milliarden Input-Token pro Monat, also etwa 40 Millionen Token pro Tag im Dauerbetrieb. Darunter ist die API auf reiner Kostenbasis günstiger.

Die Rechnung enthält keinen Personalaufwand für Betrieb und Modellpflege; wird er angesetzt, steigt der Break-even weiter. In die Gegenrichtung wirkt der vom Anbieter vorbehaltene Spitzenzeitenaufschlag: Fiele sämtlicher Verbrauch in das genannte Zeitfenster, sänke der Schwellenwert auf etwa 600 Millionen Token – das ist der ungünstigste Fall, nicht der zu erwartende, und der Zeitpunkt des Inkrafttretens steht laut Anbieterdokumentation noch aus. Ein hoher Cache-Trefferanteil verschiebt den Wert dagegen deutlich nach oben. Wechselkurs, Hardwarepreis und Tokenpreise sind veränderlich. Es handelt sich um eine Beispielrechnung mit genannten Annahmen, nicht um eine Preisprognose.

Entscheidungscheck

Diese Fragen müssen vor dem Beschluss beantwortet sein.

Wie viele Input- und Output-Token fallen tatsächlich pro Monat an – gemessen, nicht geschätzt?

Welcher Anteil der Anfragen trifft den Prompt-Cache?

Gibt es eine Rechtspflicht, die den Verarbeitungsort vorgibt?

Wie hoch ist das Risiko einer Preisänderung oder Modellabkündigung für den betroffenen Prozess?

Wer betreibt die Hardware, wer pflegt Modelle, wer übernimmt Bereitschaft?

Welche Gleichzeitigkeit muss zu Spitzenzeiten bedient werden?

Existiert ein Rückfallweg, wenn das lokale System ausfällt?

Vom Check in den Betrieb

Ablösen ist ein kontrollierter Prozess, kein Tooltausch über Nacht.

01 · Check

Kosten, Nutzung und Exit-Fähigkeit belegen

Verträge, Rechnungen, aktive Nutzer, Geschäftsfunktionen, Daten, Integrationen und Verlängerungen werden in einer prüfbaren Entscheidungsbasis zusammengeführt.

Ergebnis: Ist-TCO, Quick Wins und ein klar abgegrenzter Kandidat

02 · Pilot

Alternative mit echten Fällen vergleichen

Ein begrenzter Prozess läuft mit denselben Testfällen, Qualitätskriterien, Sicherheitsregeln und Verantwortlichen wie die bestehende Lösung.

Ergebnis: Gemessene Qualität, Aufwand und belastbare Betriebskalkulation

03 · Implementierung

Daten und Verantwortung kontrolliert übergeben

Migration, Schnittstellen, Rollen, Dokumentation, Rückfallweg und Vertragsende werden stufenweise umgesetzt und fachlich abgenommen.

Ergebnis: Produktiver Zielprozess ohne unkontrollierten Big Bang

04 · Agent Ops

Qualität, Nutzung und Kosten dauerhaft steuern

Nutzung, Fehler, Freigaben, Modell- und Infrastrukturkosten sowie neue Anforderungen werden regelmäßig gemessen und priorisiert.

Ergebnis: Nachvollziehbarer Betrieb statt neuem Kosten-Sprawl

Passende Agenten-Bausteine

Nicht jede Funktion braucht eine weitere Vollsuite.

Quellen und Prüfstand

Preis- und Produktangaben beziehen sich auf die verlinkten öffentlichen Quellen. Konditionen können sich ändern; maßgeblich ist das konkrete Angebot des jeweiligen Anbieters. Eigene Rechnungen sind separat als Annahme gekennzeichnet.

FAQ

Häufige Fragen

Ab wann lohnt sich lokale KI-Inferenz gegenüber einer API?

Rein rechnerisch erst bei sehr hohem Dauervolumen. Für ein Gerät der DGX-Spark-Klasse zu 5.699 Euro liegt der Break-even bei den aktuellen Listenpreisen von deepseek-v4-flash bei rund 1,2 Milliarden Input-Token pro Monat, Strom eingerechnet. Die meisten mittelständischen Anwendungsfälle liegen um Größenordnungen darunter.

Spart lokale KI Geld?

In der Regel nicht. Bei aktuellen Tokenpreisen ist die API für typische Volumen deutlich günstiger als Anschaffung, Strom und Betrieb eigener Hardware. Lokale Inferenz wird durch Geheimnisschutz, Preisrisiko und Kontrolle begründet, nicht durch Ersparnis.

Wie wird das eigene Tokenvolumen gemessen?

Bei bestehender API-Nutzung steht es in der Abrechnung, getrennt nach Input, Output und Cache-Treffern. Ohne bestehende Nutzung liefert ein begrenzter Pilot mit echten Dokumenten und realistischen Prompts über einige Wochen eine belastbare Hochrechnung.

Was passiert bei einer Preiserhöhung des API-Anbieters?

Der Break-even sinkt entsprechend. DeepSeek behält sich in der eigenen Dokumentation vor, die Preise während definierter Spitzenzeiten zu verdoppeln; das Inkrafttreten steht dort noch unter Vorbehalt. Fiele der gesamte Verbrauch in dieses Zeitfenster, halbierte sich der rechnerische Schwellenwert. Deshalb gehören Verbrauch und Preisstand in das laufende Monitoring, und der Wechselweg sollte technisch offengehalten werden.

Ist ein Hybridbetrieb sinnvoll?

Häufig ja. Sensible Inhalte laufen auf einem kontrollierten Endpunkt, unkritische Aufgaben über eine API. Entscheidend ist eine dokumentierte Zuordnung je Prozess und Datenklasse, sonst entsteht statt eines Hybridbetriebs ein Parallelbetrieb mit doppelten Kosten.

Gilt die Rechnung auch, wenn ein teureres Modell genutzt wird?

Der Break-even sinkt proportional zum Tokenpreis. Mit den Listenpreisen von deepseek-v4-pro (0,435 US-Dollar Input, 0,87 US-Dollar Output je Million Token) liegt er bei denselben Annahmen nur noch bei rund 390 Millionen Input-Token pro Monat; bei nochmals höher bepreisten Anbietern entsprechend darunter. Dieser Vergleich führt allerdings in die Irre, denn ein Desktop-System dieser Klasse führt offene Modelle aus, keine Spitzenmodelle. Wer lokale Hardware gegen die Preise eines deutlich leistungsfähigeren API-Modells rechnet, vergleicht zwei verschiedene Qualitätsniveaus und schönt das Ergebnis. Die belastbare Rechnung stellt lokale Hardware den API-Preisen vergleichbar offener Modelle gegenüber – und genau das tut die Beispielrechnung auf dieser Seite.

Verwandte Kostenentscheidungen

Nächster Schritt

Softwarekosten mit einem belastbaren Ablösepfad prüfen.

Im Kostenaudit erfassen wir Verträge, tatsächliche Nutzung, Integrationen, Datenexport und Betrieb. Das Ergebnis ist eine priorisierte Entscheidung: optimieren, konsolidieren, ersetzen oder bewusst behalten.