DEV Community

Cover image for Google greift NVIDIAs KI-Geschäft mit eigenen Chips an
Christian Ahrweiler
Christian Ahrweiler

Posted on Originally published at Medium

Google greift NVIDIAs KI-Geschäft mit eigenen Chips an

Google greift NVIDIAs KI-Geschäft mit eigenen Chips an*Warum TPUs nicht einfach schnellere GPUs sind, weshalb Google zugleich NVIDIA-Kunde und Konkurrent ist und wie sich der Markt für KI-Rechenzentren verändern könnte.*

NVIDIA meldete für sein Ende Januar 2026 abgeschlossenes Geschäftsjahr einen Umsatz von 215,9 Milliarden US-Dollar.

193,7 Milliarden US-Dollar entfielen auf NVIDIAs Geschäftsbereich Data Center. Der Name bezeichnet hier den Absatzmarkt, nicht den Betreiber: NVIDIA betreibt nicht die Rechenzentren seiner Kunden, sondern liefert einen großen Teil ihrer technischen Ausstattung. Dazu gehören GPUs, Netzwerkkomponenten, komplette Serversysteme und die zugehörige Software. Betreiber und Kunden sind unter anderem Google, Amazon, Microsoft, Oracle, Meta sowie spezialisierte Cloud-Anbieter. [1]

Auch Google Cloud bietet seinen Kunden NVIDIA-Systeme an. Gleichzeitig entwickelt Google seit mehr als zehn Jahren einen eigenen KI-Beschleuniger: die Tensor Processing Unit (TPU).

Google ist damit Kunde und Konkurrent zugleich.

Das Unternehmen benötigt NVIDIA-Hardware, um die aktuelle Nachfrage nach KI-Rechenleistung zu bedienen. Mit jeder neuen TPU-Generation kann es jedoch einen größeren Teil dieser Rechenleistung auf die eigene Plattform verlagern — zunächst für Search, YouTube, Werbung und Gemini, inzwischen auch für externe Cloud-Kunden.

Dieser doppelte Weg zeigt, wie sich der Markt verändern könnte. NVIDIA verschwindet nicht plötzlich aus den Rechenzentren. Aber neue KI-Kapazität muss nicht mehr automatisch mit NVIDIA-GPUs gebaut werden.

Warum KI auf GPUs läuftEin Computerchip besteht aus sehr vielen Transistoren. Das sind winzige elektronische Schalter, aus denen Rechenschaltungen und Speicher aufgebaut werden. Wie diese Schaltungen angeordnet sind, bestimmt, welche Aufgaben ein Prozessor besonders gut ausführt.

Die Central Processing Unit (CPU) ist der vielseitige Hauptprozessor eines Computers. Sie startet Programme, verwaltet Speicher, reagiert auf Eingaben und verarbeitet Abläufe mit vielen Entscheidungen und unterschiedlichen Arbeitsschritten.

Eine Graphics Processing Unit (GPU) wurde ursprünglich für Grafik entwickelt.

Beim Erzeugen eines Bildes müssen Positionen, Farben und Beleuchtung für sehr viele Punkte berechnet werden. Zahlreiche dieser Berechnungen ähneln einander und lassen sich gleichzeitig ausführen.

Eine CPU besitzt vergleichsweise wenige leistungsfähige Rechenkerne. Eine GPU verteilt die Arbeit auf sehr viele kleinere Recheneinheiten. Dadurch kann sie große Mengen ähnlicher Zahlenoperationen parallel verarbeiten.

Genau diese Fähigkeit wird auch bei neuronalen Netzen benötigt.

Das gelernte Wissen eines solchen Netzes steckt in sehr vielen Zahlenwerten, den sogenannten Gewichten. Beim Training und bei der späteren Anwendung werden große Zahlenfelder miteinander multipliziert und die Ergebnisse addiert.

Diese Matrixoperationen lassen sich gut auf die parallelen Recheneinheiten einer GPU verteilen.

So wurde aus einem Grafikprozessor ein KI-Beschleuniger.

Training und Inferenz sind zwei verschiedene AufgabenBeim Training lernt ein KI-Modell. Es verarbeitet Trainingsdaten, vergleicht seine Ausgabe mit dem gewünschten Ergebnis und verändert anschließend seine Gewichte. Dieser Ablauf wird sehr oft wiederholt.

Das Training umfasst daher nicht nur die Berechnung einer Antwort. Das System muss zusätzlich Fehler zurückverfolgen, Korrekturen für die Gewichte bestimmen und diese Änderungen zwischen vielen beteiligten Chips austauschen. Große Trainingsläufe benötigen deshalb flexible Recheneinheiten, sehr schnelle Verbindungen und eine ausgereifte Softwareumgebung.

Bei der Inferenz wird das fertig trainierte KI-Modell angewendet. Ein Sprachmodell erhält beispielsweise eine Frage und berechnet mit seinen bereits gelernten Gewichten eine Antwort. Die Gewichte werden dabei nicht erneut trainiert.

Im laufenden Dienst wiederholt sich dieser Vorgang für sehr viele Nutzer:

Eingabe erhalten
→ mit den vorhandenen Gewichten berechnen
→ Ausgabe liefernDiese häufig wiederkehrende und besser vorhersehbare Arbeit lässt sich besonders gut auf spezialisierte Hardware abstimmen. Bei Millionen oder Milliarden Anfragen zählt außerdem jeder kleine Unterschied bei Energieverbrauch und Kosten pro Antwort.

Deshalb könnte sich gerade die Inferenz schneller auf TPUs und andere spezialisierte Beschleuniger verteilen, während beim Training die größere Flexibilität und das ausgereifte NVIDIA-System länger besonders wichtig bleiben.

CUDA machte aus der GPU eine PlattformDie passende Hardware allein hätte NVIDIA nicht zum Marktführer gemacht.

Mit CUDA entwickelte NVIDIA eine Softwareplattform, über die Programme die Recheneinheiten der GPU auch für andere Aufgaben als Grafik verwenden können.

CUDA umfasst nicht nur eine Programmierschnittstelle. Dazu gehören Compiler, Bibliotheken, Werkzeuge zur Fehlersuche und optimierte Implementierungen häufig benötigter Rechenoperationen.

KI-Frameworks wie PyTorch können diese Grundlage verwenden, ohne dass ein Entwickler jede Multiplikation selbst für die GPU programmieren muss.

Über viele Jahre entstand dadurch ein großes Ökosystem:

NVIDIA-GPU
→ CUDA
→ optimierte KI-Bibliotheken
→ PyTorch und andere Frameworks
→ Werkzeuge für Entwicklung und Betrieb
→ erfahrene EntwicklerModerne NVIDIA-GPUs enthalten außerdem Tensor Cores. Diese spezialisierten Einheiten sind gezielt für Rechenoperationen ausgelegt, die bei neuronalen Netzen besonders häufig vorkommen. [2]

NVIDIA verkauft deshalb nicht mehr bloß Grafikchips, die zufällig auch KI berechnen können. Das Unternehmen liefert spezialisierte KI-GPUs, schnelle Verbindungen zwischen ihnen, Netzwerktechnik und vollständige Serversysteme.

Google kauft NVIDIA-Technik — und entwickelt den ErsatzGoogle Cloud bietet sowohl NVIDIA-GPUs als auch Googles eigene TPUs an. Noch 2025 kündigte Google neue Cloud-Systeme mit NVIDIAs GB300-Plattform an, während es gleichzeitig die siebte TPU-Generation Ironwood vorbereitete. [3]

Das ist kein Widerspruch.

Google benötigt enorme Mengen Rechenleistung. Die eigenen Chips können nicht sofort jede Arbeitslast übernehmen und stehen nicht unbegrenzt zur Verfügung. NVIDIA besitzt eine ausgereifte Plattform, die viele Kunden und Modelle bereits unterstützen.

Gleichzeitig hat Google einen starken wirtschaftlichen Grund, eine eigene Alternative zu entwickeln.

Search, YouTube, Werbung und Gemini erzeugen ständig wiederkehrende KI-Berechnungen in gewaltigem Umfang. Wenn ein eigener Chip eine einzelne Berechnung nur etwas günstiger oder energieeffizienter ausführt, summiert sich dieser Unterschied über Milliarden Vorgänge.

Ein eigener Beschleuniger verringert außerdem die Abhängigkeit von einem Lieferanten. Google kann Chip, Software und Rechenzentrum gemeinsam planen und neue Hardware gezielt an die eigenen Modelle anpassen.

Die TPU begann daher nicht als allgemeiner Angriff auf NVIDIA. Sie begann als Lösung für Googles eigene Kosten und seinen eigenen Bedarf.

Mit Google Cloud wurde daraus ein Produkt für andere Unternehmen.

Was eine TPU anders macht*TPU* steht für Tensor Processing Unit.

Ein Tensor ist ein Zahlenfeld mit einer oder mehreren Dimensionen. Ein Vektor ist ein eindimensionales Beispiel, eine Matrix ein zweidimensionales.

Der Name beschreibt den Schwerpunkt des Chips. Google entwickelte die TPU von Anfang an für maschinelles Lernen. Große Einheiten für Matrixmultiplikationen, Speicherzugriffe und der Datenaustausch zwischen vielen Chips sind auf diese Arbeitslasten abgestimmt. [4]

Eine TPU enthält keine fest eingebaute KI. Sie ist ein programmierbarer Beschleuniger, auf dem unterschiedliche unterstützte Modelle trainiert und ausgeführt werden können.

GPU und TPU unterscheiden sich vor allem durch ihre Herkunft:

GPU:
flexibler Parallelprozessor
→ später stark für KI spezialisiert

TPU:
von Beginn an für maschinelles Lernen entwickelt
→ später für mehr Modelle und Aufgaben geöffnetDie Grenze wird dadurch unschärfer.

NVIDIA baut mit Tensor Cores spezialisierte KI-Einheiten in seine GPUs ein. Google erweitert seine TPUs, damit sie mit unterschiedlichen Modellen, Zahlenformaten und Rechenverfahren umgehen können.

Die eine Plattform wird spezialisierter, die andere vielseitiger.

TPUs stehen ebenfalls in RacksEine TPU arbeitet nicht allein.

Zu einem TPU-System gehören klassische Host-Rechner, Speicher, Netzwerkverbindungen, Stromversorgung und Kühlung. Google verbindet viele TPU-Chips zu sogenannten Pods. Diese Verbünde können sich über mehrere Racks erstrecken.

Ein großes KI-Modell wird dabei auf viele Chips verteilt. Während der Berechnung müssen diese Chips ständig Zwischenergebnisse austauschen. Deshalb bestimmen Speicher und Verbindungen die Leistung des Gesamtsystems ebenso wie die Recheneinheiten.

Google bietet TPU-Kapazität über seine Cloud an. Kunden müssen die Hardware daher nicht kaufen oder selbst betreiben. Sie mieten eine bestimmte Konfiguration für einen Trainingslauf oder einen laufenden KI-Dienst. [4][5]

Damit konkurriert Google nicht Chip gegen Chip mit NVIDIA.

Auf beiden Seiten stehen vollständige Plattformen:

Beschleuniger
→ Speicher
→ Verbindungen
→ Server und Racks
→ Kühlung
→ Compiler und Bibliotheken
→ Cloud-BetriebEin Modell muss beim Wechsel nicht neu lernenDie Gewichte eines neuronalen Netzes sind gespeicherte Zahlenwerte. Sie sind nicht dauerhaft mit den GPUs verbunden, auf denen das Modell trainiert wurde.

Ein Modell kann deshalb grundsätzlich auf GPUs trainiert und später auf TPUs ausgeführt werden. Ebenso kann ein TPU-Training gespeichert und auf anderer unterstützter Hardware fortgesetzt oder für die Inferenz bereitgestellt werden.

Ein vollständiges neues Training ist allein wegen des Chipwechsels nicht erforderlich.

Der entscheidende Unterschied liegt zwischen Modell und Betrieb:

Die Gewichte sind übertragbar. Die gesamte Softwareumgebung ist es möglicherweise nicht.KI-Frameworks wie PyTorch und JAX beschreiben die mathematischen Operationen eines Modells. Compiler und Laufzeitsysteme übersetzen sie anschließend für die jeweilige Hardware.

Für TPUs existieren unter anderem JAX und PyTorch/XLA. Verwendet ein Modell nur unterstützte Standardoperationen, kann die Übertragung vergleichsweise einfach sein. [6]

Schwieriger wird sie, wenn ein Projekt:

  • eigene CUDA-Funktionen verwendet,
  • NVIDIA-spezifische Bibliotheken voraussetzt,
  • die Modellverteilung genau für eine bestimmte GPU-Struktur optimiert hat,
  • oder Überwachung und Betrieb eng an die vorhandene Plattform bindet. Dann müssen Teile der Implementierung angepasst oder ersetzt werden.

Eine KI muss also nicht neu lernen. Die Ingenieure müssen ihr Rechensystem jedoch unter Umständen neu einrichten.

Der Wechsel erfolgt Arbeitslast für ArbeitslastEin Rechenzentrum würde nicht sämtliche GPUs an einem Wochenende durch TPUs ersetzen.

Ein Betreiber kann eine Kopie des Modells auf TPUs bereitstellen und zunächst prüfen:

  • Bleibt die Ergebnisqualität gleich?
  • Wie lang wartet ein Nutzer auf eine Antwort?
  • Wie viele Anfragen verarbeitet das System gleichzeitig?
  • Wie stabil läuft der Dienst?
  • Was kostet eine Million Eingabe- und Ausgabetokens?
  • Wie hoch sind Energie- und Kühlaufwand? Anschließend kann ein kleiner Teil der Anfragen an das TPU-System geleitet werden. Wenn der Betrieb überzeugt, wächst dieser Anteil.

GPU- und TPU-Systeme können über Jahre nebeneinander arbeiten. Auch Training und Inferenz müssen nicht auf derselben Hardware erfolgen.

Was sich nicht einfach durchführen lässt, ist der Austausch einzelner GPUs gegen TPUs innerhalb eines laufenden Trainingsverbunds. Die beteiligten Chips müssen eng synchronisiert sein und dieselbe Software- und Kommunikationsumgebung verwenden.

Die Umstellung erfolgt deshalb nicht Bauteil für Bauteil, sondern Dienst für Dienst oder Modell für Modell.

Eine TPU ist nicht pauschal schnellerDie Geschwindigkeit eines KI-Systems hängt nicht nur vom Chip ab.

Beim Training zählt, wie lange ein KI-Modell benötigt, um eine bestimmte Qualität zu erreichen. Bei der Inferenz zählen die Antwortzeit eines Nutzers und die Zahl gleichzeitig bedienbarer Anfragen.

Ein System kann einen hohen Gesamtdurchsatz liefern und trotzdem für jede einzelne Anfrage langsamer reagieren. Ein anderes kann schneller sein, wegen eines höheren Mietpreises aber mehr kosten.

Auch theoretische Rechenleistung genügt nicht. Daten müssen aus dem Speicher ankommen. Viele Chips müssen Zwischenergebnisse austauschen. Wenn Speicher oder Verbindungen zum Engpass werden, bleiben Recheneinheiten ungenutzt.

Ein sinnvoller Vergleich benötigt daher eine feste Aufgabe:

dasselbe Modell
→ dieselbe Ergebnisqualität
→ dieselbe maximale Antwortzeit
→ vollständige Kosten
→ Energie pro brauchbarem ErgebnisOhne diese Angaben bedeutet „dreimal schneller“ fast nichts.

Für den Käufer zählt am Ende nicht die Zahl theoretischer Rechenoperationen, sondern der Preis einer brauchbaren Trainingsstunde oder KI-Antwort.

NVIDIAs Geschäft ist messbar — Googles TPU-Geschäft kaumNVIDIAs 193,7 Milliarden US-Dollar Umsatz mit Produkten für Rechenzentren zeigen unmittelbar, welche wirtschaftliche Bedeutung diese Plattform erreicht hat. [1]

Google veröffentlicht dagegen keinen separaten TPU-Umsatz.

TPUs erzeugen ihren Wert auf verschiedenen Wegen:

  • Sie senken möglicherweise die Kosten interner Google-Dienste.
  • Sie werden über Google Cloud vermietet.
  • Sie ermöglichen Google, vollständige KI-Infrastruktur anzubieten.
  • Seit 2026 verkauft Google Cloud nach eigenen Angaben auch TPU-Systeme als Produkt. [7] Google Cloud erzielte 2025 insgesamt 58,7 Milliarden US-Dollar Umsatz. Darin stecken neben KI-Infrastruktur auch Workspace, Datenbanken, Speicher und viele weitere Cloud-Dienste.

Alphabet investierte 2025 insgesamt 91,4 Milliarden US-Dollar in Sachanlagen, überwiegend in technische Infrastruktur. Auch diese Summe umfasst nicht nur TPUs, sondern ebenfalls GPUs, Server, Netzwerke, Grundstücke und Gebäude. [8]

Ein exakter TPU-Marktanteil lässt sich aus diesen Zahlen nicht ableiten.

Gerade das macht den Vergleich schwierig: NVIDIA verdient am Verkauf der Infrastruktur. Google kann bereits profitieren, wenn der eigene Chip den Betrieb von Search oder Gemini billiger macht.

Anthropic macht TPUs zum Geschäft außerhalb GooglesLange konnte man TPUs vor allem als interne Google-Technik betrachten.

Anthropic verändert dieses Bild.

Das Unternehmen hinter Claude vereinbarte mit Google und Broadcom mehrere Gigawatt künftiger TPU-Rechenkapazität. Die Systeme sollen ab 2027 bereitgestellt werden. [9]

Laut Reuters nennt Anthropics Börsenprospekt eine Verpflichtung von 125,2 Milliarden US-Dollar für fünf Jahre TPU-Kapazität. [10]

Anthropic wechselt damit nicht vollständig von NVIDIA zu Google. Große KI-Unternehmen verteilen ihre Rechenleistung auf mehrere Anbieter.

Die Größenordnung zeigt dennoch, dass eine externe Firma einen bedeutenden Teil ihrer künftigen Infrastruktur auf TPUs aufbauen will.

Google hat damit den Schritt vom internen Spezialchip zu einer Plattform geschafft, auf die andere KI-Unternehmen langfristige Planungen stützen.

Die eigentliche Konkurrenz entsteht bei der nächsten ErweiterungGoogle muss vorhandene NVIDIA-Racks nicht verdrängen.

Der Markt für KI-Rechenleistung wächst. Unternehmen bauen neue Rechenzentren, erweitern bestehende Anlagen und benötigen zusätzliche Kapazität für die Inferenz.

Bei jeder Erweiterung wird neu entschieden, welche Plattform die Aufgabe übernimmt.

Ein Betreiber kann seine vorhandenen GPU-Systeme weiter nutzen und neue Inferenzkapazität auf TPUs aufbauen. Ein neues Modell kann auf einer anderen Plattform trainiert werden als sein Vorgänger. Ein Cloud-Kunde kann einzelne Arbeitslasten verschieben, ohne seine gesamte Infrastruktur umzustellen.

Der Wandel sieht deshalb wahrscheinlich so aus:

vorhandene NVIDIA-Systeme bleiben
→ neue Plattformen kommen hinzu
→ neue Arbeitslasten werden verteilt
→ der Anteil jeder Plattform verändert sich langsamDas ist für NVIDIA relevant, obwohl der eigene Umsatz zunächst weiter wachsen kann.

In einem stark wachsenden Markt können gleichzeitig zwei Dinge geschehen:

  • NVIDIA verkauft jedes Jahr mehr.
  • NVIDIAs Anteil an der gesamten KI-Rechenleistung sinkt. Der Gesamtmarkt muss dafür nur schneller wachsen als NVIDIA.

Inferenz könnte den Markt stärker aufteilenDas Training großer Modelle benötigt flexible Systeme, sehr schnelle Verbindungen und eine ausgereifte Softwareumgebung. Hier besitzt NVIDIA weiterhin große Vorteile.

Bei der Inferenz bleiben die gelernten Gewichte unverändert. Ein großer Dienst führt daher für sehr viele Anfragen immer wieder ähnliche, gut planbare Rechenabläufe aus. Eine spezialisierte Architektur kann ihre Recheneinheiten dafür gezielter auslasten und unnötige Flexibilität vermeiden.

Wenige Prozent niedrigere Kosten pro Anfrage ergeben bei Search, Werbung, Übersetzungen oder einem großen Chatdienst erhebliche Beträge.

Google besitzt hier einen besonderen Vorteil. Das Unternehmen kann neue TPU-Generationen zunächst mit eigenen Diensten auslasten und unter realen Bedingungen verbessern. Es muss nicht darauf warten, dass genügend externe Kunden die erste Produktion kaufen.

Deshalb ist folgende Entwicklung plausibel:

Das Training sehr unterschiedlicher neuer Modelle bleibt länger GPU-dominiert, während sich der Inferenzmarkt schneller auf spezialisierte Beschleuniger verteilt.Das ist keine sichere Vorhersage. Neue TPU-Generationen können auch beim Training konkurrenzfähig sein, und NVIDIA optimiert seine Plattform ebenfalls stark für Inferenz.

Die wirtschaftlichen Anreize für Spezialisierung sind bei ständig wiederholten Berechnungen jedoch besonders groß.

Google ist nicht der einzige HerausfordererTPU ist Googles Bezeichnung für die eigene Chipfamilie.

Amazon entwickelt Trainium für Training und Inferentia für Inferenz. Microsoft arbeitet an Maia. Weitere Cloud-Anbieter und Chipunternehmen verfolgen ähnliche Strategien. [11][12]

Sie alle haben denselben Anreiz:

  • weniger Abhängigkeit von NVIDIA,
  • mehr Kontrolle über Kosten und Liefermengen,
  • engere Abstimmung zwischen Chip und Rechenzentrum,
  • sowie eigene Produkte, die Kunden an die jeweilige Cloud binden. NVIDIAs Konkurrenz besteht daher nicht nur aus einem zweiten Chiphersteller.

Die großen Kunden beginnen, einen Teil der bisher eingekauften Technik selbst zu entwickeln.

Das kann NVIDIAs Preismacht bereits schwächen, bevor die verkaufte Stückzahl sinkt. Ein Kunde mit einer glaubwürdigen Alternative kann Preise und Lieferbedingungen besser verhandeln.

Warum CUDA NVIDIAs stärkster Schutz bleibtEin Chipwechsel kostet mehr als die Miete der neuen Hardware.

Unternehmen müssen Software anpassen, Modelle testen, Überwachung einrichten und möglicherweise beide Plattformen eine Zeit lang parallel betreiben.

CUDA schützt NVIDIA deshalb ähnlich wie ein großes Betriebssystem- und Entwicklerökosystem.

Je mehr eigene CUDA-Funktionen und Optimierungen ein Unternehmen verwendet, desto höher ist der Wechselaufwand. Je besser PyTorch, JAX und Compiler die Unterschiede der Hardware verbergen, desto kleiner wird er.

Der Wettbewerb entscheidet sich daher auf drei Ebenen:

Leistung des Chips
→ Effizienz des vollständigen Systems
→ Aufwand für Entwicklung und MigrationEine TPU kann technisch günstiger sein und wirtschaftlich trotzdem verlieren, wenn ihre Einführung zu viel Arbeit verursacht.

Umgekehrt kann ein etwas langsamerer Chip gewinnen, wenn er besser verfügbar ist, weniger Energie benötigt oder für den konkreten Dienst geringere Gesamtkosten erzeugt.

Wird NVIDIA selbst eine TPU bauen?NVIDIA muss Googles Architektur nicht kopieren.

Mit Tensor Cores integriert das Unternehmen bereits spezialisierte KI-Einheiten in seine GPUs. Gleichzeitig bewahrt es deren breitere Programmierbarkeit.

Die weitere Entwicklung dürfte diese Kombination fortsetzen:

  • spezialisiertere Recheneinheiten,
  • schnellere Speicherzugriffe,
  • engere Verbindungen zwischen Chips,
  • bessere Energieeffizienz,
  • und noch stärker integrierte Rack-Systeme. NVIDIAs Antwort auf TPUs ist daher wahrscheinlich kein gesonderter „TPU-Chip“.

Die Antwort ist eine GPU-Plattform, die für KI immer spezialisierter wird, ohne ihre Flexibilität vollständig aufzugeben.

Eine begründete PrognoseNVIDIA wird seine führende Stellung nicht kurzfristig verlieren. Die installierte Basis, CUDA, die Entwicklergemeinschaft und die vollständige Produktpalette bilden einen starken Vorsprung.

Google muss außerdem beweisen, dass TPUs außerhalb der eigenen Infrastruktur für viele Kunden dauerhaft zuverlässig, gut verfügbar und leicht programmierbar sind.

Trotzdem spricht vieles gegen einen dauerhaft nahezu einheitlichen NVIDIA-Markt.

Die großen Cloud-Anbieter investieren so viel Geld in KI-Infrastruktur, dass sich eigene Chips bereits bei begrenzten Einsatzgebieten lohnen können. Sie müssen NVIDIA nicht überall schlagen. Es genügt, einen wachsenden Teil der eigenen und vermieteten Arbeitslasten günstiger auszuführen.

Für die nächsten Jahre ist daher folgende Entwicklung plausibel:

  • NVIDIA bleibt der wichtigste unabhängige Anbieter von KI-Beschleunigern.
  • Google, Amazon und Microsoft verwenden mehr eigene Chips in ihren Clouds.
  • Vorhandene GPU-Systeme werden nicht ersetzt, neue Kapazität wird aber stärker verteilt.
  • Die Inferenz öffnet sich schneller für spezialisierte Beschleuniger als der Markt für das Training neuer Spitzenmodelle.
  • NVIDIA kann weiter stark wachsen und gleichzeitig Marktanteile verlieren.
  • Der Wettbewerb drückt zuerst auf Preise und Margen, nicht zwingend auf den Umsatz. Am Ende wird nicht eine Chipart alle anderen ersetzen.

Wahrscheinlicher ist ein Markt, in dem Unternehmen je nach Modell und Aufgabe unterschiedliche Plattformen verwenden.

NVIDIA verkauft heute den Standard, an dem sich alle anderen messen müssen.

Google baut mit seinen TPUs eine Alternative, die nicht mehr nur im eigenen Haus funktioniert. Sobald große Kunden neue Milliardenbeträge auf diese Plattform setzen, wird aus technischer Konkurrenz wirtschaftlicher Wettbewerb.

NVIDIA betreibt die Rechenzentren nicht.

Aber bisher lieferte das Unternehmen einen großen Teil der Technik, ohne die moderne KI-Rechenzentren kaum gebaut werden konnten.

Googles Ziel ist nicht, jede NVIDIA-GPU zu ersetzen.

Es reicht, wenn beim nächsten Ausbau häufiger eine TPU gewählt wird.

Quellen- NVIDIA: Geschäftsergebnisse des Geschäftsjahres 2026

Top comments (0)