AKTUELLE NACHRICHTEN
FÜR SIE AUSGEWÄHLT

NVIDIA’s $20B-Chip könnte ChatGPT langsam aussehen lassen

VonNellius IreneNellius Irene 3 Min. Lesezeit
NVIDIAs $20B-Chip könnte ChatGPT langsam wirken lassen.
  • NVIDIA bereitet sich darauf vor, auf seiner jährlichen NVIDIA GTC einen neuen KI-Inferenz-Chip vorzustellen, der darauf ausgelegt ist, Antworten schneller zu generieren als aktuelle Systeme wie ChatGPT.
  • Der Chip konzentriert sich auf KI-Inferenz und folgt NVIDIAs rund 20 Milliarden Dollar teuren Deal zur Lizenzierung von Technologie und der Gewinnung der Groq-Gründer.
  • Analysten erwarten, dass die KI-Inferenz zukünftige Rechenzentrumsausgaben dominieren wird, selbst wenn Konkurrenten wie Meta Platforms eigene Inferenzprozessoren entwickeln.

Chip-Riese NVIDIA bereitet sich darauf vor, einen leistungsstarken neuen KI-Prozessor vorzustellen, der darauf ausgelegt ist, die Geschwindigkeit zu erhöhen, mit der Chatbots und andere KI-Tools Antworten generieren, und damit heutige Systeme wie ChatGPT im Vergleich träge erscheinen lassen könnte.

Die neue Plattform, die voraussichtlich auf der jährlichen GTC-Entwicklerkonferenz von NVIDIA debütiert, ist für die KI-Inferenz optimiert, die Phase, in der trainierte Modelle Antworten auf Benutzereingaben erzeugen. Im Gegensatz zu herkömmlichen GPUs, die sowohl für das Training als auch für die Inferenz ausgelegt sind, konzentriert sich der kommende Prozessor speziell darauf, Antworten schneller und effizienter zu liefern.

Das Produkt, falls es eingeführt wird, würde das erste greifbare Ergebnis des Deals vom Dezember markieren, der die Gründer von Groq ins Boot holte, deren Unternehmen auf Hochgeschwindigkeits-Hardware für die KI-Verarbeitung spezialisiert ist.

Ende letzten Jahres gab NVIDIA Berichten zufolge etwa 20 Milliarden US-Dollar aus, um die Technologie des Chip-Startups Groq zu lizenzieren und Schlüsselpersonal, einschließlich seines CEO, anzuwerben. Zur gleichen Zeit sagte NVIDIA-CEO Jensen Huang den Mitarbeitern: „Wir planen, die Low-Latency-Prozessoren von Groq in die NVIDIA-KI-Fabrikarchitektur zu integrieren und die Plattform zu erweitern, um noch breitere Bereiche der KI-Inferenz und Echtzeit-Arbeitslasten zu bedienen.“

Nun wird erwartet, dass der neue Inferenz-Chip komplexe KI-Anfragen mit hoher Geschwindigkeit verarbeitet, wobei OpenAI und andere führende Kunden ihn wahrscheinlich übernehmen werden, so das Wall Street Journal. Sein Bericht zeigte auch, dass der neue Chip fast 10 % der Inferenz-Arbeitslast von OpenAI bewältigen könnte.

Der Groq-ähnliche Chip wird laut Quellen SRAM verwenden

Während einer jüngsten Gewinnkonferenz deutete der NVIDIA-CEO an, dass mehrere neue Produkte auf dem bevorstehenden GTC-Event enthüllt werden, der oft als „Super Bowl der KI“ beschrieben wird. Er hatte bemerkt: „Ich habe einige großartige Ideen, die ich Ihnen auf der GTC vorstellen möchte.“ 

Die meisten Analysten sind sich einig, dass der Groq-ähnliche Chip Teil des Sortiments sein könnte. Sie stellten auch fest, dass sein Design Aufschluss darüber geben könnte, wie NVIDIA beabsichtigt, Speicherengpässe bei der Inferenz-Berechnung zu adressieren. Solche Plattformen laufen typischerweise auf High-Bandwidth-Speicher (HBM). HBM war jedoch in letzter Zeit schwer zu beschaffen.

Insider haben dass einige ihrer Operateure einen in den USA ansässigen Bürger finden, der bereit ist, als Gesicht des potenziellen Kandidaten aufzutreten. Der Operateur installiert dann Malware auf dem Gerät dieser Person, wodurch ihm ein ständiger Zugriff auf eine US-IP-Adresse und den Rest des Internets gewährt wird. In diesem Fall nimmt der Operateur an Vorstellungsgesprächen teil und arbeitet im Erfolgsfall von zu Hause aus. die Firma plant, im Chip SRAM anstelle des mit HBM verbundenen dynamischen RAMs zu verwenden. Idealerweise ist SRAM besser zugänglich und kann die Leistung von KI-Reasoning-Arbeitslasten verbessern.

Wenn der Chip enthüllt wird, könnte dies ein großer Schritt nach vorne für das Chip-Unternehmen und KI-geschulte Modelle sein. Allerdings warf Sid Sheth, Gründer und CEO von d-Matrix, bei der möglichen Einführung Schatten auf die Entwicklung. Er bemerkte, dass NVIDIA zwar klarer Marktführer im KI-Training ist, die Inferenz jedoch eine völlig andere Landschaft darstellt. Er teilte mit: „Entwickler können auf Wettbewerber neben NVIDIA zurückgreifen, da das Ausführen fertiger KI-Modelle nicht die gleiche Art der Programmierung erfordert wie deren Training.“ 

Trotzdem machen auch andere Tech-Giganten Fortschritte in der Inferenz-Berechnung. Meta stellte diese Woche vier Prozessoren vor, die speziell für die Inferenz entwickelt wurden, was einen Investor aus Silicon Valley dazu veranlasste zu sagen, die Branche könnte in eine Phase eintreten, die nicht mehr „von NVIDIA dominiert“ ist.

Jüngst warnte June Paik, Chief Executive von FuriosaAI, einem NVIDIA-Rivalen, im Kommentar zum Vorteil der einfach bereitstellbaren Inferenz-Berechnung, dass die meisten Rechenzentren die neuesten flüssigkeitsgekühlten GPUs nicht unterbringen können.

Trotz seiner Bedenken erwarten die Analysten der Bank of America, dass Inferenz-Arbeitslasten bis 2030, wenn der Markt etwa 1,2 Billionen US-Dollar erreichen wird, 75 % der KI-Rechenzentrumsausgaben ausmachen werden, im Vergleich zu etwa 50 % im Vorjahr. Ben Bajarin, ein Technologieanalyst bei Creative Strategies, behauptete ebenfalls, dass Rechenzentren der Zukunft nicht einem Einheitsmodell entsprechen werden, und prognostizierte, dass Unternehmen unterschiedliche Ansätze für die Chip- und Facility-Entwicklung wählen werden.

NVIDIA wird voraussichtlich die Vera-Rubin-Chips später in 2026 veröffentlichen

NVIDIA hat kürzlich auch seine Next-Gen-KI-Chips, die Vera-Rubin-KI-Chips, auf den Markt gebracht, in der Erwartung, dass der Aufstieg von Reasoning-KI-Plattformen wie DeepSeek noch größere Rechenanforderungen auslösen wird. Es behauptete, die Chips würden helfen, größere KI-Modelle zu trainieren und einem breiteren Nutzerkreis anspruchsvollere Ausgaben zu liefern. 

Laut Huang wird Rubin auch in der zweiten Hälfte von 2026 auf den Markt kommen, wobei eine High-End-„Ultra“-Version im Jahr 2027 folgen wird.

Er erklärte auch, dass ein einzelnes Rubin-System 576 einzelne GPUs in einem einzigen Chip kombinieren würde. Derzeit gruppiert NVIDIAs Blackwell-Chip in seinem NVL72-System 72 GPUs, was bedeutet, dass Rubin über fortschrittlichere Speicher verfügen wird.

Wenn Sie dies lesen, sind Sie bereits einen Schritt voraus. Bleiben Sie mit unserem Newsletter auf dem Laufenden.

Diesen Artikel teilen
Nellius Irene

Nellius Irene

Nellius ist Absolventin der Betriebswirtschaftslehre und Informatik mit fünf Jahren Erfahrung in der Kryptowährungsbranche. Sie hat zudem Bitcoin Dada absolviert. Nellius hat bereits für führende Medienpublikationen wie BanklessTimes, Cryptobasic und Riseup Media geschrieben.

MEHR … NACHRICHTEN