Nvidias Groq 3 LPX-Inferenzbeschleuniger geht in die Serienproduktion

2026-08-25 14:22
Merken

de.wedoany.com-Bericht: Am 24. August gab Nvidia auf der Hot-Chips-2026-Konferenz bekannt, dass der speziell für KI-Agenten-Inferenz entwickelte Groq-3-LPX-Beschleuniger die Serienproduktion erreicht hat. Dies markiert die kommerzielle Umsetzung des ersten Produkts, nachdem das Unternehmen im Dezember 2025 für 20 Milliarden US-Dollar eine Lizenz für die Groq-Chip-Technologie erworben hatte.

Der Groq 3 LPX ist der spezialisierte Inferenzbeschleuniger der Nvidia-Vera-Rubin-Datenplattform und konzentriert sich auf die „Dekodierungsphase" der KI-Inferenz – die entscheidende Phase, die die Token-Erzeugungsrate bestimmt. Ein einzelnes LPX-Rack integriert 256 Groq-3-LPU-Beschleuniger, verfügt über 128 GB On-Chip-SRAM und 640 TB/s Inter-Chip-Erweiterungsbandbreite, basiert auf der Nvidia-MGX-Rack-Architektur und ist vollständig flüssigkeitsgekühlt. Die Chips werden von Samsung Electronics gefertigt, was eine differenzierte Lieferkettenstrategie im Vergleich zu Nvidias GPUs (gefertigt von TSMC) darstellt.

In Benchmarks der Drittorganisation Artificial Analysis erreichte der Groq 3 LPX beim Ausführen des Open-Source-Modells Gemma 4 31B mit 100.000 Token langem Kontext eine Erzeugungsgeschwindigkeit von 3.400 Ausgabe-Token pro Sekunde. Nvidia bezeichnet dies als die schnellste dokumentierte Inferenzleistung für dieses Modell, die bei latenzempfindlichen Aufgaben viermal schneller ist als konkurrierende Plattformen.

Der KI-Cloud-Dienstleister Nebius hat sich als erster Bereitstellungskunde für den Groq 3 LPX verpflichtet und wird Entwicklern über die Nebius-Token-Factory-Inferenzplattform die extrem schnelle Token-Erzeugungsfähigkeit des Beschleunigers bereitstellen. Nvidias Senior Director Dion Harris erklärte, dass die Groq-Racks zusammen mit den Vera-Zentralprozessoren und Rubin-Grafikprozessoren bei Nebius bereitgestellt werden, mit einem geplanten Produktionsstart in der zweiten Jahreshälfte 2026. Nebius-CTO Danila Shtan sagte: „Die Erzeugung ist die Inferenzphase, die die Antwortgeschwindigkeit von KI-Systemen bestimmt – genau diese wird durch den Groq 3 LPX beschleunigt."

Nvidias Gründer und CEO Jensen Huang erklärte, dass die Vera-Rubin-Plattform durch den Groq 3 LPX eine optimierte Konfiguration von Rechenfabriken für das Zeitalter der KI-Agenten erreicht habe: „Dies verändert die Art und Weise, wie Intelligenz produziert wird, und stellt einen weiteren großen Sprung bei KI-Durchsatz, Effizienz und Reaktionsgeschwindigkeit dar."

Harris betonte, dass der Groq 3 LPX GPUs nicht ersetzen solle, sondern für bestimmte Workloads den optimalen Prozessor einsetze – GPUs übernehmen weiterhin Modelltraining und allgemeine Inferenz, während Groq-Chips sich auf die latenzempfindliche „Dekodierungsphase" konzentrieren. Nvidia gab außerdem bekannt, dass SpaceX sich als neuester Flaggschiff-Kunde der Vera-Rubin-Plattform verpflichtet hat und Vera-CPUs für CPU-intensive Orchestrierungs- und Simulationsaufgaben über Rechenzentren am Boden und Orbital-Satelliten hinweg einsetzen wird. Die Auslieferungen des Vera-Rubin-Systems, dessen Produktion Anfang 2026 anlief, werden beschleunigt.

Diese Kurznachricht stammt aus der Übersetzung und Weiterverbreitung von Informationen aus dem globalen Internet und von strategischen Partnern. Sie dient lediglich dem Austausch mit den Lesern. Bei Urheberrechtsverletzungen oder anderen Problemen bitten wir um rechtzeitige Mitteilung, und wir werden die notwendigen Änderungen oder Löschungen vornehmen. Die Weitergabe dieses Artikels ist ausdrücklich ohne formelle Genehmigung verboten.E-Mail: news@wedoany.com