Zum Hauptinhalt Zur Navigation Zur Suche

Auf Inferenz angepasste Hardware

OpenAI hat bei Jalapeño einige interessante Design-Entscheidungen getroffen: So unterstützen die Matrixeinheiten keine Berechnungen mit 16-Bit-Gleitkommadatentypen (FP16). Das vereinfacht die Logik und entspricht dem Trend zu stärker quantisierten Modellen. 64- und 32-Bit-Datentypen unterstützen lediglich die zusätzlich vorhandenen Skalar- und Vektoreinheiten. Letztere sind allerdings auch auf 32-Bit-Berechnungen beschränkt.

Bei der FP8- und FP4-Rechenleistung liegt OpenAIs Chip mit 3,4 und 13,4 PFlops hinter Nvidias Blackwell (5 und 15 PFlops). Dafür bekommt der Chip sechs HBM4-Stacks, was eine mit 15,4 statt 8 TByte/s fast doppelt so hohe Speicherbandbreite im Vergleich zu Blackwell ermöglicht.

Dank acht Stacks kommen Blackwell und Rubin allerdings mit 288 GByte auf eine höhere Kapazität, Jalapeño stehen nur 216 GByte zur Verfügung. Die TDP des Chips liegt bei 700 W, laut OpenAI benötigt er im Betrieb im Mittel aber nur 550 W.

Interessant ist die Speicherhierarchie: OpenAI teilt den Chip in 64 Rechengruppen, denen jeweils ein Teil des HBM fest zugeordnet ist. Das reduziert die Latenz, schränkt allerdings die Flexibilität ein. Verbunden sind die Gruppen über je ein Network-on-Chip (NoC) für kollektive Operationen und sonstige Kommunikation. Wie viele andere dedizierte KI-Beschleuniger auch setzt Jelapeño auf ein systolisches Array, bei dem Zwischenergebnisse direkt zwischen den Recheneinheiten weitergegeben werden.

Mehr Chips pro Rack als Nvidia

Bekanntlich ist ein Chip aber bei Frontier-Modellen nichts, weshalb OpenAI auch ein Rack-System mit entworfen hat. Dabei gehören je zwei Racks zusammen: eines mit 16 CPU-Servern, in denen jeweils zwei Epyc 9005 (Turin) mit 1,5 TByte RAM verbaut sind, und eines mit ebenso vielen Jalapeño-Trays.

In jedem der 1-HE-Server sind acht Chips verbaut – insgesamt 128 pro Rack. Bis zu 2.048 Chips können zu einer Scale-up-Domäne verbunden werden. Im Rack sind die Chips mit einer Bandbreite von je 4,8 TBit/s verbunden, zwischen den Racks mit 1,6 TBit/s. Dabei kommen Tomahawk-6-Switches von Broadcom zum Einsatz.

Anders als insbesondere Nvidia sieht OpenAI keine spezialisierten Chips für Prefill- und Decode-Stufe vor. Eine pragmatische Entscheidung, schreibt Semianalysis: Das sinnvolle Verhältnis der jeweiligen Chips hänge stark vom Modell ab, was getrennte Chip-Pools ineffizienter machen könne.

Die Serienfertigung von OpenAIs Chip soll allerdings erst 2027 anlaufen. Bislang sind nur Engineering-Samples verfügbar, während Nvidia sein Vera-Rubin-System bereits ausliefert. Allerdings sind laut OpenAI bereits zwei neue Hardware-Generationen in Arbeit.


Relevante Themen