NVIDIA Rubin CPX får HBM4 hukommelse i nyt design
NVIDIA har genoplivet Rubin CPX-projektet med et markant skift fra GDDR7 til 168 GB HBM4 hukommelse. For danske virksomheder betyder det en ekstremt kraftfuld accelerator dedikeret til prefill-opgaver i store AI-modeller, men det kræver også en omfattende investering i specialiseret rack-infrastruktur og køling.
Hovedpunkter
- Rubin CPX skifter fra 128 GB GDDR7 til 168 GB HBM4 hukommelse for at øge båndbredden markant.
- Hardwaren er specialiseret til prefill-opgaver, mens standard Rubin GPU'er håndterer decode-fasen.
- Systemet kræver en 1:1 ratio mellem CPX og decode-GPU'er for optimal ydeevne.
- Produktionen af den nye HBM4-version forventes ifølge Ming Chi Kuo at starte i første kvartal af 2027.
Kort svar
NVIDIA har ifølge Ming Chi Kuo redesignet Rubin CPX til at bruge 168 GB HBM4 hukommelse i stedet for de planlagte 128 GB GDDR7. Dette gør chippen i stand til at håndtere massive prefill-arbejdsbelastninger og KV cache for LLM'er med trillioner af parametre. For danske købere betyder det, at hardwaren flyttes fra et budgetorienteret segment til den absolutte high-end enterprise-klasse, hvilket kræver dedikerede MGX ETL racks og avanceret væskekøling.
Anbefalede produkter 2026
| Produkt | Pris | Lager | |
|---|---|---|---|
| 7.212,- DKK | På lager - leveringstid: 2-3 hverdage, ved bestilling inden kl. 14.00 | Se produkt | |
| 68.000,- DKK | Ikke på lager, forventet levering ved bestilling 10/10-2026 | Se produkt | |
| 6.396,- DKK | På lager hos leverandør - leveringstid: 12-13 hverdage | Se produkt | |
| 22.780,- DKK | Ikke på lager, forventet levering ved bestilling 08/10-2026 | Se produkt |
Hvad er nyheden om NVIDIA's Rubin CPX med HBM4 hukommelse?
NVIDIA har ifølge supply chain-analytikeren Ming Chi Kuo genoplivet projektet for Rubin CPX, som tidligere havde været sat på pause. Den væsentligste ændring er et komplet skift i hukommelsesarkitekturen; hvor den oprindelige plan var at benytte 128 GB GDDR7-hukommelse, vil den nye version i stedet blive udstyret med 168 GB HBM4 (High Bandwidth Memory 4). Denne ændring kræver et redesign af chippakken, hvor NVIDIA forventes at anvende TSMC's CoWoS-S eller CoWoS-L teknologier til integrationen.
Ifølge de foreliggende oplysninger er Rubin CPX ikke en generel GPU, men en specialiseret accelerator designet til agentiske AI-arbejdsbelastninger. Den er specifikt målrettet prefill-opgaver, hvilket betyder, at den håndterer input-konteksten for LLM'er (Large Language Models) og processeringen af KV cache (Key-Value cache). Ved at separere prefill fra decode-opgaver kan systemet levere tokens hurtigere til slutbrugeren. Hardwaren leveres i separate racks med konfigurationer fra 64 til 256 selvstændige CPX-GPU'er per rack, og en enkelt chip meldes at levere 30 PetaFLOPS beregningsydelse baseret på NVFP4-formatet på en monolithic die.
Hvilke tekniske forbedringer bringer skiftet til HBM4?
Skiftet fra GDDR7 til HBM4 betyder i praksis et massivt spring i hukommelsesbåndbredde og kapacitet, hvilket er kritisk for modeller med billioner af parametre. Mens GDDR7 er hurtigere end tidligere generationer, kan den ikke matche den vertikale stabling og direkte integration, som HBM4 tilbyder via CoWoS-pakningen (Chip on Wafer on Substrate). Dette gør det muligt at håndtere langt større kontekstvinduer uden at ramme flaskehalse i dataoverførslen mellem hukommelse og kerne.
| Egenskab | Betydning i praksis |
|---|---|
| 168 GB HBM4 | Muliggør håndtering af enorme KV caches og længere kontekstvinduer for LLM'er. |
| 30 PetaFLOPS NVFP4 | Ekstremt høj beregningskraft til præcision i AI-inferens på en enkelt chip. |
| Integrerede NVENC/NVDEC | Fire encodere og decodere direkte på chippen fjerner behovet for ekstern videoprocessing. |
| CoWoS-S/L Pakning | Avanceret 3D-pakning fra TSMC, der sikrer minimal latenstid mellem HBM4 og GPU-die. |
For at forstå værdien skal man se på opdelingen af inferens. Prefill er den fase, hvor modellen læser hele input-prompten; her er båndbredde altavgørende. Decode er fasen, hvor tokens genereres ét efter ét. Ved at dedikere Rubin CPX til prefill og standard Rubin GPU'er til decode, undgår man, at én proces blokerer for den anden, hvilket resulterer i en mere flydende brugeroplevelse.
Hvordan adskiller prefill- og decode-opgaver sig teknisk?
Skellet mellem prefill og decode er fundamentalt for moderne AI-arkitektur, da de to faser har vidt forskellige krav til hardwaren. Prefill er beregningstung (compute-bound) og kræver massiv båndbredde for at indlæse prompten hurtigt, mens decode er hukommelsesbegrænset (memory-bound), da den genererer tokens sekventielt. Ved at bruge Rubin CPX specifikt til prefill kan NVIDIA optimere hardwaren til netop denne flaskehals.
| Fase | Primært fokus | Hardware-krav (Rubin økosystem) |
|---|---|---|
| Prefill | Input-kontekst & KV cache | Rubin CPX med HBM4 |
| Decode | Token-generering (output) | Standard Rubin GPU |
Denne disaggregerede inferensmodel betyder, at man ikke længere behøver at kompromittere ydeevnen på tværs af hele processen.
Hvilke konfigurationer findes for MGX ETL racks?
Implementeringen af Rubin CPX sker ikke via enkelte kort, men gennem MGX ETL (Enterprise Technology Layer) racks. Disse systemer er designet til at skalere efter modellens størrelse og den forventede belastning. Valget af antal GPU'er per rack har direkte indflydelse på, hvor mange parametre en model kan køre effektivt uden ekstrem latenstid.
| Konfiguration | Antal CPX-GPU'er | Typisk anvendelse |
|---|---|---|
| Mindre Enterprise | 64 GPU'er per rack | Mellemstore LLM'er med moderate kontekstkrav. |
| High-Scale AI | 128-256 GPU'er per rack | Trillion-parameter modeller og massive agentiske arbejdsbelastninger. |
Det er vigtigt at bemærke, at skaleringen ikke kun handler om rå kraft, men om at matche mængden af HBM4-hukommelse med modellens behov for KV cache. Jo flere GPU'er i racket, desto større bliver den samlede hukommelsespool, hvilket reducerer behovet for at flytte data mellem forskellige noder i datacentret.
Hvilke strøm- og kølekrav stiller et Rubin CPX rack?
Overgangen til HBM4 og monolithic dies med 30 PetaFLOPS beregningsydelse medfører en drastisk stigning i energiforbruget. Et fuldt udstyret MGX ETL rack kræver specialiseret infrastruktur, da traditionel luftkøling ikke længere er tilstrækkelig til at fjerne den varme, som disse tætpakkede acceleratorer genererer under fuld belastning.
| Komponent | Krav / Specifikation | Anbefalet løsning |
|---|---|---|
| Køling | Ekstremt høj termisk belastning | Direkte væskekøling (DLC) eller immersion cooling. |
| Strømforsyning | Høj TDP per chip | Enterprise-grade PDU'er med høj ampere-kapacitet. |
| Kabling | Ultra-lav latenstid | NVLink-interconnects i højeste generation. |
Virksomheder, der planlægger en opgradering til Rubin CPX, bør derfor først auditere deres datacenter for at sikre, at strømdistributionen kan håndtere de nye racks. Manglende investering i køling vil føre til termisk throttling, hvilket vil eliminere den hastighedsgevinst, som HBM4-hukommelsen bringer.
Hvordan sammenligner GDDR7 og HBM4 sig teknisk?
Forskellen mellem GDDR7 (Graphics Double Data Rate 7) og HBM4 (High Bandwidth Memory 4) er ikke blot hastighed, men arkitektur. Mens GDDR7 placeres omkring GPU'en på printpladen, stables HBM4 vertikalt og forbindes direkte til chippen via et interposer-lag. Dette reducerer den fysiske afstand, data skal rejse, hvilket sænker strømforbruget per overført bit og øger båndbredden eksponentielt.
| Specifikation | GDDR7 (Oprindelig plan) | HBM4 (Ny version) |
|---|---|---|
| Kapacitet per enhed | 128 GB | 168 GB |
| Arkitektur | Diskret hukommelse (PCB) | Stakket 3D-hukommelse (In-package) |
| Båndbredde | Høj | Ultra-høj |
| Integration | Standard monteret | CoWoS-S/L pakning |
For en dansk køber betyder dette skift, at produktet er flyttet fra at være en 'prisbevidst' accelerator til at være et high-end instrument. HBM4 er væsentligt dyrere at producere end GDDR7, hvilket placerer Rubin CPX i den absolutte top af prisklassen for AI-hardware.
Hvordan ser dansk pris og tilgængelighed ud for Rubin CPX?
For danske virksomheder betyder lanceringen af Rubin CPX, at man skal planlægge efter en infrastrukturinvestering i den absolutte topklasse. Da produktet leveres som rack-løsninger (MGX ETL racks) og ikke som enkelte kort til eksisterende servere, er tale om et komplet datacenter-setup.
Det er vigtigt at bemærke, at dette ikke er et produkt til mindre virksomheder eller standard workstation-brugere. Prisklassen ligger i det højeste enterprise-segment, hvor omkostningerne ikke kun dækker hardwaren, men også den massive strømforsyning og køling, som HBM4-baserede systemer kræver. For aktuel pris og lagerstatus på tilgængelige AI-acceleratorer henvises til produktkarrusellen ved artiklen.
| Prisklasse | Forventet dansk tilgængelighed | Kompatibilitet |
|---|---|---|
| Ultra-high-end Enterprise | Forventet 2027 (efter 1Q27 produktion) | MGX ETL Racks / Rubin Decode GPU'er |
Kompatibilitetsmæssigt kræver Rubin CPX en stram integration. NVIDIA anbefaler specifikt et 1:1 forhold mellem CPX-enheder og standard Rubin GPU'er i decode-racket for at undgå flaskehalse. Hvis man kun investerer i CPX uden tilsvarende decode-kapacitet, vil systemet være ude af balance, da prefill-fasen vil køre hurtigere, end tokens kan genereres.
Typiske fejl ved valg af Rubin CPX
Ved implementering af så specialiseret hardware som Rubin CPX er der flere kritiske faldgruber, som kan føre til dyre fejlindkøb eller ineffektive systemer.
- Manglende balance mellem Prefill og Decode: Den største fejl er at købe CPX-enheder uden at opretholde NVIDIA's anbefalede 1:1 ratio til standard Rubin GPU'er. Dette skaber en ubalance, hvor prefill-kapaciteten overstiger decode-hastigheden, hvilket gør den ekstra investering i HBM4 spildt.
- Undervurdering af strøm og køling: Skiftet fra GDDR7 til HBM4 og brugen af monolithic dies med 30 PetaFLOPS beregningsydelse øger strømkravene markant. Virksomheder begår ofte den fejl at tro, at eksisterende rack-infrastruktur kan håndtere de nye MGX ETL racks uden opgradering af kølesystemet (fx til væskekøling).
- Forveksling med generelle GPU'er: Rubin CPX er ikke en erstatning for standard AI-GPU'er, men et supplement. At forsøge at bruge CPX til generelle træningsopgaver eller ren decode vil være ineffektivt, da chippen er optimeret specifikt til prefill og KV cache processing.
- Ignorering af rack-skalering: Da systemet konfigureres fra 64 til 256 GPU'er per rack, kan man risikere at underdimensionere sit setup i forhold til de modeller (LLM'er), man ønsker at køre. Modeller med billioner af parametre kræver den øvre ende af rack-skalaen for at udnytte HBM4-kapaciteten fuldt ud.
- Manglende software-stack validering: En hyppig fejl er ikke at sikre, at CUDA-versioner og orkestreringssoftware (som Kubernetes eller NVIDIA Triton) er opdateret til at understøtte disaggregeret inferens, hvilket kan føre til, at hardwaren kører i en suboptimal kompatibilitetsmode.
- Oversett overgang fra luft- til væskekøling: Mange danske datacentre er bygget til luftkøling. At installere Rubin CPX uden at have etableret et lukket vandloop eller immersion cooling-infrastruktur vil føre til øjeblikkelig termisk throttling og potentielt hardwarenedbrud.
Ofte stillede spørgsmål
Hvad er forskellen på Rubin CPX og en standard Rubin GPU?
Hvilken køling kræver et Rubin CPX rack?
Hvad er den anbefalede ratio mellem CPX og decode-GPU'er?
Hvornår kan man forvente, at Rubin CPX bliver tilgængelig?
Hvad er KV cache, og hvorfor er HBM4 vigtig her?
Kan Rubin CPX bruges til træning af AI-modeller?
Hvad betyder skiftet til HBM4 for NVIDIA Rubin CPX?
- Det betyder en stigning i hukommelseskapacitet fra 128 GB GDDR7 til 168 GB HBM4 og et redesign af chippakken via TSMC CoWoS.
- Praktisk betyder det markant højere båndbredde til prefill-opgaver, hvilket muliggør hurtigere behandling af enorme AI-kontekster.