Meer leren over AI?
AI inzetten voor je team? In onze trainingen leer je het in 4 uur.
Dennis Claassen
AI-trainer · 35+ teams getraind
Key Takeaways
- •21 juli 2026: NVIDIA bevestigt in een press briefing dat Vera Rubin NVL72-systemen nu actief worden geleverd aan klanten waaronder OpenAI (Q3 2026), CoreWeave en Azure. Acht cloudpartners zijn beschikbaar (NVIDIA Newsroom).
- •10x lagere tokenkosten vs de vorige generatie Grace Blackwell — en 10x meer tokens per megawatt. Gemeten door CoreWeave op een DeepSeek R1-werklast (CoreWeave blog).
- •NVL72-rack: 72 Rubin GPU's + 36 Vera CPU's = 3,6 EFLOPS inferentierekenkracht. Elk GPU: 288 GB HBM4 met 22 TB/s bandbreedte — bijna driemaal de bandbreedte van een Blackwell-GPU (8 TB/s).
- •Microsoft + Mistral sloten op dezelfde dag een miljardeninvestering in Europese AI-infrastructuur met duizenden NVIDIA Vera Rubin GPU's — gericht op bedrijven en gereguleerde sectoren (Microsoft Source).
- •Voor Nederlandse bedrijven: AI-tokenkosten dalen structureel zodra Vera Rubin breed in productie is. Businesscases die nu net niet rendabel zijn, worden dat — bereken dit effect nu, zodat u klaar bent voor het beslismoment.
Stel dat u vorig jaar een AI-project hebt berekend. Automatisch contracten beoordelen, klanttickets samenvatten, rapporten opstellen. U trok de getallen door: x duizend tokens per dag, y cent per duizend tokens, netto besparing z. En het haalde de grens nét niet. Een kwart minder kosten had het over de streep getrokken. Dus bleef het bij een pilot.
Op 21 juli 2026 werden twee aankondigingen gedaan die die grens opschuiven.
Wat er op 21 juli 2026 is aangekondigd
NVIDIA Vera Rubin NVL72: van aankondiging naar productie
NVIDIA kondigde op 31 mei 2026 (GTC Taipei) formeel aan dat Vera Rubin NVL72 in volledige productie gaat (NVIDIA Newsroom). Op 21 juli bevestigde Ian Buck, NVIDIA's VP Accelerated Computing, in een press briefing op het NVIDIA-hoofdkantoor dat systemen nu actief worden geleverd aan klanten waaronder OpenAI (grootschalige inzet Q3 2026), CoreWeave, Google Cloud, Microsoft Azure en Meta (The Next Web).
Acht cloudpartners zijn beschikbaar: AWS, Microsoft Azure, Google Cloud, Oracle, CoreWeave, Lambda, Nebius en Nscale.
Vera Rubin is de opvolger van Grace Blackwell (GB200), de generatie die in 2024-2025 de industriestandaard werd voor AI-training en -inferentie. NVL72 pakt 72 Rubin GPU's en 36 Vera CPU's in één rack-scale systeem, met 3,6 EFLOPS aan inferentierekenkracht. Elk GPU heeft 288 GB HBM4-geheugen met 22 TB/s geheugenbandbreedte — bijna driemaal de bandbreedte van een Blackwell-GPU (8 TB/s).
De relevante benchmark: CoreWeave testte Vera Rubin NVL72 op een DeepSeek R1-werklast en mat 10x meer tokens per megawatt bij gelijke responstijd versus de Grace Blackwell NVL72 (CoreWeave). NVIDIA claimt daarmee ook 10x lagere kostprijs per miljoen tokens ten opzichte van de vorige generatie.
Een kanttekening die eerlijkheid vereist: die 10x-factor is een benchmark op een specifieke werklast (DeepSeek R1) bij een specifiek vermogensbudget (150 MW). In de praktijk hangt de kostenreductie af van het type AI-taak, de bezettingsgraad van het datacenter en de prijsstelling van cloudproviders. De richting is helder; de exacte factor in uw situatie zal variëren.
Microsoft + Mistral: Europese AI-infrastructuur met Vera Rubin-chips
Op diezelfde dag sloten Microsoft en Mistral een uitbreiding van hun strategisch partnerschap met een multimiljarden-investering in Europese AI-infrastructuur. Mistral voegt rekencapaciteit toe — gedragen door duizenden NVIDIA Vera Rubin GPU's — als gedeeld platform voor training, inferentie en grootschalige deployment in Europa (Microsoft Source; Data Center Dynamics).
Het gaat om meer dan chips alleen. De deal combineert:
- •Europese GPU-capaciteit op basis van Vera Rubin
- •Mistral-modellen in Microsoft Foundry en Copilot Studio — beschikbaar voor enterprise-klanten
- •Azure Local — deployment op klant-beheerde hardware, buiten Microsoft-datacenters
- •Volledig geïsoleerde omgevingen zonder internetverbinding, voor de hoogst gereguleerde sectoren
De focus ligt expliciet op sovereign AI: bedrijven en overheden die controle willen over wáár en hoe AI draait. Dat is een directe reactie op de groeiende Europese vraag naar dataregie — versterkt door de EU AI Act en de AVG.
Wat dit technisch inhoudt — in gewone taal
U hoeft de chiparchitectuur niet te begrijpen om de impact te vatten. Het gaat om drie dingen:
Meer output per energieeenheid. Datacenters worden begrensd door stroom. Hoeveel watt mag er naar het gebouw? Hoe meer AI-berekeningen je per watt kunt doen, hoe meer capaciteit er beschikbaar is — en hoe lager de marginale kosten per token worden.
Lagere variabele kosten bij cloudproviders. Cloudproviders betalen voor stroom, hardware-afschrijving en operationele kosten. Als hun hardware 10x efficiënter wordt, daalt hun kostenbasis. Dat werkt uiteindelijk — na vertraging en met winstmarges van de provider — door in de prijzen die u betaalt.
Meer capaciteit voor hetzelfde geld. Dezelfde investering in Vera Rubin-hardware levert significant meer tokens op dan Blackwell. Voor providers met capaciteitsdruk (die er nu massaal zijn) betekent dit snellere uitbreiding van het aanbod, wat ook prijsdruk geeft.
Wat dit betekent voor Nederlandse bedrijven
Laten we concreet zijn over wat er wél en niet verandert.
Wat er verandert
Uw AI-businesscase wordt gunstiger. Als u AI inzet via API's (Anthropic, OpenAI, Google) of via Azure AI Studio, betaalt u per token. Die prijs zal de komende maanden dalen — niet abrupt, maar geleidelijk naarmate Vera Rubin-capaciteit bij cloudproviders operationeel wordt. H2 2026 is de verwachte periode voor brede beschikbaarheid (NVIDIA Newsroom).
Concreet: als u nu een AI-toepassing overweegt die bij huidige tokenkosten net niet rendeert, is het verstandig om die berekening over zes tot twaalf maanden opnieuw te maken — of nu al rekening te houden met 20-40% lagere variabele kosten als conservatieve aanname.
Europese AI-infrastructuur wordt serieuzer. De Microsoft-Mistral-deal voegt Europese GPU-capaciteit toe met Vera Rubin — voor Azure-gebruikers in Nederland een relevante uitbreiding. Het sovereign cloud-aanbod (Azure Local, volledig geïsoleerde omgevingen) maakt het voor gereguleerde sectoren als zorg, overheid en financiële dienstverlening concreter om zware AI-werklasten in Europa te houden.
Sovereign AI wordt een product, geen belofte. "Uw data blijft in Europa" klinkt al een tijdje. Maar de combinatie van Vera Rubin-rekenkracht in Europese datacenters, Mistral-modellen (een Europees bedrijf) en Azure Local-deployment geeft dat nu ook infrastructurele inhoud. Dat is relevant voor elke Nederlandse organisatie die te maken heeft met de EU AI Act, AVG of sectorale toezichthouders die vragen stellen over dataregie.
Wat er niet verandert
De prijzen gaan niet morgen door de helft. Cloudproviders schrijven hardware af over jaren. Ze bewegen hun tarieven zelden in grote stappen. Verwacht geen schokdaling in uw volgende factuur. De beweging is structureel, maar gradueel.
Goedkopere tokens lossen geen implementatieproblemen op. De meeste Nederlandse bedrijven worstelen niet met tokenkosten, maar met implementatie: weerstand van medewerkers, onduidelijk AI-beleid, gebrek aan kennis over wanneer AI wél en niet inzetten. Goedkopere infrastructuur maakt die vraagstukken niet kleiner.
Vendor lock-in verschuift niet. U bent na dit nieuws niet minder afhankelijk van NVIDIA — integendeel, Vera Rubin versterkt NVIDIA's positie. En als u op Azure zit voor AI, blijft u op Azure zitten. De sovereign cloud-aanpak biedt iets meer flexibiliteit, maar lost geen fundamenteel lock-in-vraagstuk op.
Info
Rekenregel voor uw businesscase: reken vandaag met huidige tokenkosten. Voeg een tweede kolom toe met 30% kostenreductie als aanname voor 2027. Als het project in dat scenario wél rendeert, is dit het moment om de pipeline te bouwen en de integratie te testen — zodat u klaar bent zodra de prijzen daadwerkelijk dalen.
Wanneer voelen Nederlandse bedrijven dit?
De verwachte tijdlijn:
- •H2 2026: Eerste Vera Rubin-instanties bij AWS, Azure, Google Cloud en Oracle live. Initieel voor grote klanten en research-partners.
- •Begin 2027: Breder beschikbaar; impact op standaard token-API-prijzen begint zichtbaar te worden.
- •2027-2028: Structurele prijsdaling bij meerdere aanbieders naarmate Blackwell-hardware wordt afgeschreven en Vera Rubin de norm wordt.
Of dit schema klopt, hangt af van leveringsketens, vraag en bezettingsgraden. De acht genoemde cloudpartners hebben al werkende Vera Rubin-racks draaien — die capaciteit schalen ze nu op.
De bredere context: twee aankondigingen, één patroon
Dat NVIDIA en Microsoft+Mistral op exact dezelfde dag publiceerden, is geen toeval. Beide aankondigingen maken deel uit van een bredere verschuiving in de AI-infrastructuurmarkt: van schaarste naar beschikbaarheid.
In 2023-2024 was het probleem: er zijn niet genoeg GPU's. Iedereen betaalde mee aan die schaarste. In 2025-2026 komen Blackwell-systemen op grote schaal online, en nu al wordt de volgende generatie (Vera Rubin) in productie genomen. De krapte lost op. En als de krapte oplost, dalen de kosten.
Voor Nederlandse bedrijven is dat goed nieuws — maar het betekent ook dat de concurrentie die nu al AI integreert, dat straks goedkoper kan. Het moment om te bouwen is niet wanneer de kosten laag genoeg zijn: het moment is nu, zodat u een vroegere leercurve hebt dan uw concurrent die wacht tot het "evident rendabel" is.
Bronnen
- •NVIDIA Newsroom — Vera Rubin Ramps Into Full Production (21 juli 2026)
- •CoreWeave blog — First-Ever Measured Vera Rubin NVL72 Silicon Performance Stats
- •Microsoft Source — Microsoft en Mistral breiden strategisch partnerschap uit (21 juli 2026)
- •Data Center Dynamics — Microsoft to spend billions on GPUs shared with Mistral
- •HPCwire/BigDataWire — Microsoft and Mistral Expand AI Partnership
Veelgestelde vragen
Wat is NVIDIA Vera Rubin NVL72?
NVIDIA Vera Rubin NVL72 is NVIDIA's volgende generatie AI-chipplatform, op 21 juli 2026 in volledige productie gegaan. Een NVL72-rack combineert 72 Rubin GPU's en 36 Vera CPU's tot 3,6 EFLOPS inferentierekenkracht. Elk GPU heeft 288 GB HBM4-geheugen met 22 TB/s bandbreedte — bijna driemaal de bandbreedte van de vorige Blackwell-generatie. Het platform vervangt de Grace Blackwell (GB200) als industriestandaard voor AI-training en -inferentie.
Hoe veel goedkoper worden AI-tokens met NVIDIA Vera Rubin?
NVIDIA en CoreWeave claimen 10x lagere kostprijs per miljoen tokens ten opzichte van Grace Blackwell NVL72, gebaseerd op een benchmark met DeepSeek R1 bij gelijke responstijd en vermogenbudget. In de praktijk hangt de kostenreductie af van het type AI-werklast en de prijsstelling van cloudproviders. Een conservatieve aanname voor uw businesscase is 20-40% kostenreductie op token-API's in de periode 2027-2028, naarmate Vera Rubin-capaciteit breed beschikbaar wordt en providers hun tarieven aanpassen.
Wanneer zijn NVIDIA Vera Rubin-instanties beschikbaar bij Azure, AWS of Google Cloud?
Vera Rubin NVL72-systemen draaien al bij de eerste acht cloudpartners: AWS, Microsoft Azure, Google Cloud, Oracle Cloud, CoreWeave, Lambda, Nebius en Nscale. Brede beschikbaarheid voor standaard enterprise-klanten wordt verwacht in H2 2026. Google Cloud kondigde A5X-instanties op Vera Rubin NVL72 aan als een van de eerste commerciële aanbiedingen. Verwacht dat dit uitbreidt in de loop van 2027.
Wat is de Microsoft-Mistral sovereign AI-deal van 21 juli 2026?
Op 21 juli 2026 sloten Microsoft en Mistral een uitgebreid strategisch partnerschap met een multimiljarden-investering in Europese AI-infrastructuur. Mistral voegt duizenden NVIDIA Vera Rubin GPU's toe als shared compute voor training, inferentie en deployment. De deal omvat: Mistral-modellen in Microsoft Foundry en Copilot Studio, Azure Local-deployment op klant-beheerde hardware, en volledig geïsoleerde omgevingen voor gereguleerde sectoren. Het is de Europese invulling van sovereign AI: controle over wáár en hoe AI draait, relevant voor bedrijven en overheden die te maken hebben met de EU AI Act en AVG-vereisten.
Wat moet ik als Nederlands bedrijf nu met NVIDIA Vera Rubin doen?
Directe actie is niet nodig — u koopt geen chips. Wat wel verstandig is: herbereken uw AI-businesscase met een tweede scenario dat uitgaat van 30% lagere tokenkosten in 2027. Als uw AI-project in dat scenario wél rendabel is, gebruik de komende maanden dan om de pipeline te bouwen en integraties te testen. Zo bent u klaar zodra de prijzen daadwerkelijk dalen. Kiest u voor Microsoft Azure als AI-platform, hou dan de A5X Vera Rubin-instanties in de gaten voor grootschalige inferentiewerklasten.

