Nieuws

Qwen3.8-27B: Alibaba's krachtigste open-weight AI draait nu op één RTX 4090

Op 14 augustus 2026 bracht Alibaba's Tongyi Lab Qwen3.8-27B uit als open-weight model onder Apache 2.0: 27,78 miljard parameters, multimodaal (tekst, afbeeldingen, video), 262.144-token contextvenster en sterke agentic benchmarks. Het model draait op een RTX 4090 met 4-bit kwantisatie. Voor Nederlandse bedrijven die AI lokaal willen inzetten — zonder data naar een cloudserver te sturen — is dit een serieuze optie om te beoordelen.

Dennis ClaassenDennis Claassen7 min lezen
Alibaba Qwen3.8-27B open-weight AI-model — uitgebracht 14 augustus 2026, 27,78B parameters, draait lokaal op RTX 4090 met Apache 2.0-licentie

Meer leren over AI?

AI inzetten voor je team? In onze trainingen leer je het in 4 uur.

Dennis Claassen

Dennis Claassen

AI-trainer · 35+ teams getraind

Bekijk trainingen

Key Takeaways

  • 14 augustus 2026, 15:00 UTC: Alibaba's Tongyi Lab brengt Qwen3.8-27B uit als open weights op Hugging Face en ModelScope — licentie: Apache 2.0, commercieel gebruik toegestaan (warp2search.net).
  • 27,78 miljard parameters (dense architectuur) — dit is een ander model dan Qwen3.8-Max, dat 2,4 biljoen MoE-parameters heeft en alleen via API beschikbaar is (kingy.ai).
  • Multimodaal: verwerkt tekst, afbeeldingen én video; contextvenster van 262.144 tokens — het grootste in zijn gewichtsklasse (yottalabs.ai).
  • Hardware-ondergrens: met 4-bit kwantisatie (Q4_K_M) past het model in 17–24 GB VRAM — een RTX 4090 of equivalente workstation-GPU volstaat (kingy.ai).
  • Agentic benchmarks (Alibaba-gerapporteerd): OSWorld-Verified 84,3 — dit overtreffen ze naar eigen zeggen Qwen3.6-27B (63,9) significant; onafhankelijke verificatie loopt nog (kingy.ai).
  • Eerlijke kanttekening: alle benchmarkcijfers zijn vooralsnog Alibaba's eigen rapportage; dezelfde voorzichtigheid geldt hier als bij de Qwen3.8-Max-lancering eerder deze maand.

Een advocatenkantoor wil intern AI gebruiken voor contractanalyse. De data is vertrouwelijk. Een cloudmodel is geen optie. Het kantoor heeft een workstation met een RTX 4090 staan. Tot voor kort was er geen open-source model dat sterk genoeg was voor dit soort taken op die hardware — tenzij je bereid was tot grote compromissen in kwaliteit.

Op 14 augustus 2026 veranderde dat.

Alibaba's Tongyi Lab bracht Qwen3.8-27B uit: een 27,78-miljard-parameters vision-language model, volledig open-weight onder Apache 2.0, met een contextvenster van 262.000 tokens en een reeks sterke agentic-taakcijfers. Het model past op één consumentenGPU en brengt frontier-klasse capaciteiten dichter bij lokale inzet dan eerder haalbaar was in deze gewichtsklasse.

Dit is de eerlijke beoordeling.

Qwen3.8-27B versus Qwen3.8-Max: twee compleet verschillende modellen

Verwarring is begrijpelijk: de naam "3.8" duidt op de modelgeneratie, niet op het parametertal. De twee modellen zijn fundamenteel anders.

Qwen3.8-27BQwen3.8-Max
Parameters27,78B (dense)2,4 biljoen (MoE, ~95B actief)
LicentieApache 2.0Apache 2.0 (weights komende weken)
ToegangDownload, lokaal draaienAPI + geplande open weights
Hardware24 GB VRAM (4-bit)Datacenter GPU's (>1 TB)
ModalitiesTekst, afbeeldingen, videoTekst
Contextvenster262.144 tokens128.000 tokens
Uitgebracht14 augustus 20263 augustus 2026

Qwen3.8-Max is Alibaba's frontier API-model — vergelijkbaar met Claude Fable 5 of GPT-5.6 Sol. Qwen3.8-27B is het open-weight model voor lokale inzet — vergelijkbaar in rol met Meta Muse Glimmer, dat wij eerder deze week bespraken.

Technische specs

EigenschapWaarde
Totale parameters27,78 miljard (dense)
Contextvenster262.144 tokens
ModalitiesTekst, afbeeldingen, video
Talen100+
VRAM (Q4_K_M kwantisatie)17–24 GB
VRAM (FP8 precisie)~48 GB
VRAM (BF16 volledig)~56 GB
LicentieApache 2.0
Uitgebracht14 augustus 2026
BeschikbaarHuggingFace, ModelScope

Bron: kingy.ai; yottalabs.ai.

Benchmarks: indrukwekkend, maar met de bekende kanttekening

Alibaba rapporteert grote verbeteringen ten opzichte van de vorige generatie (Qwen3.6-27B):

BenchmarkQwen3.6-27BQwen3.8-27B
Terminal-Bench 2.1 (agentic coding)63,473,0
DeepSWE 1.1 (softwaretaken)13,342,2
OSWorld-Verified (computer-use)63,984,3
SWE-MM (multimodale software)25,738,6

Bron: kingy.ai; yottalabs.ai.

Dit zijn vendor-gerapporteerde cijfers — Alibaba's eigen evaluaties. Onafhankelijke reproductie loopt nog. Dezelfde voorzichtigheid paste bij de Qwen3.8-Max-lancering, en is hier ook van toepassing. De sprongen zijn groot genoeg om serieus te nemen, maar niet klakkeloos over te nemen.

Wat opvalt: de OSWorld-Verified-score van 84,3 zou Qwen3.8-27B als lokaal model direct in de buurt brengen van Qwen3.8-Max (86,1) op computer-use — een formidabele claim voor een model dat op één GPU past.

Op welke hardware draait het?

Praktische inzetbaarheid hangt af van uw hardware:

24 GB VRAM (RTX 4090, RTX 5090, Mac Studio M4 Ultra): voldoende voor 4-bit kwantisatie. Q4_K_M-weights nemen 17–24 GB in beslag. Dit is de aanbevolen ondergrens voor productiegebruik (kingy.ai).

32–48 GB VRAM (workstation-GPU's, meerdere consumer-GPU's): comfortabele marge voor hogere quantisatieprecisie (Q6_K, Q8) — betere kwaliteit, hogere geheugeneis.

48–80 GB VRAM: FP8-precisie (~48 GB) of full BF16 (~56–80 GB) voor maximale kwaliteit — vereist professionele GPU-hardware (RTX 6000 Ada, A100, H100).

Normale laptop (8–16 GB VRAM): niet geschikt voor productieve inzet.

Een standaard werkstation met RTX 4090 kost anno augustus 2026 €2.500–€4.000. Dat is een eenmalige investering — geen lopende API-kosten.

Wat dit voor Nederlandse bedrijven betekent

Lokale verwerking: GDPR-voordeel in de praktijk

Apache 2.0 + lokale inzet betekent: de data verlaat uw infrastructuur niet. Er is geen verwerkersovereenkomst nodig met Alibaba, geen API-call naar buitenlandse servers, geen dataretentie bij een derde partij.

Dit is relevant voor:

  • Gezondheidszorg: patiëntendossiers, medische analyses
  • Juridisch: contracten, correspondentie, vertrouwelijke adviezen
  • Financiële dienstverlening: klantdata, kredietbeoordelingen, fraudedetectie
  • Overheid: gevoelige beleids- of persoonsdocumenten

Kanttekening: lokale verwerking vereenvoudigt de AVG-verwerkingsketen, maar garandeert geen volledige compliance op zichzelf. Medewerkers moeten getraind worden in wat ze mogen invoeren; ook lokale systemen vallen onder artikel 32 AVG (beveiligingsvereisten).

Geen API-kosten, maar wél hardware- en beheerkosten

Gratis model ≠ gratis inzet. Verwacht:

  • Aanschaf: €2.500–€4.000 voor een werkstation met RTX 4090
  • Energie: een RTX 4090 verbruikt 450–500W onder load — significant bij 24/7-gebruik
  • Beheer: modellen moeten worden beheerd, geüpdatet en geïntegreerd met uw workflow

Voor organisaties die al een geschikte workstation hebben en DevOps-capaciteit bezitten, zijn de drempelkosten laag. Voor organisaties zonder technische infra is een cloudmodel via een EU-gevestigde provider (zoals Azure NL of OVHcloud) vaak praktischer.

Vergelijking met Meta Muse Glimmer

Meta Muse Glimmer (10 augustus 2026, 30B, Apache 2.0) is de meest directe concurrent. Verschil in een oogopslag:

Qwen3.8-27BMeta Muse Glimmer
Contextvenster262.144 tokens131.072 tokens
OSWorld-Verified84,365,9
Terminal-Bench 2.173,0n.v.t.
Video-inputJaNee
VRAM (4-bit)17–24 GB24 GB

Op basis van de gerapporteerde cijfers scoort Qwen3.8-27B sterker op agentic en coding-taken. Muse Glimmer heeft het voordeel van een Westerse herkomst (Meta, VS) — relevant als uw risicobeleid Chinese technologie uitsluit.

Wat tegenvalt: eerlijke beperkingen

Chinese herkomst. Alibaba is een Chinees bedrijf. Dat is geen blokkade — de Apache 2.0-licentie geeft u de weights zonder beperking — maar voor organisaties in sectoren als defensie, overheid of kritieke infrastructuur kan een intern beleid de inzet van Alibaba-modellen uitsluiten. Apache 2.0 betekent geen inhoudelijke gebondenheid aan Alibaba, maar u moet dit beleid wel expliciet toetsen.

Vendor-benchmarks. Alle bovenstaande cijfers zijn Alibaba's eigen rapportage. De OSWorld-Verified-score van 84,3 is indrukwekkend, maar onafhankelijke reproductie ontbreekt op moment van publicatie. Wees terughoudend met beslissingen op basis van deze benchmarks alleen.

Geen fine-tuning-instructies bij release. De initiële open-weight release bevat de basisweights; fine-tuning-datasets en -recepten zijn nog niet gepubliceerd. Organisaties die specifieke domeinaanpassing willen, moeten wachten op aanvullende releases.

Knowledge cutoff. De cutoff van het model is niet publiek gespecificeerd bij release — vermoedelijk midden 2026. Voor taken met recente gebeurtenissen is het model minder betrouwbaar.

Conclusie

Qwen3.8-27B is een serieuze toevoeging aan de open-weight AI-markt. Het combineert een groot contextvenster (262K), multimodale input (tekst, afbeelding, video), sterk gerapporteerde agentic-capaciteiten en een Apache 2.0-licentie in een pakket dat op één consumentenGPU past.

Voor Nederlandse bedrijven in sectoren met gevoelige data — juridisch, medisch, financieel, overheid — is lokale inzet van dit model de moeite waard om te evalueren. De GDPR-voordelen van lokale verwerking zijn reëel; de drempelkosten zijn beheersbaar als de hardware al aanwezig is.

Voorbehoud: de benchmarks zijn vendor-supplied en onafhankelijke verificatie loopt nog. Kijk de komende weken naar community-evaluaties op platforms als LMArena en Hugging Face voordat u productiebesluiten neemt.


Kernfeiten gebaseerd op: kingy.ai, yottalabs.ai, warp2search.net, finance.biggo.com — 14–15 augustus 2026. Klopt er iets niet meer? Laat het ons weten.

Veelgestelde vragen

Wat is het verschil tussen Qwen3.8-27B en Qwen3.8-Max?

Qwen3.8-27B en Qwen3.8-Max zijn twee compleet verschillende modellen ondanks de vergelijkbare naam. Qwen3.8-27B is een compact dense model met 27,78 miljard parameters dat lokaal draait op 24 GB VRAM (zoals een RTX 4090). Qwen3.8-Max is een Mixture-of-Experts model met 2,4 biljoen totale parameters (circa 95 miljard actief per token) en is alleen via API bereikbaar — lokaal draaien vereist datacenterinfrastructuur. De "3.8" in de naam staat voor de modelfamilie-generatie, niet voor het parametertal. Qwen3.8-27B heeft een groter contextvenster (262K vs. 128K tokens) en ondersteunt multimodale input (tekst, afbeeldingen, video). Bron: kingy.ai; yottalabs.ai (augustus 2026).

Welke hardware heb ik nodig om Qwen3.8-27B lokaal te draaien?

De minimumeis voor productief gebruik is 24 GB VRAM. Met 4-bit kwantisatie (Q4_K_M) nemen de weights 17–24 GB in beslag. Geschikte hardware: NVIDIA RTX 4090 (24 GB), RTX 5090 (32 GB), Apple Mac Studio M4 Ultra, of professionele workstation-GPU's. Hogere precisiemodi vereisen meer: FP8 ~48 GB, volledig BF16 ~56–80 GB. Een standaard laptop met 8–16 GB VRAM is onvoldoende. Aanschafkosten voor een werkstation met RTX 4090 liggen anno augustus 2026 op €2.500–€4.000. Bron: kingy.ai; yottalabs.ai (augustus 2026).

Is Qwen3.8-27B GDPR-compliant als ik het lokaal inzet?

Lokale inzet vereenvoudigt de GDPR-verwerkingsketen aanzienlijk: data verlaat uw eigen infrastructuur niet, er is geen verwerkersovereenkomst nodig met Alibaba en er is geen dataretentie bij een externe partij. Dit is met name relevant voor gezondheidszorg, juridische dienstverlening en financiële sectoren waar data-soevereiniteit een harde eis is. Kanttekening: lokale verwerking is geen AVG-garantie op zichzelf. Ook lokale systemen moeten beveiligd zijn (artikel 32 AVG) en medewerkers moeten getraind worden in welke data ze in het model mogen invoeren. Bron: eigen analyse op basis van AVG en Apache 2.0-licentievoorwaarden.

Hoe verhoudt Qwen3.8-27B zich tot Meta Muse Glimmer?

Qwen3.8-27B en Meta Muse Glimmer zijn de twee sterkste lokale open-weight opties van augustus 2026. Qwen3.8-27B heeft een groter contextvenster (262K vs. 131K tokens), ondersteunt video-input en scoort hoger op agentic en coding-benchmarks (OSWorld 84,3 vs. 65,9; Terminal-Bench 73,0). Muse Glimmer heeft het voordeel van een westerse herkomst (Meta, VS) — voor organisaties die Chinese technologie willen mijden uit beleidsoverwegingen. De VRAM-eis is vergelijkbaar (beide 24 GB voor 4-bit kwantisatie). Kies Muse Glimmer als herkomst zwaarder weegt dan capaciteit; kies Qwen3.8-27B als contextvermogen en agentic-kwaliteit leidend zijn. Bron: kingy.ai; eigen vergelijkingsanalyse (augustus 2026).

Waar kan ik Qwen3.8-27B downloaden en hoe begin ik ermee?

Qwen3.8-27B is gratis beschikbaar op Hugging Face (zoek op "Qwen/Qwen3.8-27B") en ModelScope. De licentie is Apache 2.0 — commercieel gebruik en lokale hosting zijn zonder licentievergoeding toegestaan. Voor lokale inzet kunt u de weights laden via Ollama (eenvoudigste route voor eerste tests), LM Studio (grafische interface) of llama.cpp (maximale controle, geschikt voor productie). Zorg voor minimaal 24 GB VRAM en download de Q4_K_M-versie als startpunt. Raadpleeg de officiële Qwen GitHub-pagina (github.com/QwenLM/Qwen3) voor de actuele modelkaart en implementatiegidsen. Bron: warp2search.net; kingy.ai (augustus 2026).

Tags
open-source-aiai-modellenalibabaqwenlokale-aigdprenterprise-aiagentic-ai
Dennis Claassen
Geschreven door

Dennis Claassen

Founder & AI Trainer

Dennis is de oprichter van Project Impact en traint Nederlandse bedrijven in het effectief gebruiken van AI. Met jarenlange ervaring in tech en onderwijs helpt hij teams om AI praktisch toe te passen.

Gerelateerde Artikelen

Meer interessante artikelen over dit onderwerp

Abstracte weergave van serverrekken met kostengrafiek — NVIDIA AI-serverprijzen stijgen meer dan 15% voor Vera Rubin en Grace Blackwell systemen
Nieuws

NVIDIA-klanten krijgen 15%+ prijsstijging voor AI-servers: de paradox van goedkopere modellen en duurder hardware

Op 22 augustus 2026 rapporteerde Bloomberg dat NVIDIA's grootste klanten zijn ingelicht dat AI-servers met Vera Rubin en Grace Blackwell chips meer dan 15% duurder worden voor leveringen begin 2027. De reden: stijgende kosten voor HBM-geheugen. Tegelijk worden AI-modellen goedkoper in gebruik. Die paradox verdient een uitleg — en een concrete implicatie voor uw AI-investering.

6 min lezen
Een ChatGPT-gespreksvenster met een zichtbaar Sponsored-blok onder een antwoord — illustratie bij de lancering van ChatGPT-advertenties in Nederland op 24 augustus 2026
Nieuws

ChatGPT toont vanaf 24 augustus advertenties aan Nederlandse gebruikers: dit moet u weten

Op 19 augustus 2026 kondigde OpenAI aan dat ChatGPT per 24 augustus advertenties gaat tonen aan Free en Go-gebruikers in Nederland en dertig andere Europese landen. Dit artikel legt uit wie de advertenties te zien krijgt, hoe ze eruitzien, of ze de antwoorden van ChatGPT beïnvloeden, en wat u als Nederlands bedrijf nu concreet moet overwegen.

6 min lezen
Abstracte weergave van AI-modelrouting: één centraal knooppunt verbindt via pijlen meerdere gekleurde AI-modelblokken — illustreert hoe een gateway als OpenRouter werkt als tussenpersoon tussen developers en honderden AI-modellen
Nieuws

Stripe koopt OpenRouter voor $7 miljard: wat betekent dit voor uw AI-kosten?

Stripe heeft OpenRouter overgenomen voor meer dan zeven miljard dollar — een betaalinfrastructuurspeler die nu ook de routerlaag van AI bezit. OpenRouter stuurt het API-verkeer van 8 miljoen ontwikkelaars langs meer dan 400 modellen. Wat dit voor Nederlandse organisaties betekent: leveranciersonafhankelijkheid, geconsolideerde AI-facturen én een nieuwe machtsconcentratie in een infrastructuur die u waarschijnlijk al betaalt.

7 min lezen

AI leren toepassen in je bedrijf?

Ontdek onze praktische AI trainingen voor teams.