Meer leren over AI?
AI inzetten voor je team? In onze trainingen leer je het in 4 uur.
Dennis Claassen
AI-trainer · 35+ teams getraind
Key Takeaways
- •14 augustus 2026, 15:00 UTC: Alibaba's Tongyi Lab brengt Qwen3.8-27B uit als open weights op Hugging Face en ModelScope — licentie: Apache 2.0, commercieel gebruik toegestaan (warp2search.net).
- •27,78 miljard parameters (dense architectuur) — dit is een ander model dan Qwen3.8-Max, dat 2,4 biljoen MoE-parameters heeft en alleen via API beschikbaar is (kingy.ai).
- •Multimodaal: verwerkt tekst, afbeeldingen én video; contextvenster van 262.144 tokens — het grootste in zijn gewichtsklasse (yottalabs.ai).
- •Hardware-ondergrens: met 4-bit kwantisatie (Q4_K_M) past het model in 17–24 GB VRAM — een RTX 4090 of equivalente workstation-GPU volstaat (kingy.ai).
- •Agentic benchmarks (Alibaba-gerapporteerd): OSWorld-Verified 84,3 — dit overtreffen ze naar eigen zeggen Qwen3.6-27B (63,9) significant; onafhankelijke verificatie loopt nog (kingy.ai).
- •Eerlijke kanttekening: alle benchmarkcijfers zijn vooralsnog Alibaba's eigen rapportage; dezelfde voorzichtigheid geldt hier als bij de Qwen3.8-Max-lancering eerder deze maand.
Een advocatenkantoor wil intern AI gebruiken voor contractanalyse. De data is vertrouwelijk. Een cloudmodel is geen optie. Het kantoor heeft een workstation met een RTX 4090 staan. Tot voor kort was er geen open-source model dat sterk genoeg was voor dit soort taken op die hardware — tenzij je bereid was tot grote compromissen in kwaliteit.
Op 14 augustus 2026 veranderde dat.
Alibaba's Tongyi Lab bracht Qwen3.8-27B uit: een 27,78-miljard-parameters vision-language model, volledig open-weight onder Apache 2.0, met een contextvenster van 262.000 tokens en een reeks sterke agentic-taakcijfers. Het model past op één consumentenGPU en brengt frontier-klasse capaciteiten dichter bij lokale inzet dan eerder haalbaar was in deze gewichtsklasse.
Dit is de eerlijke beoordeling.
Qwen3.8-27B versus Qwen3.8-Max: twee compleet verschillende modellen
Verwarring is begrijpelijk: de naam "3.8" duidt op de modelgeneratie, niet op het parametertal. De twee modellen zijn fundamenteel anders.
| Qwen3.8-27B | Qwen3.8-Max | |
|---|---|---|
| Parameters | 27,78B (dense) | 2,4 biljoen (MoE, ~95B actief) |
| Licentie | Apache 2.0 | Apache 2.0 (weights komende weken) |
| Toegang | Download, lokaal draaien | API + geplande open weights |
| Hardware | 24 GB VRAM (4-bit) | Datacenter GPU's (>1 TB) |
| Modalities | Tekst, afbeeldingen, video | Tekst |
| Contextvenster | 262.144 tokens | 128.000 tokens |
| Uitgebracht | 14 augustus 2026 | 3 augustus 2026 |
Qwen3.8-Max is Alibaba's frontier API-model — vergelijkbaar met Claude Fable 5 of GPT-5.6 Sol. Qwen3.8-27B is het open-weight model voor lokale inzet — vergelijkbaar in rol met Meta Muse Glimmer, dat wij eerder deze week bespraken.
Technische specs
| Eigenschap | Waarde |
|---|---|
| Totale parameters | 27,78 miljard (dense) |
| Contextvenster | 262.144 tokens |
| Modalities | Tekst, afbeeldingen, video |
| Talen | 100+ |
| VRAM (Q4_K_M kwantisatie) | 17–24 GB |
| VRAM (FP8 precisie) | ~48 GB |
| VRAM (BF16 volledig) | ~56 GB |
| Licentie | Apache 2.0 |
| Uitgebracht | 14 augustus 2026 |
| Beschikbaar | HuggingFace, ModelScope |
Bron: kingy.ai; yottalabs.ai.
Benchmarks: indrukwekkend, maar met de bekende kanttekening
Alibaba rapporteert grote verbeteringen ten opzichte van de vorige generatie (Qwen3.6-27B):
| Benchmark | Qwen3.6-27B | Qwen3.8-27B |
|---|---|---|
| Terminal-Bench 2.1 (agentic coding) | 63,4 | 73,0 |
| DeepSWE 1.1 (softwaretaken) | 13,3 | 42,2 |
| OSWorld-Verified (computer-use) | 63,9 | 84,3 |
| SWE-MM (multimodale software) | 25,7 | 38,6 |
Bron: kingy.ai; yottalabs.ai.
Dit zijn vendor-gerapporteerde cijfers — Alibaba's eigen evaluaties. Onafhankelijke reproductie loopt nog. Dezelfde voorzichtigheid paste bij de Qwen3.8-Max-lancering, en is hier ook van toepassing. De sprongen zijn groot genoeg om serieus te nemen, maar niet klakkeloos over te nemen.
Wat opvalt: de OSWorld-Verified-score van 84,3 zou Qwen3.8-27B als lokaal model direct in de buurt brengen van Qwen3.8-Max (86,1) op computer-use — een formidabele claim voor een model dat op één GPU past.
Op welke hardware draait het?
Praktische inzetbaarheid hangt af van uw hardware:
24 GB VRAM (RTX 4090, RTX 5090, Mac Studio M4 Ultra): voldoende voor 4-bit kwantisatie. Q4_K_M-weights nemen 17–24 GB in beslag. Dit is de aanbevolen ondergrens voor productiegebruik (kingy.ai).
32–48 GB VRAM (workstation-GPU's, meerdere consumer-GPU's): comfortabele marge voor hogere quantisatieprecisie (Q6_K, Q8) — betere kwaliteit, hogere geheugeneis.
48–80 GB VRAM: FP8-precisie (~48 GB) of full BF16 (~56–80 GB) voor maximale kwaliteit — vereist professionele GPU-hardware (RTX 6000 Ada, A100, H100).
Normale laptop (8–16 GB VRAM): niet geschikt voor productieve inzet.
Een standaard werkstation met RTX 4090 kost anno augustus 2026 €2.500–€4.000. Dat is een eenmalige investering — geen lopende API-kosten.
Wat dit voor Nederlandse bedrijven betekent
Lokale verwerking: GDPR-voordeel in de praktijk
Apache 2.0 + lokale inzet betekent: de data verlaat uw infrastructuur niet. Er is geen verwerkersovereenkomst nodig met Alibaba, geen API-call naar buitenlandse servers, geen dataretentie bij een derde partij.
Dit is relevant voor:
- •Gezondheidszorg: patiëntendossiers, medische analyses
- •Juridisch: contracten, correspondentie, vertrouwelijke adviezen
- •Financiële dienstverlening: klantdata, kredietbeoordelingen, fraudedetectie
- •Overheid: gevoelige beleids- of persoonsdocumenten
Kanttekening: lokale verwerking vereenvoudigt de AVG-verwerkingsketen, maar garandeert geen volledige compliance op zichzelf. Medewerkers moeten getraind worden in wat ze mogen invoeren; ook lokale systemen vallen onder artikel 32 AVG (beveiligingsvereisten).
Geen API-kosten, maar wél hardware- en beheerkosten
Gratis model ≠ gratis inzet. Verwacht:
- •Aanschaf: €2.500–€4.000 voor een werkstation met RTX 4090
- •Energie: een RTX 4090 verbruikt 450–500W onder load — significant bij 24/7-gebruik
- •Beheer: modellen moeten worden beheerd, geüpdatet en geïntegreerd met uw workflow
Voor organisaties die al een geschikte workstation hebben en DevOps-capaciteit bezitten, zijn de drempelkosten laag. Voor organisaties zonder technische infra is een cloudmodel via een EU-gevestigde provider (zoals Azure NL of OVHcloud) vaak praktischer.
Vergelijking met Meta Muse Glimmer
Meta Muse Glimmer (10 augustus 2026, 30B, Apache 2.0) is de meest directe concurrent. Verschil in een oogopslag:
| Qwen3.8-27B | Meta Muse Glimmer | |
|---|---|---|
| Contextvenster | 262.144 tokens | 131.072 tokens |
| OSWorld-Verified | 84,3 | 65,9 |
| Terminal-Bench 2.1 | 73,0 | n.v.t. |
| Video-input | Ja | Nee |
| VRAM (4-bit) | 17–24 GB | 24 GB |
Op basis van de gerapporteerde cijfers scoort Qwen3.8-27B sterker op agentic en coding-taken. Muse Glimmer heeft het voordeel van een Westerse herkomst (Meta, VS) — relevant als uw risicobeleid Chinese technologie uitsluit.
Wat tegenvalt: eerlijke beperkingen
Chinese herkomst. Alibaba is een Chinees bedrijf. Dat is geen blokkade — de Apache 2.0-licentie geeft u de weights zonder beperking — maar voor organisaties in sectoren als defensie, overheid of kritieke infrastructuur kan een intern beleid de inzet van Alibaba-modellen uitsluiten. Apache 2.0 betekent geen inhoudelijke gebondenheid aan Alibaba, maar u moet dit beleid wel expliciet toetsen.
Vendor-benchmarks. Alle bovenstaande cijfers zijn Alibaba's eigen rapportage. De OSWorld-Verified-score van 84,3 is indrukwekkend, maar onafhankelijke reproductie ontbreekt op moment van publicatie. Wees terughoudend met beslissingen op basis van deze benchmarks alleen.
Geen fine-tuning-instructies bij release. De initiële open-weight release bevat de basisweights; fine-tuning-datasets en -recepten zijn nog niet gepubliceerd. Organisaties die specifieke domeinaanpassing willen, moeten wachten op aanvullende releases.
Knowledge cutoff. De cutoff van het model is niet publiek gespecificeerd bij release — vermoedelijk midden 2026. Voor taken met recente gebeurtenissen is het model minder betrouwbaar.
Conclusie
Qwen3.8-27B is een serieuze toevoeging aan de open-weight AI-markt. Het combineert een groot contextvenster (262K), multimodale input (tekst, afbeelding, video), sterk gerapporteerde agentic-capaciteiten en een Apache 2.0-licentie in een pakket dat op één consumentenGPU past.
Voor Nederlandse bedrijven in sectoren met gevoelige data — juridisch, medisch, financieel, overheid — is lokale inzet van dit model de moeite waard om te evalueren. De GDPR-voordelen van lokale verwerking zijn reëel; de drempelkosten zijn beheersbaar als de hardware al aanwezig is.
Voorbehoud: de benchmarks zijn vendor-supplied en onafhankelijke verificatie loopt nog. Kijk de komende weken naar community-evaluaties op platforms als LMArena en Hugging Face voordat u productiebesluiten neemt.
Kernfeiten gebaseerd op: kingy.ai, yottalabs.ai, warp2search.net, finance.biggo.com — 14–15 augustus 2026. Klopt er iets niet meer? Laat het ons weten.
Veelgestelde vragen
Wat is het verschil tussen Qwen3.8-27B en Qwen3.8-Max?
Qwen3.8-27B en Qwen3.8-Max zijn twee compleet verschillende modellen ondanks de vergelijkbare naam. Qwen3.8-27B is een compact dense model met 27,78 miljard parameters dat lokaal draait op 24 GB VRAM (zoals een RTX 4090). Qwen3.8-Max is een Mixture-of-Experts model met 2,4 biljoen totale parameters (circa 95 miljard actief per token) en is alleen via API bereikbaar — lokaal draaien vereist datacenterinfrastructuur. De "3.8" in de naam staat voor de modelfamilie-generatie, niet voor het parametertal. Qwen3.8-27B heeft een groter contextvenster (262K vs. 128K tokens) en ondersteunt multimodale input (tekst, afbeeldingen, video). Bron: kingy.ai; yottalabs.ai (augustus 2026).
Welke hardware heb ik nodig om Qwen3.8-27B lokaal te draaien?
De minimumeis voor productief gebruik is 24 GB VRAM. Met 4-bit kwantisatie (Q4_K_M) nemen de weights 17–24 GB in beslag. Geschikte hardware: NVIDIA RTX 4090 (24 GB), RTX 5090 (32 GB), Apple Mac Studio M4 Ultra, of professionele workstation-GPU's. Hogere precisiemodi vereisen meer: FP8 ~48 GB, volledig BF16 ~56–80 GB. Een standaard laptop met 8–16 GB VRAM is onvoldoende. Aanschafkosten voor een werkstation met RTX 4090 liggen anno augustus 2026 op €2.500–€4.000. Bron: kingy.ai; yottalabs.ai (augustus 2026).
Is Qwen3.8-27B GDPR-compliant als ik het lokaal inzet?
Lokale inzet vereenvoudigt de GDPR-verwerkingsketen aanzienlijk: data verlaat uw eigen infrastructuur niet, er is geen verwerkersovereenkomst nodig met Alibaba en er is geen dataretentie bij een externe partij. Dit is met name relevant voor gezondheidszorg, juridische dienstverlening en financiële sectoren waar data-soevereiniteit een harde eis is. Kanttekening: lokale verwerking is geen AVG-garantie op zichzelf. Ook lokale systemen moeten beveiligd zijn (artikel 32 AVG) en medewerkers moeten getraind worden in welke data ze in het model mogen invoeren. Bron: eigen analyse op basis van AVG en Apache 2.0-licentievoorwaarden.
Hoe verhoudt Qwen3.8-27B zich tot Meta Muse Glimmer?
Qwen3.8-27B en Meta Muse Glimmer zijn de twee sterkste lokale open-weight opties van augustus 2026. Qwen3.8-27B heeft een groter contextvenster (262K vs. 131K tokens), ondersteunt video-input en scoort hoger op agentic en coding-benchmarks (OSWorld 84,3 vs. 65,9; Terminal-Bench 73,0). Muse Glimmer heeft het voordeel van een westerse herkomst (Meta, VS) — voor organisaties die Chinese technologie willen mijden uit beleidsoverwegingen. De VRAM-eis is vergelijkbaar (beide 24 GB voor 4-bit kwantisatie). Kies Muse Glimmer als herkomst zwaarder weegt dan capaciteit; kies Qwen3.8-27B als contextvermogen en agentic-kwaliteit leidend zijn. Bron: kingy.ai; eigen vergelijkingsanalyse (augustus 2026).
Waar kan ik Qwen3.8-27B downloaden en hoe begin ik ermee?
Qwen3.8-27B is gratis beschikbaar op Hugging Face (zoek op "Qwen/Qwen3.8-27B") en ModelScope. De licentie is Apache 2.0 — commercieel gebruik en lokale hosting zijn zonder licentievergoeding toegestaan. Voor lokale inzet kunt u de weights laden via Ollama (eenvoudigste route voor eerste tests), LM Studio (grafische interface) of llama.cpp (maximale controle, geschikt voor productie). Zorg voor minimaal 24 GB VRAM en download de Q4_K_M-versie als startpunt. Raadpleeg de officiële Qwen GitHub-pagina (github.com/QwenLM/Qwen3) voor de actuele modelkaart en implementatiegidsen. Bron: warp2search.net; kingy.ai (augustus 2026).

