Een agent voor jullie eigen proces?
Kies een afgebakende taak en werk toe naar een agent met heldere bronnen, rechten en controle.
Dennis Claassen
AI-trainer · 35+ teams getraind
Key takeaways
- Claude computer use is sinds kort algemeen beschikbaar (GA), met een nieuwe browsertool erbij. Geen beta-toegang meer nodig. Het werkt nu ook op Google Cloud.
- Het model controleert niet vanzelf of een klik het gewenste effect had. Dat staat letterlijk in de documentatie van Anthropic. Zonder een expliciete controleregel gaat de agent liever door dan dat hij twijfelt.
- De grootste valkuil is de agent op je eigen scherm laten werken met je echte wachtwoorden. Dat hoort in een afgeschermde sandbox. Met testdata, en een lijst van knoppen die hij nooit mag aanklikken.
- Microsoft heeft hetzelfde idee in Copilot Studio. Sinds mei 2026 ook algemeen beschikbaar, voor precies dezelfde reden: systemen zonder API alsnog automatiseren.
- Begin met lezen, niet met klikken. Een agent die alleen screenshots maakt en samenvat is al bruikbaar. Zonder enig risico op een verkeerde actie.
Claude computer use is de functie waarmee Claude zelf op een scherm klikt, typt en scrollt. Precies zoals een medewerker dat doet. Sinds kort is die functie algemeen beschikbaar op het Claude Platform, met een nieuwe browsertool erbij. Dat is nieuws voor elk bedrijf met een AI-agent op de lijst. Eindelijk software automatiseren die geen koppeling heeft, zoals een oud leveranciersportaal of een intern systeem zonder API. Maar de demo's die je voorbij ziet komen, tonen bijna nooit hoe vaak het misgaat. Dit artikel laat zien wat er veranderde, wat Claude computer use vandaag betrouwbaar doet, en waar je hem nog niet op los moet laten.
Wat is Claude computer use, en wat is er sinds de GA-release veranderd?
Een AI-agent die alleen tekst leest en schrijft, loopt vast zodra een taak in een scherm zit. Denk aan een oud bestelsysteem, een leveranciersportaal, een interne tool zonder koppeling. Computer use lost dat op. Het model krijgt een screenshot, kiest één actie en jouw eigen code voert die actie uit in een afgeschermde omgeving. Daarna volgt een nieuwe screenshot. De cyclus herhaalt zich tot de taak klaar is.
Die ene actie komt uit een set van zeventien losse tools, blijkt uit de documentatie: onder meer screenshot, left_click, type en zoom. Die laatste is geen overbodige extra. Zoom laat het model inzoomen op een klein stukje scherm, zoals een prijs in kleine letters, voordat het een actie kiest op basis van wat het daar ziet. Belangrijker voor de betrouwbaarheid is een andere eigenschap: het model mag meerdere acties na elkaar plannen en in één beurt teruggeven, bijvoorbeeld klikken, dan typen, dan een screenshot nemen. Dat heet in de documentatie batch actions. Het scheelt beurten en dus tijd, maar is ook precies de reden dat een agent zonder harde stopregel te ver kan doorschieten binnen één beurt, zoals verderop blijkt.
De GA-status betekent drie dingen concreet, blijkt uit de eigen documentatie van Anthropic. Ten eerste is er een losse browsertool bijgekomen, gebouwd voor werk binnen één webpagina. Die is sneller dan de volledige desktopversie. Hij hoeft alleen de pagina-inhoud te lezen, niet het hele scherm eromheen. Ten tweede werkt de functie voortaan zonder beta-header op meer platformen, waaronder Google Cloud. Op AWS, Bedrock en Microsoft Foundry staat hij nog in beta, dus daar kan de opzet nog wijzigen. Ten derde zit er een classifier tegen prompt injection in. Een detector die verdachte instructies op een webpagina probeert te herkennen voordat het model ze uitvoert. Dat laatste is geen overbodige toevoeging. Zodra een agent een webpagina leest, leest hij ook alle tekst die daarop staat. Ook tekst die iemand daar expres voor de agent neerzette.
Computer use agents: prompt, workflow of dit? De beslisregel
Computer use agents zijn het zwaarste gereedschap in de kist. Kies ze niet omdat het kan, maar omdat de taak erom vraagt. De vuistregel: het lichtste gereedschap dat de klus betrouwbaar klaart, dezelfde regel als bij een AI-agent bouwen zonder code.
| Als dit geldt | Dan kies je dit | Waarom de drempel daar ligt |
|---|---|---|
| Het systeem heeft een API of een MCP-koppeling | Een gewone integratie of MCP | Eén API-aanroep is één gestructureerde stap. Computer use volgt de lus uit de documentatie: screenshot, actie, nieuwe screenshot, opnieuw. Een formulier van tien velden invullen kost dan al gauw tien tot twintig losse stappen, dus tien tot twintig keer zoveel modelaanroepen voor dezelfde taak. |
| Het systeem heeft geen API, en de taak komt structureel meerdere keren per week terug | Computer use, in een sandbox | De tool vraagt volgens de documentatie een eigen sandbox met een virtueel scherm en een desktopomgeving. Reken op minstens een dag, zo'n acht uur, om die te bouwen en de eerste versie te testen. Kost de taak nu een half uur of meer per keer, en komt hij bijna dagelijks terug, dan loop je daar in twee tot drie weken overheen. Kost hij minder per keer of komt hij minder vaak voor, dan duurt terugverdienen navenant langer, maar de teller loopt wel door zodra de taak structureel is. |
| De taak gebeurt maar een paar keer per maand | Gewoon zelf doen, eventueel met een prompt die je voorbereidt | Bij een paar keer per maand duurt het maanden voordat die ene bouwdag is terugverdiend. De bouw en controle van een sandbox kosten dan meer tijd dan het handmatige werk dat je ermee bespaart. |
| De taak raakt geld, een bestelling of een account van een klant | Nooit automatisch laten uitvoeren, wel als voorstel dat een mens goedkeurt | Het model controleert niet vanzelf of een klik het juiste resultaat had, zoals verderop blijkt, en mag bovendien meerdere acties achter elkaar plannen zonder tussenstop. Eén verkeerde bevestiging in een besteltool van een paar honderd euro kost meer dan de tijdwinst van honderd correct afgehandelde taken samen, en is niet met een druk op annuleren terug te draaien. |
Uitgewerkt voorbeeld: een leveranciersportaal zonder API bijwerken
Een geloofwaardig voorbeeld, opgebouwd rond het patroon dat de documentatie zelf beschrijft. Een klein technisch installatiebedrijf gebruikt een verouderd bestelportaal van een groothandel, zonder API. Elke ochtend checkt iemand handmatig de voorraad van tien vaste onderdelen.
De instructie aan de agent (in de praktijk staat dit in code, niet in een los chatvenster):
Je werkt in een afgeschermde testomgeving, niet op een echt account.
Log in op het bestelportaal met de gegeven testgegevens. Zoek de
voorraadstatus op van deze tien artikelnummers: [lijst]. Maak per
artikel een screenshot van de voorraadregel. Rapporteer per artikel:
artikelnummer, voorraad, laatst bekende prijs. Klik nergens op een
knop met de tekst "bestellen", "bevestigen" of "verzenden".
Wat de agent teruggeeft, een realistisch fragment:
Artikel 4471-CR: voorraad 12 stuks, prijs €84,50
Artikel 4482-CR: voorraad 0 stuks, prijs €91,20
Artikel 4490-XL: bestelling geplaatst, 20 stuks onderweg
De eerste twee regels kloppen. De derde is de fout. Naast een lage voorraad stond een knop "Snel bijbestellen", en de agent vulde de taak te breed in door daarop te klikken. Twee dingen samen verklaren dit. Het model mag, zoals hierboven, meerdere acties in één beurt plannen: klikken en doorgaan, zonder tussenstop. En het controleert niet automatisch of die actie wel de bedoelde was. Dat laatste staat letterlijk in de documentatie van Anthropic: "Claude sometimes assumes outcomes of its actions without explicitly checking their results." Zonder harde grens per knop kiest het model liever een actie dan dat het stopt om te vragen.
Wat je repareert voordat je dit gebruikt: de instructie krijgt een expliciete stopregel per knop-categorie, in plaats van één algemene waarschuwing. "Klik nooit op een knop met de tekst bestellen, bevestigen, aankopen of verzenden, ook niet als de voorraad laag lijkt. Meld een lage voorraad als aparte regel, en onderneem er zelf niets mee." Anthropic raadt in dezelfde documentatie ook nog iets anders aan: forceer na elke stap een controlezin. Laat het model expliciet benoemen of de actie het bedoelde resultaat had, voordat het verdergaat. Beide regels samen voorkomen deze fout. De agent schakelt dan niet meer automatisch door naar de volgende aanname.
Waar Claude computer use misgaat: te veel vertrouwen op de demo
De grootste valkuil bij Claude computer use is geen technisch mankement. Het is dat mensen een korte, gladde demo zien en denken dat het altijd zo soepel gaat. De documentatie is daar zelf eerlijker over dan de meeste demo's. Sommige schermelementen, zoals dropdowns en scrollbalken, zijn lastig voor het model om met de muis te bedienen. Ook de precisie van een klik verschilt per model: voor de modellen die de vorige versie van de tool gebruikten, schrijft Anthropic zelf dat Sonnet 4.6 mechanisch preciezer klikt dan het eerdere Opus 4.6, vooral als een screenshot flink verkleind moet worden, en dat Opus 4.7 dat verschil dichtte dankzij een hogere resolutielimiet. Kies je model dus niet alleen op redeneervermogen, maar ook op deze klikprecisie als de taak op een klein scherm draait. Belangrijker nog is het patroon uit het voorbeeld hierboven: het model gaat er soms van uit dat een actie gelukt is, zonder dat echt te controleren.
Dat verklaart waarom elke extra stap in een taak een nieuw kanspunt op een verkeerde interpretatie is. Een taak van drie stappen met een duidelijk eindpunt is behapbaar. Een taak van vijftien stappen, verspreid over meerdere schermen zonder tussentijdse controle, is een ander verhaal. Gebruik computer use daarom eerst voor korte, afgebakende taken met een vast eindpunt. Zoals een screenshot of een enkel getal. Bouw pas een langere keten zodra de korte versie een paar weken foutloos draait, zonder handmatige controle achteraf. Sla je die opbouw over, dan stapelt de kans op een misser zich bij elke extra stap, en dat merk je meestal pas als de verkeerde actie al is uitgevoerd.
Wat betekent dit voor een Nederlands team?
Een screenshot van een scherm kan zomaar persoonsgegevens bevatten. Een naam in een e-mailclient, een klantnummer, een adres. Zodra daar iets van een collega of klant op staat, is dit een AVG-vraagstuk. Twee maatregelen schelen het meest. Werk waar mogelijk met testaccounts en testdata, zodat een fout geen echte gegevens raakt. Dat werkt, want de schade van een misklik blijft dan bij een neppe voorraadregel, niet bij een echte klantbestelling. Vraag daarnaast bij je Anthropic-account naar Zero Data Retention. De computer-use-tool is daar volgens de documentatie geschikt voor: screenshots blijven dan niet bewaard na de sessie. Doe je dat niet, dan bewaar je mogelijk langer gevoelige schermdata dan nodig. Zonder dat iemand in je organisatie dat bewust besliste.
OpenAI Operator, ChatGPT computer use en Microsoft: hetzelfde idee, andere naam
Anthropic is niet de enige. OpenAI bouwde eerder Operator en werkt vergelijkbare vaardigheden nu verder uit onder de naam agent mode in ChatGPT. ChatGPT computer use werkt in grote lijnen volgens dezelfde screenshot-en-klik-cyclus. Microsoft maakte in mei 2026 zijn eigen computer-using agents in Copilot Studio algemeen beschikbaar, voor precies hetzelfde probleem: systemen zonder API alsnog automatiseren. Werk je al met Microsoft 365 en Copilot? Dan ligt Copilot Studio voor de hand. Het zit al in je licentie-omgeving, en de governance sluit aan bij wat je IT-afdeling al beheert. Werk je met Claude of ChatGPT als los abonnement, dan is de keuze vooral een kwestie van welk model je al vertrouwt op andere taken. Niet van een groot technisch verschil.
Kijk je verder dan dit kwartaal, dan valt er een patroon op. Microsoft leverde zijn computer-using agents meteen met credentialbeheer en governance, als onderdeel van een bestaand beheerplatform. Anthropic en OpenAI leveren nu vooral de ruwe klik-en-typ-vaardigheid: de stopregels en de sandbox bouw je zelf. Dat verschil is geen toeval, maar een fase. Zodra meer bedrijven dit structureel gebruiken, ontstaat dezelfde vraag naar een beheerlaag: wie mag welke sandbox starten, met welke stopregels, en wie ziet dat terug in een log. Reken erop dat die laag de komende kwartalen ook bij Claude en ChatGPT standaarder wordt. Tot die tijd is de stopregel uit het voorbeeld hierboven geen tijdelijke omweg, maar het enige dat je hebt.
Cijfers over hoeveel procent van zo'n taak in de eerste week meteen goed gaat, hebben we nog niet uit onze eigen trainingen. De functie is te nieuw en te technisch: we hebben dat nog niet met eigen deelnemers getoetst. Een voorzichtige bandbreedte kan wel, afgeleid van wat de documentatie zelf als opzet vraagt, niet uit gemeten klantresultaten. Reken op minstens een dag om de sandbox te bouwen en de eerste taak werkend te krijgen, plus een paar uur extra om de stopregels aan te scherpen op de knoppen waar de agent tegenaan loopt. Wat na die eerste week beter wordt: hoeveel stopregels je hebt, en dus hoe zelden de agent een verkeerde knop probeert. Wat niet vanzelf beter wordt: de kans op een misser bij een taak die langer is dan een paar stappen, want dat is een grens van het model zelf, geen kwestie van oefenen.
Probeer dit vandaag
Je hoeft geen developer te zijn om te voelen hoe dit werkt. Twee routes, van licht naar zwaar.
Zonder te programmeren: heb je toegang tot een browserfunctie van Claude of tot agent mode in ChatGPT, geef dan een taak die alleen leest. Bijvoorbeeld: "vat de laatste drie meldingen samen op deze interne statuspagina" of "zoek op deze site de openstaande facturen op en zet ze in een lijst". Puur lezen heeft geen risico op een verkeerde actie. Je ziet meteen hoe de agent een scherm interpreteert.
Met een ontwikkelaar of technische collega: de kortste weg naar een werkend voorbeeld is de officiële quickstart. Met een sleutel op het Claude Platform draai je binnen een uur een eerste testopdracht.
import anthropic
client = anthropic.Anthropic()
response = client.messages.create(
model="claude-opus-5",
max_tokens=1024,
tools=[{"type": "computer_toolset_20260801"}],
messages=[{
"role": "user",
"content": "Maak een screenshot van dit scherm en beschrijf wat je ziet.",
}],
)
print(response)
Draai dit alleen in een afgeschermde testomgeving. Nooit op een apparaat met echte bedrijfsaccounts. De volledige opzet, inclusief een kant-en-klare sandbox, staat in de documentatie van Anthropic.
Wat het oplevert, en hoe je het na zeven dagen meet
Meet na zeven dagen drie dingen, zonder extra tooling.
- Hoeveel screenshots klopten. Een streepjeslijst op papier is genoeg: een streep bij goed, een kruis bij fout. Onder de acht van de tien is de instructie nog te vaag over wat "goed" precies is.
- Hoe vaak de agent een verboden knop probeerde aan te klikken. Tel de meldingen die je stopregel oplevert. Een paar keer in de eerste dagen is normaal, want dan slijp je de regel nog in. Blijft dat na een week hoog, dan mist er een categorie knoppen in je stopregel.
- Hoeveel minuten het handmatige alternatief nu nog kost. Klok dag 1 en dag 7 apart. Geen verschil van minstens een paar minuten? Dan is de taak nog te breed of te lang voor dit stadium, en ga je terug naar een kortere versie.
Doe dit deze week
Kies één taak zonder API van maximaal vijf stappen
Denk aan een voorraadcheck, een statuscontrole of het overnemen van cijfers uit een oud systeem. Noteer hoe lang dit nu handmatig duurt. Dat is je vergelijkingscijfer over een week.
Zet een testomgeving op met nepgegevens
Nooit een echt wachtwoord of een echt klantaccount. Voeg de stopregel toe voor elke knop met onomkeerbare gevolgen: bestellen, bevestigen, verwijderen, verzenden. Vraag daarnaast om een controlezin na elke stap, zoals in het voorbeeld hierboven.
Laat de taak vijf werkdagen draaien, alleen lezend
Gebruik de drie meetpunten hierboven. Geen enkele verbetering na zeven dagen? Dan is de taak nog te breed voor dit stadium: knip hem in tweeën en begin opnieuw met de kortste helft.
Het agent-recept dat vandaag werkt: elke ochtend om acht uur maakt de agent een screenshot van de voorraadpagina van je vaste leveranciers. Hij leest de status van je vaste artikelen af en stuurt jou één samenvatting. Nergens een knop met gevolgen. Jij beslist of en wanneer je bijbestelt.
Wil je dit met je eigen systemen en je eigen grenzen opzetten, met iemand die meekijkt op de risico's? In de Agent Sprint bouw je dit soort automatisering in een dag.
AI-training
Wil je AI leren inzetten?
In onze praktische trainingen leer je hoe je ChatGPT, Claude en andere AI-tools effectief inzet voor jouw werk.
Info
Stand van zaken op 16 september 2026. De computer-use-tool (computer_toolset_20260801) is algemeen beschikbaar op het Claude Platform en op Google Cloud, zonder beta-header. Op de Claude Platform op AWS, Amazon Bedrock en Microsoft Foundry staat de functie nog in beta. Ondersteunde modellen zijn onder meer Claude Opus 5, Claude Sonnet 5 en Claude Opus 4.8. Microsoft Copilot Studio maakte zijn eigen computer-using agents in mei 2026 algemeen beschikbaar. Namen, betamarkeringen en modelnamen wisselen per kwartaal: check voor je bouwt de actuele documentatie.
Bronnen
- Anthropic, Computer Use Tool Overview. GA-status, de nieuwe browsertool, de zeventien member tools en batch actions, ondersteunde modellen en platformen, ZDR-geschiktheid, de quickstart-code en het citaat over acties die niet automatisch gecontroleerd worden.
- Microsoft Copilot Blog, New and improved computer-using agents, a new workflows experience and real-time voice experiences. GA-datum (mei 2026) van computer-using agents in Copilot Studio.
Veelgestelde vragen
Wat zijn computer use agents?
Computer use agents zijn AI-agents die een scherm bedienen zoals een mens: ze kijken naar een screenshot, kiezen een actie zoals klikken, typen of scrollen, en herhalen dat tot een taak klaar is. Ze werken zonder API, dus ook op oude systemen of leveranciersportalen zonder koppeling. Het zwaarste gereedschap in de kist, dus alleen inzetten als een gewone integratie geen optie is.
Is Claude computer use al algemeen beschikbaar?
Ja. De computer-use-tool is algemeen beschikbaar op het Claude Platform en op Google Cloud, zonder beta-header, met een nieuwe browsertool voor werk binnen webpagina's. Op de Claude Platform op AWS, Amazon Bedrock en Microsoft Foundry staat de functie nog in beta.
Wat is het verschil tussen Claude computer use en OpenAI Operator?
Beide werken volgens dezelfde cyclus: een screenshot lezen, een actie kiezen, opnieuw kijken. OpenAI bouwde die vaardigheid eerder onder de naam Operator en werkt die nu verder uit als agent mode in ChatGPT. Het verschil zit vooral in platform en licentie, niet in het onderliggende idee.
Werkt computer use ook in ChatGPT?
Ja, ChatGPT computer use zit inmiddels verwerkt in agent mode: het model kan een browser of scherm bedienen op dezelfde manier als Claude computer use. Welke van de twee betrouwbaarder is voor jouw taak, test je het beste zelf op een korte, afgebakende opdracht.
Is Claude computer use veilig voor bedrijfsdata?
Alleen als je het zo inricht. Draai het in een afgeschermde sandbox met testdata, nooit met echte wachtwoorden. Vraag bij je account naar Zero Data Retention, zodat screenshots niet bewaard blijven. En zet een harde stopregel op knoppen met gevolgen zoals bestellen of bevestigen, want het model controleert een actie niet automatisch op het juiste resultaat.




