— vrijdag 28 augustus 2026 06:53 | 1 reactie , praat mee

Vraag het Vreekamp: Waku Waku niet zomaar mee met AI!

Vraag het Vreekamp: Waku Waku niet zomaar mee met AI!
© Vincent Boon

Heb je vragen over AI en journalistiek, maar ken je niemand aan wie je die kunt stellen? Vraag het Vreekamp! Deze keer: zonder aarzelen nemen we van AI-bedrijven aan dat hun taalmodellen 'krachtig', 'hoogwaardig' en 'frontier' zijn. Maar er is niemand die deze claims onafhankelijk kan verifiëren. Hoe bestaat het dat we die eenzijdige kwalificaties vertrouwen en de makers niet veel sterker bevragen, voordat AI zich volledig heeft ingenesteld in ons werk en onze maatschappij? Laatste wijziging: 31 augustus 2026, 06:44

Dit artikel wordt met je gedeeld door NVJ-lid Laurens. Ook lid worden?

Laat me beginnen met een quizvraag: weet je hoe bijen honingstelende hoornaars uitschakelen? Is dat door te steken, door de hoornaar te verhitten, of door ‘m met honing te bekogelen? Met mijn negenjarige keek ik naar een recente aflevering van tv-programma Waku Waku, waarin deze vraag voorbijkwam. Alhoewel de antwoorden meerkeuze waren, bleek het zonder parate kennis nog best lastig.

Dat bijen in dit geval steken leek mijn dochter uitgesloten, want dan leggen ze immers zelf het loodje, zo wist ze. Met honing gooien was ook al niet slim, want was het die hoornaar niet juist te doen om het zoete goedje?! Zo bleef alleen het tweede antwoord over. (Hoe de bijen dat verhitten precies doen, lees je verderop).

Het beredeneerd uitsluiten van zaken is een waardevolle vaardigheid voor ieder mens, niet alleen voor journalisten. Maar de wereld is geen Waku Waku en journalisten zijn geen quizkandidaten. We weten vaker niet dan wel waarom iets is zoals het is of waardoor iets veroorzaakt wordt. Dan hebben we extra expertise, tijd en bronnen nodig.

We vinden logisch redeneren en het aannemen van een kritische houding essentieel voor de uitoefening van ons beroep, maar het is opvallend dat we deze vaardigheden overboord gooien wanneer het generatieve AI betreft.  Wanneer we verslag doen van weer een nieuw AI-model, gebruiken we termen als ‘krachtig’, ‘hoogwaardig’ en ‘frontier’, terwijl dergelijke kwalificaties op geen enkele betrouwbare, onafhankelijke en op consensus gebaseerde manier te staven zijn.

Voor de vermeende werking en kwaliteit van AI-modellen zijn we volledig aangewezen op wat de makers ervan met ons (willen) delen. Opmerkelijk daarbij is dat computerwetenschappers die AI-systemen bouwen zelf aangeven ook niet precies te weten hoe hun modellen functioneren en hoe ze tot bepaalde resultaten komen. Waar of niet, de al dan niet geveinsde onwetendheid versterkt vooral het eigenbelang. Techbedrijven houden er een zweem van magie mee in stand en voorkomen allerhande claims, zoals de verantwoordelijkheid voor AI-agenten die al dan niet autonoom hacks uitvoeren, chatbots die desinformatie verspreiden en hun robots die onze verhalen opzuigen.

Hoe komt het dat AI nog altijd een black box is?
Er zijn grofweg drie redenen die ervoor zorgen dat niemand de modellen onafhankelijk kan onderzoeken. Ten eerste houden de grote Amerikaanse AI-labs hun modellen zo gesloten mogelijk. Bedrijven die naar eigen zeggen ‘hoogwaardige’ taalmodellen aanbieden, willen niet dat anderen onder de motorkap meekijken. ‘Uit angst voor concurrentie en voor onze veiligheid’, beargumenteerde Ilya Sutskever, een van de oprichters van OpenAI in 2023 in gesprek met techsite The Verge. ‘Als je, net als wij, van mening bent dat AI op een gegeven moment buitengewoon, ongelooflijk krachtig zal worden, dan heeft het gewoon geen zin om het als open source beschikbaar te stellen. Het is een slecht idee. Ik verwacht absoluut dat het over een paar jaar voor iedereen volkomen duidelijk zal zijn dat het gewoon niet verstandig is om AI als open source beschikbaar te stellen.’

Chinese AI-labs (en ook Meta) geven wel vaker inzage in de werking van hun modellen. Dat gaat dan over welk gewicht, voorkeuren en bias bepaalde inhoud in het model meekreeg tijdens de training. Het is wat we open weights noemen. Deze vorm van openheid biedt helaas geen grondslag om onafhankelijk kwaliteitsonderzoek op uit te voeren.

Een tweede oorzaak is dat onafhankelijke wetenschappers aan universiteiten en niet-commerciële labs onvoldoende middelen hebben (o.a. rekenkracht en energie) en up-to-date gereedschap missen om adequate evaluaties mee uit te voeren.

Een derde belangrijke oorzaak is dat mensen met de benodigde specialistische kennis om dergelijke tests uit te voeren, partijdig zijn (Big Tech adviseren) of in dienst zijn van de AI-bedrijven. Ze kiezen liever voor de daarbij behorende status, een hoog salaris en een onderzoeksplek waar de eerdergenoemde middelen ruim voorhanden zijn.

Hoe meet je de kwaliteit van een model?
Er zijn wel standaarden die iets zeggen over het functioneren van modellen. Dat zijn de zogeheten benchmarks: tests die zo zijn ontworpen dat ze verschillende modellen met elkaar vergelijken. Daarop is ook kritiek. Modellen kunnen getraind zijn (lees: gemanipuleerd) om juist op die tests goed te scoren (Benchmarktests hebben daarbij een dominante oriëntatie op het Globale Noorden). De uitslagen zeggen weinig over hoe een model scoort op opdrachten en casussen buiten die tests om.

Want, alsof dit alles nog niet genoeg is, weten we ook niet precies waarvoor mensen chatbots gebruiken. Hier zijn we voor cijfers en inhoud wederom afhankelijk van de selectieve informatie die Anthropic en OpenAI met ons willen delen. Ze publiceren regelmatig rapporten met data, waarin ze vertellen hoe mensen hun producten gebruiken. Ze delen echter alleen de inhoud waarvan ze willen dat wij die zien. Zo schreef de maker van Claude afgelopen april dat 75% van alle chats grofweg gaat over vier (door hen geïdentificeerde) thema’s: gezondheid & welzijn, werk & carrière, relaties en financiën. 1,9% valt in de categorie ‘overig’. Dat lijkt een klein percentage, maar bij 35 miljoen gebruikers is er een aanzienlijk deel van chatgesprekken waar we voor de inhoud en kwaliteit ervan alleen maar kunnen gissen. Er wordt verder ook met geen woord gerept over problematisch, gevaarlijk of ander voor het bedrijf onwelgevallig gebruik van de eigen modellen door gebruikers. Behalve dan het bekende naar-de-mond-praten van chatbots (ook wel vleierij genoemd, ‘sycophancy’): een heerlijk zelf gecreëerd en PR-technisch handig probleem om aan te pakken voor de AI-labs.

OpenAI publiceerde begin augustus gebruikscijfers onder de kop: ‘Hoe de wereld ChatGPT aan het werk zet’, met louter positieve ontwikkelingen: ‘gebruik onder 35+-ers neemt toe’, ‘de gebruikskloof wordt kleiner’ en ‘multimedia snelstgroeiende toepassing’. Het onderzoeksrapport als advertentie. Gek genoeg staat in een vrij diep weggestopte PDF over de gebruikte methodologie, dat de geanalyseerde data waaruit blijkt dat ChatGPT ons aan het werk zet, “geen statistieken bevat die zijn gebaseerd op de indeling van bedrijfsberichten, waardoor het zakelijke gebruik in deze gegevens waarschijnlijk te laag wordt weergegeven.” Ik herhaal het nog maar eens: er zijn geen onafhankelijke bronnen die deze gedeelde data van AI-labs bevestigen of volledig kunnen bevragen. 

Publieke en private audits
Er zijn wel academici, bedrijven en zelfs journalisten die voor onderzoek identieke opdrachten aan verschillende modellen geven (probing) of gebruikers vragen om chatgesprekken te delen (datadonatie), zodat resultaten per model met elkaar te vergelijken zijn. Dit soort onderzoek is altijd beperkt door een gebrek aan tijd, menskracht, expertise en financiële middelen. Zo zijn we onwenselijk afhankelijk van de AI-aanbieders, die ons de toegang kunnen ontzeggen, hun prijzen kunnen verhogen of modelversies uitzetten of wijzigen tijdens de tests.

De AI-labs hebben ondertussen een nieuwe manier gevonden om het publieke vertrouwen in hun modellen te versterken. The New York Times berichtte op 25 augustus over de tot nu vrij onbekende Israëlische startup Irregular. In het artikel met de veelzeggende kop ‘How do you safely test “Superhuman” A.I. Models? No One Really Knows’, blijkt dat de start-up door Meta, OpenAI en Anthropic wordt ingehuurd om de veiligheid van nieuwe modellen te testen. Door het testen van modellen uit te besteden aan commerciële partijen, vormt zich een extra laag die eerder verdoezelt dan licht schijnt op de kracht en gevaren van AI-modellen. Het is tegelijkertijd een manier voor AI-bedrijven om de eigen verantwoordelijkheid wederom af te schuiven.

Behoud onze honing, give ‘em heat!
De basis voor ons gebruik van en onze verslaggeving over AI blijkt zo bezien wel heel wankel, feitenvrij en onverifieerbaar. Voor gebruik van geneesmiddelen, voedsel en zelfs broodroosters zou dit ondenkbaar zijn. Maar voor al die talloze, kostbare experimenten op redacties met zogenaamd intelligente machines, agenten en modellen, vertrouwen we de verkopers van AI al vijf jaar blindelings. Als journalistiek geven we onze honing wel heel makkelijk op. Laten we een voorbeeld nemen aan de bijen en ons beter organiseren en collectief verdedigen. Wat die bijen namelijk met die hoornaar doen, is als groep in een bolvorm om de grote indringer heen vliegen en hevig met hun vleugels trillen. Daardoor raakt de hoornaar oververhit en overwinnen de bijen.

Wat mij betreft is de vraag ‘welk model goed is’ dan ook onmogelijk eerlijk en bevredigend te beantwoorden. Tot we meer duidelijkheid hebben, moeten we verre blijven van het gebruik van generatieve AI en terughoudend zijn met het overnemen van de door AI-aanbieders vastgestelde kwalificaties. Laten we ze bij hun volgende persbericht of onderzoeksrapport het eens wat heter onder de voeten maken.

Schrijvers en journalisten in opstand tegen Big Tech - banner onder artikel

Tip de redactie

Logo Publeaks Wil je Villamedia tippen, maar is dat te gevoelig voor een gewone mail? Villamedia is aangesloten bij Publeaks, het platform waarmee je veilig en volledig anoniem materiaal met de redactie kunt delen: publeaks.nl/villamedia

Praat mee

1 reactie

Laurens, 31 augustus 2026, 16:07

Natali Helberger, professor Law and Digital Technology (UvA), postte op 31 augustus 2026 op LinkedIn dat ChatGPT als VLOS (Very Large Search Engine) wordt gezien door de EU onder de DSA. Dat betekent wellicht (zie haar laatste punt) dat OpenAI veel meer inzage in de modellen moet gaan geven:
‘This designation will raise fascinating questions about data access for researchers under Art. 40 DSA, a right that does not exist under the AI Act. This will raise interesting questions regarding the extent of data access rights, such as whether the access obligation under Article 40 could potentially also include access to training data or model weights if such access is necessary in order to be able to identify systemic risk or assess the adequacy of mitigation measures.’
https://www.linkedin.com/posts/natali-helberger-2473901_press-corner-activity-7500152101138767872-ZjN_