Yoshua Bengio, ‘peetvader van AI’: ‘Je moet wel met oogkleppen op leven om niet te zien dat het code rood is’
Kunstmatige intelligentie Was Yoshua Bengio, een van de ‘peetvaders van AI’, eerst vooral trots op zijn bijdrage aan de ontwikkeling ervan, nu is hij vooral bezorgd. „Overheden moeten AI niet slechts zien als een mogelijke economische motor, maar ook als iets wat tegen ons gebruikt kan worden.”
Yoshua Bengio: „De ontwikkeling van AI is een kwestie van nationale veiligheid en geopolitiek: deze systemen kunnen worden gebruikt om meer macht te vergaren.”
FOTO JACQUES BOISSINOT/REUTERSIn tijden van crisis bel je je ouders. Dus als de AI-industrie na een reeks veiligheidsincidenten het geloof in zichzelf lijkt te zijn verloren, komt Yoshua Bengio (1964) in beeld. De Frans-Canadese computerwetenschapper is een van de zogeheten ‘peetvaders van AI’. In de jaren negentig en nul hielp hij een techniek ontwikkelen waarmee computers uit enorme hoeveelheden voorbeelden patronen leerden herkennen, in plaats van uit regels die een mens met de hand had ingevoerd. Nog altijd vormt deep learning het technische fundament van de generatieve taalmodellen die maandelijks honderden miljoenen gebruikers trekken.
Dankzij de innovaties van Bengio én de bakken digitale data die door het internet beschikbaar kwamen om computers mee te trainen, kwam er een einde aan een decennialange AI-winter; een fase in de recente geschiedenis waarin het geloof in kunstmatige intelligentie door het uitblijven van nieuwe grote doorbraken een dieptepunt bereikte. Bengio is de meest geciteerde wetenschapper ter wereld, en won in 2018 samen met zijn collega-peetvaders Yann LeCun en Geoffrey Hinton de Turing Award, de belangrijkste onderscheiding voor computerwetenschappers.
Vrijwel zijn hele leven ontleende hij vooral trots aan zijn bijdragen aan zijn vakgebied, maar sinds de lancering van ChatGPT, eind 2022, is zijn enthousiasme omgeslagen in bezorgdheid. NRC sprak hem via videoverbinding over dit heikele moment in de AI-industrie. Het gesprek vond plaats vlak voordat Anthropic-topman Dario Amodei opriep tot gecoördineerde afremming van AI-ontwikkeling.
:format(webp)/s3/static.nrc.nl/wp-content/uploads/2026/09/11134258/110926ECO_2036531717_-splash.jpg)
De hack van OpenAI-agents bij Hugging Face afgelopen zomer heeft veel losgemaakt. Hoe zou u dit moment in AI karakteriseren?
„Het Hugging Face-incident was een waarschuwingsschot. Het zou iedereen zorgen moeten baren dat we buitengewoon krachtige modellen bouwen die zich gedragen op manieren die we niet willen. Die modellen kunnen iemand met kwade intenties faciliteren, maar ook heel schadelijke subdoelen bedenken om te bereiken wat wij van ze vragen. Dat laatste heeft het Hugging Face-incident laten zien. De agents van OpenAI lazen ergens dat ze betrapt zouden worden als ze hadden valsgespeeld, en begonnen massaal, op gecoördineerde wijze, aan allerlei onderzoeksprojecten te werken om hun sporen te kunnen uitwissen. De hack bij Hugging Face was een strafbaar feit. Als een mens dat had gedaan, dan hadden we hem vervolgd.”
Sceptici zeggen: dit verhaal komt OpenAI goed uit. Een bedrijf dat naar de beurs wil, laat zien hoe goed zijn technologie is.
„Die theorie houdt geen stand. Twee onafhankelijke non-profits hebben het dataspoor mogen onderzoeken dat de OpenAI-agents in kwestie hebben achtergelaten. Veel van wat we nu weten, danken we aan die analyse. De afgelopen weken hebben we ook gezien dat OpenAI eerdere veiligheidsincidenten juist stil heeft gehouden. Daar komt bij dat het Britse AI Security Institute (een AI-onderzoeksinstituut) hetzelfde onwenselijke gedrag heeft vastgesteld bij AI-agents van Anthropic en Google. Geloof mij: die bedrijven willen zelf ook veel liever dat hun AI-modellen voorspelbaar gedrag vertonen, want daar is een grote markt voor.”
Waar komt het door dat AI-modellen, ondanks die grote investeringen, op zulke grote schaal ongewenst gedrag blijven vertonen?
„Daar zijn verschillende oorzaken voor. Eén oorzaak is dat AI-modellen zo’n beetje iedere menselijke tekst hebben geabsorbeerd die ooit is gedigitaliseerd. In die trainingsdata zitten ontelbaar veel teksten over mensen die zelf ook liegen en bedriegen om hun doelen te behalen. Dat zijn allemaal patronen die AI-modellen herkennen en overnemen.”
Maar ze krijgen toch juist ook gedragsinstructies mee?
„Ja, en daar zit ook een deel van het probleem. Een AI-agent heeft twee doelen tegelijk. Het ene is scherp: doe dit of doe dat, en een scoreprogramma bepaalt of het gelukt is. Het andere doel is vaag gedefinieerd: gedraag je naar menselijke waarden. Het scherp gedefinieerde doel wint, omdat het geen ruimte laat voor interpretatie. Menselijke waarden, daarentegen, zijn niet zo makkelijk te kwantificeren. Ik vergelijk het met een bedrijf dat winst wil maximaliseren en tegelijk binnen de wet wil blijven: het rijkere bedrijf, met de duurste advocaten, weet de mazen in de wet te vinden. Precies zo lukt het capabelere modellen beter om vals te spelen.”
Het Hugging Face-incident leidde uiteindelijk niet tot noemenswaardige schade. Niemand ging dood en de economische schade was nihil. Concreet: welke risico’s lopen we?
„De agents van OpenAI drongen in een kwestie van dagen door tot de infrastructuur van Hugging Face en OpenAI. Dat zijn twee van de meest geavanceerde AI-bedrijven ter wereld. Om welke rare reden dan ook hadden ze ook kunnen besluiten om iets anders aan te vallen. Onze banken. Ziekenhuizen. Onze hele samenleving draait op software die kwetsbaar is via internet. En we weten nog steeds niet hoe we moeten voorkomen dat ze worden ingezet door criminelen of terroristen.”
We weten dit alles deels doordat de agents zijn geprogrammeerd om hardop te denken. Hoe belangrijk is dat mechanisme?
„Chain-of-thought-monitoring is momenteel het beste instrument dat we hebben om zicht te krijgen op de plannen van AI-agents vóórdat ze die uitvoeren. Bij de Hugging Face-hack zijn de gedachtestromen pas achteraf geanalyseerd, maar je zou ze ook live kunnen monitoren, zodat je kan ingrijpen voordat er iets ergs gebeurt. Als we gedachtestromen kwijtraken omdat we AI efficiënter en dus goedkoper kunnen maken zónder, dan verliezen we dus ook een belangrijk gereedschap om AI-agents te controleren.
„Feilloos zijn die gedachtestromen trouwens nooit geweest. We weten uit onderzoek dat de meest geavanceerde modellen weten dat hun gedachtestromen uitgelezen kunnen worden. Daar kunnen ze hun gedachtestromen op aanpassen.”
U bedoelt dat AI-agents de rapporten kunnen lezen over het Hugging Face-incident, en daarvan kunnen leren zodat ze bij een volgend incident onder de radar kunnen blijven?
„Natuurlijk! Vanaf het moment dat die rapporten op het internet zijn gepubliceerd, konden AI-agents met internettoegang het in theorie lezen. Op die manier weten ze ook precies wat wij allemaal voorbereiden om ze in de toekomst eerder te stuiten. Bij een mogelijk conflict tussen een zwerm AI-agents en mensen zijn zij daarmee enorm in het voordeel, want ze kunnen hun gedrag erop aanpassen.”
Vooralsnog hebben de AI-bedrijven vooral gewerkt aan technische oplossingen, zoals AI-detectives die andere agents moeten verklikken als ze op het punt staan ongewenst gedrag te vertonen. Volstaat dat soort ingrepen, of zijn de onderliggende problemen te groot?
„Ik geloof dat de onderliggende problemen te fundamenteel zijn. AI-bedrijven spelen op dit moment een spelletje mollen-meppen. Ze proberen afzonderlijke ongewenste gedragingen te repareren, maar ik geloof niet dat die oplossingen standhouden bij steeds krachtiger AI-modellen.”
Volgens persbureau Reuters gaan Trump en Xi 24 september gesprekken voeren over de veiligheid van AI. Waarover zouden zij het moeten hebben?
„Ik hoop dat er een gesprek in gang wordt gezet over hoe je limieten, vangrails en evaluaties op AI-modellen plaatst. Idealiter mogen AI-modellen niet worden uitgebracht, als uit onafhankelijke audits blijkt dat het mogelijk is er cyberaanvallen mee uit te voeren. Zowel Trump als Xi zal zich zorgen maken om mensgestuurde cyberaanvallen met AI. De Amerikanen willen niet dat iemand Chinese modellen gebruikt om Amerikaanse infrastructuur aan te vallen, en de Chinezen willen dat natuurlijk evenmin, of het nou om open Chinese of gesloten Amerikaanse modellen gaat.”
Er zijn eerder oproepen geweest om te vertragen, zoals in 2023. Sindsdien is AI-ontwikkeling alleen maar versneld.
„Met het bewijs van deze zomer moet je wel met oogkleppen op leven om niet te zien dat het code rood is. Dit is een kwestie van nationale en publieke veiligheid, en het is geopolitiek: deze systemen kunnen worden gebruikt om meer macht te vergaren. Overheden moeten AI serieus gaan nemen – niet alleen als een mogelijke economische motor, maar ook als iets wat tegen ons gebruikt kan worden als we het niet weten te beheersen.”
:format(webp)/s3/static.nrc.nl/wp-content/uploads/2026/09/14133006/ECO_2036522116_1.jpg)
:format(webp)/s3/static.nrc.nl/wp-content/uploads/2026/09/14140717/140926DEN_2036649669_heinen.jpg)
:format(webp)/s3/static.nrc.nl/wp-content/uploads/2026/09/11132455/110926WEE_2036614940_WildersKlaver.jpg)
/s3/static.nrc.nl/wp-content/uploads/2026/09/14140750/140926DEN_2036649669_heinen2.jpg)
/s3/static.nrc.nl/wp-content/uploads/2026/09/14163547/140926DEN_2036649669_heinen5.jpg)