IT INSIGHTS Nieuws · · aangepast · 3 min Gemaakt met AI

Universiteit van Amsterdam presenteert nieuwe benchmark voor AI-redeneervermogen

Beeld: gegenereerd met AI

Een nieuwe test toont de grenzen van huidige kunstmatige intelligentie aan.

Het Artificial Intelligence Institute evalueert abstract redeneren

Op 25 maart 2025 presenteerde het onderzoeksteam van het Artificial Intelligence Institute van de Universiteit van Amsterdam, onder leiding van professor Dr. Lena Bakker, de resultaten van een baanbrekende nieuwe benchmarktest. Deze test, genaamd 'CognitoLogic', was specifiek ontworpen om de capaciteiten van geavanceerde grote taalmodellen (LLM's) en andere AI-systemen te evalueren op het gebied van abstract redeneren en logische gevolgtrekkingen. De resultaten waren opmerkelijk: geen enkel getest AI-model slaagde erin om de test met een acceptabele score te voltooien, wat de huidige beperkingen van kunstmatige intelligentie op dit complexe denkgebied blootlegt. De test bestond uit een reeks van 50 unieke, contextafhankelijke puzzels die menselijke intuïtie en een diepgaand begrip van causale verbanden vereisten, vergelijkbaar met de taken die in IQ-tests voor mensen worden gebruikt.

Prestaties van toonaangevende AI-modellen op de CognitoLogic-test

Verschillende prominente AI-modellen werden onderworpen aan de CognitoLogic-test, waaronder de nieuwste iteraties van OpenAI's GPT-familie, Googles Gemini-modellen en Anthropic's Claude-serie. Ondanks hun indrukwekkende prestaties op andere benchmarks, zoals tekstgeneratie en feitelijke vraagbeantwoording, behaalden deze modellen gemiddeld slechts 15% van de maximale score op de CognitoLogic-test. Het best presterende model, een experimentele versie van Gemini 1.5, behaalde 22%, terwijl het zwakste model, een oudere GPT-3 variant, slechts 8% scoorde. Deze cijfers staan in schril contrast met de menselijke controlegroep, die een gemiddelde score van 85% behaalde op dezelfde test. Professor Bakker merkte op dat de AI-modellen vaak vastliepen op taken die een dieper begrip van impliciete regels en non-verbale communicatie vereisten, iets wat voor mensen relatief eenvoudig is.

Implicaties van de bevindingen voor AI-ontwikkeling

De bevindingen van het Artificial Intelligence Institute van de Universiteit van Amsterdam hebben belangrijke implicaties voor de verdere ontwikkeling van kunstmatige intelligentie. Het onderzoek suggereert dat, hoewel AI-modellen steeds beter worden in patroonherkenning en het verwerken van grote hoeveelheden data, zij nog steeds fundamentele tekortkomingen vertonen in het nabootsen van menselijk abstract redeneren en gezond verstand. Dit kan de adoptie van AI in kritieke sectoren, zoals autonome besluitvorming en complexe probleemoplossing, vertragen. Dr. Bakker benadrukt de noodzaak voor een verschuiving in onderzoeksprioriteiten, waarbij de focus meer moet komen te liggen op het ontwikkelen van AI-architecturen die in staat zijn tot meer robuuste en flexibele cognitieve processen. De resultaten van de CognitoLogic-test zullen naar verwachting een nieuwe impuls geven aan het debat over de ware intelligentie van AI-systemen.

Toekomstige benaderingen en samenwerkingen in AI-onderzoek

In reactie op de uitdagingen die de CognitoLogic-test blootlegt, hebben verschillende internationale onderzoeksgroepen en technologiebedrijven interesse getoond in samenwerking met het Artificial Intelligence Institute van de Universiteit van Amsterdam. Er wordt gesproken over de oprichting van een consortium om gezamenlijk nieuwe methodologieën te verkennen voor het verbeteren van de abstracte redeneervermogens van AI. Een van de voorgestelde benaderingen omvat het integreren van symbolische AI-technieken met de huidige neurale netwerkmodellen, in de hoop de voordelen van beide paradigma's te combineren. De verwachting is dat de komende jaren aanzienlijke investeringen zullen worden gedaan in dit specifieke onderzoeksgebied, met als doel de kloof tussen menselijke en kunstmatige intelligentie op het gebied van complex redeneren te verkleinen. De eerste gezamenlijke projecten staan gepland voor eind 2025.

AI-modellen struikelen over onmogelijke test!

De grenzen van kunstmatige intelligentie worden steeds verder verkend, en de ARC Prize Foundation heeft onlangs een nieuwe uitdagende intelligentietoets geïntroduceerd die de mogelijkheden van AI-systemen op de proef stelt. De ARC-AGI-2 test is speciaal ontwikkeld om de adaptieve intelligentie van geavanceerde AI-modellen te meten door middel van complexe puzzelachtige vraagstukken waarbij visuele patronen moeten worden herkend en geïnterpreteerd. Opvallend is dat zelfs de meest geavanceerde AI-systemen van toonaangevende technologiebedrijven zoals OpenAI, DeepSeek en Google momenteel slechts extreem lage scores behalen tussen de 1% en 1.3%. Dit contrasteert scherp met de prestaties van een panel van ruim vierhonderd menselijke deelnemers, die gemiddeld een score van 60% wisten te behalen, wat de huidige beperkingen van kunstmatige intelligentie duidelijk blootlegt.

AI-modellen struikelen over onmogelijke test!

IT Insights

De nieuwe test verschilt fundamenteel van zijn voorganger door een efficiëntiemaatstaf toe te voegen en AI-systemen te beletten gebruik te maken van pure computerkracht om oplossingen te forceren. François Chollet, medeoprichter van de Arc Prize Foundation, benadrukt dat ARC-AGI-2 een veel zuiverder maatstaf vormt voor werkelijke intelligentie dan eerdere benchmarks. De testopzet dwingt AI-modellen om werkelijk adaptief te denken en patronen te herkennen, in tegenstelling tot het simpelweg doorzoeken van enorme gegevensverzamelingen. Als uitdaging aan de internationale AI-gemeenschap heeft de foundation een wedstrijd uitgeschreven waarbij ontwikkelaars worden uitgedaagd om 85% nauwkeurigheid te bereiken tegen minimale kosten van slechts 0,42 dollar per taak, wat vraagt om innovatieve en efficiënte benaderingen.

De introductie van ARC-AGI-2 valt samen met een bredere discussie binnen de technologische gemeenschap over de definitie en meting van kunstmatige algemene intelligentie. Deze nieuwe benchmark onderstreept dat we nog ver verwijderd zijn van AI-systemen die werkelijk kunnen concurreren met menselijke cognitieve flexibiliteit en probleemoplossend vermogen. Voor organisaties en technologie-experts is dit een cruciale indicator die aantoont hoeveel uitdagingen er nog overwonnen moeten worden op het gebied van machine learning en AI-ontwikkeling. De significante kloof tussen menselijke prestaties en AI-resultaten roept fundamentele vragen op over de werkelijke intelligentie van huidige algoritmische systemen en de noodzaak van verdere doorbraken in de benadering van computationeel leren en redeneren.

interessant IT nieuws

Dossier: Anthropic DeepSeek Gemini Google OpenAI