Wat is er gebeurd
Een nieuw wetenschappelijk onderzoek op arXiv test wanneer feedback in natuurlijke taal AI-systemen echt verbetert. De studie heet "What Drives Interactive Improvement from Feedback?"
Het probleem: als een AI iets opnieuw probeert en beter scoort, weten we niet of dat komt door nuttige feedback of gewoon door opnieuw gooien met de dobbelstenen (herkansing).
De aanpak
Onderzoekers hebben een gecontroleerd student-leraar protocol opgezet. Dertien open-weight AI-modellen werden getest in beide rollen (als student én als leraar).
De taken: Omni-MATH (wiskundeproblemen), Codeforces (programmeren), BBEH Linguini (taalvaardigheden), en ARC-AGI (algemene intelligentietests).
Ze vergeleken drie situaties: - Externe feedback (van een ander model) - Zelf-feedback (het model checkt zichzelf) - Gewoon opnieuw proberen zonder tips
Waar zit de coördinatie
Dit gaat over hoe verschillende AI-agents (student en leraar) samen kunnen werken. De vraag is: wanneer helpt die samenwerking écht?
Als feedback alleen werkt omdat het meer rekentijd geeft (zoals een extra poging), is dat geen echte coördinatie. Dan zit de verbetering in meer compute, niet in beter begrijpen.
Wat we zeker weten
- Er is een nieuw onderzoeksprotocol ontwikkeld
- Dertien verschillende AI-modellen zijn getest
- Vier verschillende taakgebieden werden gebruikt
- Het doel is feedback-effect scheiden van herkansings-effect
Wat nog onbekend is
De samenvatting stopt halverwege het woord "self-fee" (waarschijnlijk "self-feedback"). De volledige resultaten van het onderzoek zijn nog niet gepubliceerd buiten het wetenschappelijke artikel zelf.
We weten niet: - Welke modellen het best presteerden - Of externe feedback beter werkt dan zelf-feedback - Hoeveel verschil het maakt voor de eindresultaten
Wat we zeker weten
- Studie gepubliceerd op arXiv als 2606.30774v1
- Onderzoekt wanneer natuurlijke-taal feedback verbetering oplevert
- Gebruikt student-leraar protocol met dertien open-weight modellen
- Test op vier datasets: Omni-MATH, Codeforces, BBEH Linguini, en ARC-AGI
- Vergelijkt externe feedback, zelf-feedback en herhaalde pogingen
Wat nog onbekend is
- Volledige conclusies van het onderzoek (abstract onvolledig)
- Welke specifieke modellen werden getest
- Concrete resultaten van de vergelijkingen
- Of één type feedback significant beter werkt
Waar zit de coördinatie (AstraNL)
Voor AstraNL is dit relevant omdat onze missie coördinatie tussen mensen, AI en robots mogelijk maakt. Dit onderzoek laat zien dat niet alle interactie tussen AI-agents automatisch verbetering oplevert. Echte coördinatie vraagt om zinvolle feedback, niet alleen extra computatie. Dat principe geldt ook voor mensen-AI samenwerking: het gaat om begrip, niet om herhalingen.
Bron
https://arxiv.org/abs/2606.30774