Aanmelden

De impact van data en AI op wetenschappelijke productie

Een beleidsperspectief op hoe FAIR-databeheer en AI-governance de betrouwbaarheid van wetenschappelijke productie kunnen waarborgen.

Auteurs:

Portretfoto van Barend Mons

Barend Bergen, emeritus hoogleraar aan de Universiteit Leiden, bestuurslid van de GO FAIR-stichting en directeur van LIFES, het Leiden Initiative for FAIR and Equitable Science.

Portretfoto van Arie Baak

Arie Baak, bestuurslid van de LIFES Association for FAIR and Equitable Science

Portretfoto van Koen Jonkers

Koen JonkersEuropese Commissie, Gemeenschappelijk Onderzoekscentrum (JRC), Brussel, België

Kunstmatige intelligentie (AI) transformeert de manier waarop wetenschap wordt bedreven, gecommuniceerd en gevalideerd. Het biedt echte mogelijkheden, zoals patroonherkenning op een schaal die geen enkele menselijke onderzoeker kan evenaren, het versnellen van werkprocessen en het openen van nieuwe wegen voor ontdekkingen. Maar AI is ook snel, niet foutloos en niet willekeurig, terwijl wetenschap van nature tijdrovend en nauwgezet is. De spanning tussen deze twee realiteiten leidt nu al tot ernstige problemen: een vloedgolf aan door AI gegenereerde publicaties en data, een verslechterde peerreview, misleidende bevindingen en een afnemend vertrouwen in de wetenschappelijke literatuur. De vaardigheden die van toekomstige wetenschappers worden vereist, veranderen fundamenteel en het wetenschapsbeleid is daar niet in meegegaan. Het is dringend noodzakelijk om deze kloof te dichten.

AI verandert de manier waarop wetenschap wordt bedreven.

De wetenschap is in een opmerkelijk tempo geëvolueerd van een data-arme naar een data-rijke omgeving. Waar onderzoekers vroeger bescheiden datasets genereerden en hun bevindingen voornamelijk via leesbare artikelen communiceerden, opereren ze nu in een tijdperk van exponentiële datageneratie. Veel van deze data is hoogdimensionaal, gedistribueerd en alleen door machines te verwerken. Deze trend wordt echter niet weerspiegeld in het daadwerkelijke hergebruik van data. Om daar verandering in te brengen, moet data zelf nu worden beschouwd als een volwaardige wetenschappelijke output, en niet als een bijproduct van artikelen.

Machines blinken uit in het vinden van patronen in grote en complexe datasets. Maar machines hebben geen inherent conceptueel model van de voor mensen relevante realiteit. Het resultaat is een bijna onbeperkte hoeveelheid patronen, waarvan vele onjuist en sommige misleidend zijn. Een centrale uitdaging voor de volgende generatie wetenschappers zal zijn om door deze patroonjungle te navigeren: het onderscheiden van betekenisvolle signalen van statistische ruis. Menselijk toezicht is niet optioneel; het is structureel noodzakelijk.

Beleidsmakers moeten zich er ook van bewust zijn dat AI in de wetenschap veel verder reikt dan de grote taalmodellen die momenteel het publieke debat domineren. Het bredere landschap omvat machine learning voor het genereren van hypothesen, geautomatiseerde experimentele workflows en redeneren op basis van kennisgrafieken, elk met hun eigen risico's en kansen die een op maat gemaakte aanpak vereisen.

De datakwaliteit en de infrastructuur vormen het knelpunt.

De kwaliteit van de output van AI in de wetenschap wordt direct bepaald door de kwaliteit van de data. invoerFAIR-data (Findable, Accessible, Interoperable and Reusable, en steeds vaker begrepen als Fully AI Ready) is de fundamentele voorwaarde voor verantwoorde AI-gestuurde wetenschap. Zonder FAIR-data worden AI-modellen getraind op ruwe, ongefilterde, mogelijk bevooroordeelde of zelfs verzonnen gegevens, wat hallucinaties produceert die levensbedreigend kunnen zijn in klinische contexten en die het vertrouwen in de wetenschap systematisch ondermijnen. Dit geldt met name wanneer het hergebruik van gemakkelijk vindbare data voornamelijk plaatsvindt door niet-wetenschappelijk georiënteerde partijen, zoals de huidige LLM-bedrijven.

Eveneens belangrijk is het gebruik van FAIR-conceptuele modellen om AI te beperken. uitgangenDoor gestructureerde semantische kaders te bieden, waarin elk concept goed gedefinieerd is, hoe ze met elkaar samenhangen en wat als geldige gevolgtrekking geldt, verminderen deze modellen het risico op misleiding aanzienlijk en helpen ze ervoor te zorgen dat door AI gegenereerde bevindingen verklaarbaar, interpreteerbaar en verifieerbaar blijven voor mensen.

De integriteitscrisis in wetenschappelijke publicaties versterkt deze risico's. AI-systemen kunnen nu vrijwel direct plausibel ogende artikelen, data en reviews genereren. Een toonaangevende AI-conferentie ontving alleen al in 2025 meer dan 20,000 inzendingen. Het gevolg (wetenschappers die AI gebruiken om door AI gegenereerde artikelen te beoordelen) is het risico dat er een vicieuze cirkel ontstaat waarin gebrekkige systemen elkaar evalueren zonder zinvolle externe controle. FAIR-data, gepubliceerd bij de bron waar de herkomst kan worden geverifieerd, is een van de meest robuuste instrumenten om deze trend tegen te gaan.

Aan de basis van dit alles ligt een structureel falen van de stimuleringsmaatregelen. Onderzoekers worden nog steeds voornamelijk beloond voor het aantal artikelen en citaties, een meetinstrument dat is ontworpen voor een tijdperk met weinig data. Het publiceren van hoogwaardige FAIR-data levert weinig professionele erkenning op en biedt geen garantie op financiering. Dit moet veranderen.

De lacunes in het bestuur zijn acuut.

Het technische governance-landschap voor data in de wetenschap verkeert in een crisis. Decennia van afhankelijkheid van een klein aantal grote cloudproviders, in combinatie met juridische instrumenten zoals de Amerikaanse Cloud Act, hebben een data-soevereiniteitsprobleem gecreëerd dat nu acuut is, met name in het licht van de recente beleidsinstabiliteit in de VS en de gevolgen daarvan voor de internationaal gedeelde onderzoeksinfrastructuur. Veel van 's werelds belangrijkste wetenschappelijke databronnen vallen feitelijk buiten de jurisdictie van de instellingen en gemeenschappen die ze hebben gegenereerd.

De FAIR-principes, aangevuld met de CARE-principes (die de rechten en belangen van inheemse volkeren in databeheer behandelen), bieden een samenhangend kader voor verantwoord beheer. Samen definiëren ze de voorwaarden waaronder data open of beperkt, herbruikbaar en soeverein moeten zijn. Het concept van een Internet van FAIR Data en Diensten (IFDS), waarin data bij de bron blijft en wordt geraadpleegd door geautoriseerde algoritmen in plaats van gekopieerd en gecentraliseerd, biedt een praktische architectonische oplossing. In dit model gaan computerquery's naar gedistribueerde dataknooppunten; data wordt niet naar gecentraliseerde opslagplaatsen verzonden, tenzij dit onvermijdelijk is.

Gelijkwaardige deelname aan AI-gedreven wetenschap vereist ook dat deze infrastructuur daadwerkelijk toegankelijk is. Instellingen en gemeenschappen in het mondiale Zuiden kunnen geen passieve ontvangers zijn van hergebruik van data. Aan de andere kant van het spectrum van connectiviteit mag de data-intensieve industrie niet worden uitgesloten. Gedistribueerde FAIR-infrastructuur, ontworpen om vendor lock-in en single points of failure te voorkomen, is het mechanisme waarmee zinvolle deelname mogelijk wordt.

Wat beleidsmakers zouden moeten doen

Een samenhangend beleidsantwoord vereist actie op meerdere fronten:

  • Eis FAIR-datastandaarden in publiek gefinancierd onderzoek. Financieringsinstanties zouden publicatie van FAIR-gegevens als voorwaarde voor subsidieverlening moeten stellen, en niet als aanbeveling.
  • Financier datapublicatie en FAIRification als subsidiabele kosten. De investering die nodig is om hoogwaardige, door machines verwerkbare data te genereren, moet worden erkend en vergoed.
  • Maak hergebruik van eerder gegenereerde data en de bijbehorende infrastructuur subsidiabele onderzoekskosten in subsidieaanvragen.De investering die nodig is om hoogwaardige, machineverwerkbare data op te slaan en beschikbaar te stellen, moet worden erkend en vergoed.
  • Ondersteun op de gemeenschap gebaseerde standaarden in plaats van door leveranciers gedreven oplossingen. Een open, interoperabele infrastructuur, gebouwd op minimale gedeelde standaarden, voorkomt vendor lock-in en zorgt voor een gelijk speelveld.
  • Investeer in wetenschappelijke geletterdheid. Naast wetenschappers hebben ook burgers, journalisten en beleidsmakers een goed begrip nodig van de mogelijkheden en beperkingen van AI. De kloof tussen de publieke perceptie en de technische realiteit vormt een risico voor het bestuur.
  • Stel eisen vast met betrekking tot herkomst en transparantie voor AI die in onderzoek wordt gebruikt. Elk AI-systeem dat bijdraagt ​​aan gepubliceerde wetenschappelijke bevindingen, moet verplicht worden de herkomst van de trainingsgegevens, de beperkingen van het model en de eventuele tekortkomingen ervan openbaar te maken.

Wetenschap is een mondiaal publiek goed. De integriteit, rechtvaardigheid en openheid ervan kunnen niet als vanzelfsprekend worden beschouwd; ze vereisen actieve beleidskeuzes. De mogelijkheid om degelijk bestuur voor AI in wetenschappelijke productie te creëren is er, maar dat zal niet voor altijd zo blijven. De beslissingen die nu worden genomen over datastandaarden, infrastructuur, stimulansen en toezicht zullen bepalen of AI betrouwbare wetenschap versnelt of systematisch ondermijnt.


Foto door Getty Images voor Ontsplash+

Deze blog, die in samenwerking met de International Science Council (ISC) en Frontiers Policy Labs wordt gehost, maakt deel uit van een groter project. 'Een nieuw bestuursmodel voor de wetenschap in de 21e eeuw' Deze reeks dient als een dynamisch discussieforum voor toonaangevende denkers over de toekomst van wetenschapsbestuur. Het initiatief neemt afstand van rigide academische studies en brengt vooraanstaande internationale stemmen samen om scherpe, provocerende, maar op bewijs gebaseerde en toekomstgerichte opiniestukken te presenteren. Daarmee wil het bijdragen aan de ontwikkeling van een veerkrachtig, inclusief en transparant bestuursmodel dat is toegerust voor de uitdagingen van morgen.

Bekijk het originele bericht hier.

Disclaimer
De informatie, meningen en aanbevelingen die in onze gastblogs worden gepresenteerd, zijn afkomstig van de individuele auteurs en weerspiegelen niet noodzakelijkerwijs de waarden en overtuigingen van de Internationale Wetenschapsraad.

Blijf op de hoogte met onze nieuwsbrieven