Beeld: AI-gegenereerd
OpenAI en Microsoft kenden vroeg de risico’s van hun AI-training op webdata en gingen toch door. Dat blijkt uit recent vrijgegeven gerechtelijke documenten in de zaak van The New York Times tegen beide bedrijven.
De stukken tonen interne erkenningen van schade aan het open web en aan nieuwsuitgevers. Ook beschrijven medewerkers expliciet dat chatbots klassieke zoekopdrachten vervangen, waardoor minder mensen doorklikken naar bronnen.
Interne waarschuwingen over diefstal en zelfschade
Microsoft’s Director of Applied Science Brent Hecht omschreef de dataverzameling voor AI-modellen als een “verbazingwekkende diefstal van ongekende proporties” en mogelijk zelfs de “grootste diefstal van arbeid in de menselijke geschiedenis”. Een intern Microsoft-document waarschuwde voor een zelfvernietigend effect door een echokamer op internet. Daarin staat dat iedereen daar last van krijgt, inclusief Microsoft zelf.
Microsoft-CEO Satya Nadella erkende onder ede dat chatbots klassieke zoekmachines al hebben vervangen. Mensen hoeven volgens hem niet meer naar de bron te gaan, omdat zij het antwoord direct van de AI krijgen. Microsoft-woordvoerder Alex Haurek noemde Hechts woorden “het individuele perspectief van een werknemer” en niet het standpunt van het bedrijf.
OpenAI zag existentiële dreiging voor uitgevers
Bij OpenAI schreef het hoofd van ChatGPT dat AI-producten voor uitgevers een “existentiële bedreiging” vormen en “grotendeels vervangend” zullen zijn. Dat is relevant voor de fair-use-verdediging, omdat vervanging die juist onderuithaalt. Beleidsdirecteur Jack Clark noemde ChatGPT intern “de moderne nieuwskiosk”. OpenAI’s Nick Turley stelde dat er na een chatbot-antwoord “geen goede reden om te klikken” meer is.
OpenAI-medeoprichter Greg Brockman verwachtte volgens de documenten “gazillions” te verdienen. Uit eerdere documentatie van 4 september blijkt dat de kernvraag in de zaak is of AI-content “transformatief” genoeg is, of dat zij een substituut is die de nieuwsmarkt schaadt.
Reproductie van content en paywalls
OpenAI erkende in 2021 dat GPT-modellen bestaande content “verbatim” konden reproduceren, dus woord voor woord. Medewerkers merkten in 2022 op dat GPT-4 door memorisatie “waanzinnig goed in regurgitatie” zou worden, het oplepelen van eerder opgezogen materiaal. De documenten stellen ook dat OpenAI geen moeite deed om paywall-content in trainingsdata te herkennen of te verwijderen.
De kwestie raakt niet alleen grote techbedrijven en uitgevers, maar ook het bredere ecosysteem van AI-diensten. De inzet is of grootschalig scrapen van het open web onder fair use valt, of licenties vereist.
De rechter moet binnenkort uitspraak doen over een eventuele kort geding.
Bron: Bright (bright.nl)
https://www.bright.nl/plusplus/2138664/openai-en-microsoft-weten-al-lang-dat-ai-jat-en-veel-verpest-maar-gaan-door.html
