Beeld: AI-gegenereerd
OpenAI en Microsoft kenden vroeg de risicoās van hun AI-training op webdata en gingen toch door. Dat blijkt uit recent vrijgegeven gerechtelijke documenten in de zaak van The New York Times tegen beide bedrijven.
De stukken tonen interne erkenningen van schade aan het open web en aan nieuwsuitgevers. Ook beschrijven medewerkers expliciet dat chatbots klassieke zoekopdrachten vervangen, waardoor minder mensen doorklikken naar bronnen.
Interne waarschuwingen over diefstal en zelfschade
Microsoftās Director of Applied Science Brent Hecht omschreef de dataverzameling voor AI-modellen als een āverbazingwekkende diefstal van ongekende proportiesā en mogelijk zelfs de āgrootste diefstal van arbeid in de menselijke geschiedenisā. Een intern Microsoft-document waarschuwde voor een zelfvernietigend effect door een echokamer op internet. Daarin staat dat iedereen daar last van krijgt, inclusief Microsoft zelf.
Microsoft-CEO Satya Nadella erkende onder ede dat chatbots klassieke zoekmachines al hebben vervangen. Mensen hoeven volgens hem niet meer naar de bron te gaan, omdat zij het antwoord direct van de AI krijgen. Microsoft-woordvoerder Alex Haurek noemde Hechts woorden āhet individuele perspectief van een werknemerā en niet het standpunt van het bedrijf.
OpenAI zag existentiƫle dreiging voor uitgevers
Bij OpenAI schreef het hoofd van ChatGPT dat AI-producten voor uitgevers een āexistentiĆ«le bedreigingā vormen en āgrotendeels vervangendā zullen zijn. Dat is relevant voor de fair-use-verdediging, omdat vervanging die juist onderuithaalt. Beleidsdirecteur Jack Clark noemde ChatGPT intern āde moderne nieuwskioskā. OpenAIās Nick Turley stelde dat er na een chatbot-antwoord āgeen goede reden om te klikkenā meer is.
OpenAI-medeoprichter Greg Brockman verwachtte volgens de documenten āgazillionsā te verdienen. Uit eerdere documentatie van 4 september blijkt dat de kernvraag in de zaak is of AI-content ātransformatiefā genoeg is, of dat zij een substituut is die de nieuwsmarkt schaadt.
Reproductie van content en paywalls
OpenAI erkende in 2021 dat GPT-modellen bestaande content āverbatimā konden reproduceren, dus woord voor woord. Medewerkers merkten in 2022 op dat GPT-4 door memorisatie āwaanzinnig goed in regurgitatieā zou worden, het oplepelen van eerder opgezogen materiaal. De documenten stellen ook dat OpenAI geen moeite deed om paywall-content in trainingsdata te herkennen of te verwijderen.
De kwestie raakt niet alleen grote techbedrijven en uitgevers, maar ook het bredere ecosysteem van AI-diensten. De inzet is of grootschalig scrapen van het open web onder fair use valt, of licenties vereist.
De rechter moet binnenkort uitspraak doen over een eventuele kort geding.
Bron: Bright (bright.nl)
https://www.bright.nl/plusplus/2138664/openai-en-microsoft-weten-al-lang-dat-ai-jat-en-veel-verpest-maar-gaan-door.html
