LAION-5B: miljarden afbeeldingen, open gedeeld
Een dataset van miljarden afbeeldingen die iedereen mag gebruiken. Dit is hoe inclusieve technologie eruitziet: niet centraal beheerd, maar open voor allen.
LAION
Miljarden afbeeldingen, open gedeeld.
LAION verzamelde miljarden afbeeldingen van het internet en maakte ze beschikbaar als open dataset, niet achter een betaalmuur en niet in handen van één bedrijf, maar werkelijk open.
Dit gebeurde omdat onderzoekers zagen dat grote dataopsetslagen alleen in handen waren van bedrijven met veel geld. OpenAI had ze. Google had ze. Een student in een klein land zonder budget kon niet experimenteren.
Dit leidde tot LAION, een niet-winstdoelstelling gericht op het open maken van data. Het resultaat is dat duizenden onderzoekers wereldwijd nu kunnen werken met dezelfde gereedschappen als miljardenbedrijven.
Dit is DIP in technologie, niet om altruïstisch te zijn, maar omdat meer mensen kunnen innoveren als meer mensen kunnen experimenteren.
De paradox is dat dit open-data-werk waarschijnlijk meer waarde heeft gegenereerd dan vele private datasets. Door de barrière zo laag mogelijk te houden, trok het meeste talent aan.
Dit is inclusiviteit als strategie. Als je wilt dat de beste ideeën winnen, moet je voorkomen dat geldgebrek het winnende idee tegenhoudt. Je moet voorkomen dat talent uit minder rijke landen niet kan experimenteren.
LAION is niet zuiver. Net als andere open-sourceprojecten is het gebouwd door mensen met tijd en interesse, maar het geeft ook inzicht: je wint meer door open te zijn dan door gesloten te zijn.
Bronnen:
- Schuhmann, Christoph, et al. "LAION-5B: An Open Large-Scale Image-Text Dataset" (2022, https://arxiv.org/abs/2210.08402).
- LAION (Large-scale Artificial Intelligence Open Network). Open dataset initiative (2021-heden).
Bron: LAION-5B Dataset; Christoph Schuhmann et al., LAION-5B (2022)