À l’incrédulité de beaucoup de gens, des artistes vivants découvrent que leur art a été utilisé pour entraîner des modèles d’IA sans leur consentement. Grâce à un outil Web appelé « Have I Been Trained ? », vous pouvez savoir en quelques minutes si vos images ont été utilisées par Midjourney, NightCafe et d’autres générateurs d’images d’IA populaires.
Si vous trouvez votre image dans l’un des ensembles de données utilisés pour former ces systèmes d’IA, ne désespérez pas. Certaines organisations ont mis au point des moyens de se soustraire à cette pratique, empêchant ainsi que vos images ne soient récupérées sur Internet et transmises à des sociétés d’IA.
Comment les générateurs d’images d’IA sont formés en premier lieu
Lorsque vous demandez à un système d’IA comme DALL-E de générer l’image d’un « chien portant un chapeau d’anniversaire », il doit d’abord savoir à quoi ressemble un chien et à quoi ressemble aussi un chapeau d’anniversaire. Il tire ces informations d’énormes ensembles de données qui rassemblent des milliards de liens vers des images sur l’internet.
Comme nous le savons tous, l’internet contient à peu près tous les types d’images que vous pouvez imaginer, y compris, selon toute vraisemblance, des tonnes d’images d’un « chien portant un chapeau d’anniversaire ». Avec suffisamment de données de ce type, un modèle d’IA peut trouver comment reproduire une image à l’image de celles sur lesquelles il a été entraîné.
Mais qu’en est-il si ces images étaient à l’origine protégées par des droits d’auteur ? Et si ces images appartenaient à des artistes, des photographes ou des personnes ordinaires qui ne savaient pas que leurs images alimentaient un système d’IA ?
Le problème des artistes
De nombreux générateurs d’images d’IA ont un niveau payant où les utilisateurs peuvent acheter des crédits pour créer plus d’images, ce qui leur permet de faire des bénéfices. Mais ce profit est réalisé sur le dos des personnes non créditées dont les images ont été utilisées pour former le système d’IA.
Plus les artistes découvrent que leurs images ont été utilisées pour développer des systèmes d’IA, plus il est clair que tout le monde n’est pas d’accord. Ils souhaitent à tout le moins que les entreprises d’IA obtiennent leur consentement avant d’utiliser leurs images.
En particulier si vous êtes un artiste populaire et connu, le fait que des images soient générées dans votre style peut encombrer votre marché, avec des fans ou des mécènes potentiels qui ne savent pas si l’œuvre a été créée par vous ou reproduite à votre image par l’IA. Pire encore, des personnes peuvent créer des œuvres d’art dans votre style pour soutenir des valeurs auxquelles vous ne croyez pas.
Ce n’est pas un problème nouveau, les deepfakes existent depuis des années et sont potentiellement sur le point d’empirer avec l’essor de l’IA. De nos jours, la reproduction de « faux » art est rapide, bon marché et facile. Il n’existe que quelques moyens d’identifier une image générée par l’IA, ce qui rend difficile de distinguer l’art original de son homologue généré par l’IA.
Ensembles de données : Trouver et indexer vos images
Comme nous l’avons mentionné précédemment, les ensembles de données d’images sont utilisés par les entreprises d’IA pour entraîner leurs modèles. Ces ensembles de données ressemblent à une feuille de calcul Excel géante dont une colonne contient un lien vers une image sur Internet, tandis qu’une autre contient la légende de l’image.
Toutes les entreprises d’IA ne divulguent pas l’ensemble de données qu’elles utilisent, DALL-E en est un exemple. Il est donc difficile de savoir à quoi l’on fait référence lorsqu’elle génère une image et cela ajoute à la mystique générale des systèmes d’IA.
D’autre part, Stable Diffusion, un modèle développé par Stability AI, a clairement indiqué qu’il avait été construit sur le jeu de données LAION-5B, qui comprend un nombre colossal de 5,85 milliards de paires image-texte filtrées par CLIP. Comme cette base de données est en libre accès, tout le monde est libre de visualiser les images qu’elle indexe, ce qui lui a valu de nombreuses critiques.
Au début de l’année 2023, Getty Images a poursuivi Stability AI pour avoir récupéré des images de son site Web afin d’entraîner son générateur d’images IA, Stable Diffusion. Si vous vous demandez qui, à son tour, utilise Stable Diffusion, il s’agit de NightCafe, Midjourney et DreamStudio, quelques-uns des plus grands acteurs du secteur.
Comment savoir si vos images ont été utilisées pour entraîner un modèle d’IA ?
Créé par un groupe d’artistes, Spawning est un collectif dont l’objectif est d’aider les gens à savoir si leurs images figurent dans des ensembles de données comme LAION-5B, utilisés pour entraîner des modèles d’IA. Leur moteur de recherche sur le Web, appelé Have I Been Trained ?, vous permet de rechercher facilement des mots clés tels que le nom de votre artiste.
Ai-je été formé ?
Have I Been Trained fonctionne un peu comme une recherche d’images sur Google, sauf que votre recherche correspond aux résultats de l’ensemble de données LAION-5B. Vous avez la possibilité d’effectuer une recherche par mot-clé ou par image. Cette dernière option est utile si vous souhaitez savoir si une image exacte a été utilisée.
Nous avons utilisé le nom de l’artiste Frida Kahlo (1907-1954) pour le tester et nous avons trouvé un mélange de photographies historiques et de ce qui ressemble à du fan art sous forme de gribouillis, de peintures, de point de croix, de crochet et d’illustrations.
Si vous êtes l’un de ces créateurs, vous êtes l’un des nombreux humains non crédités dont la créativité a rendu possible l’existence des générateurs d’images d’IA. Et avec ce pouvoir, n’importe qui peut maintenant créer des images de Frida comme ce portrait bizarre de « Frida Kahlo mangeant de la glace ».
Essayez de taper le nom de votre propre artiste dans la barre de recherche pour voir si votre travail a été utilisé pour entraîner un modèle d’IA.
Comment se retirer des ensembles de données d’entraînement de l’IA ?
L’équipe à l’origine du site Web Have I Been Trained a créé un outil permettant aux gens d’accepter ou de refuser les systèmes artistiques de l’IA. C’est un moyen pour les artistes de garder le contrôle et les autorisations sur l’utilisation de leurs œuvres et les raisons pour lesquelles elles sont utilisées.
D’autres plateformes artistiques commencent à suivre le mouvement. Actuellement, DeviantArt propose une option permettant d’exclure ses images des recherches effectuées par les ensembles de données d’images.
Have I Been Trained : Outil d’exclusion de l’IA
En plus de pouvoir rechercher votre image, vous pouvez également sélectionner des images à exclure des données d’entraînement du LAION-5B en utilisant le site Have I Been Trained.
Vous devrez d’abord créer un compte, puis cliquer avec le bouton droit de la souris sur une image et choisir de la retirer. Désactiver cette image.
En sélectionnant cette option, cette image sera ajoutée à votre liste d’exclusion à laquelle vous pouvez accéder en cliquant sur le symbole de votre compte dans le coin supérieur droit de la page, puis en sélectionnant Mes listes. Pour la supprimer de votre liste, cliquez avec le bouton droit de la souris sur l’image et sélectionnez Retirer de la liste d’exclusion.
Si vous êtes un artiste prolifique, cette méthode est fastidieuse et ne permet pas de refuser efficacement toutes vos images. Malheureusement, il n’y a pas de meilleure alternative au moment où nous écrivons ces lignes, mais il est probable que des améliorations seront apportées à ce système à l’avenir.
Ces listes d’exclusion sont ensuite transmises à la société à l’origine de LAION-5B, qui a accepté de retirer ces images de son ensemble de données.
Préférence d’opt-out de DeviantArt
DeviantArt a jusqu’à présent montré la voie aux plateformes d’hébergement d’œuvres d’art en donnant aux utilisateurs la possibilité de retirer leurs œuvres. Au départ, il fallait trouver la préférence et cocher la case opt-out. Mais suite à de nombreux retours de la communauté DeviantArt, cette option est désormais activée par défaut.
Cela signifie qu’aucune image publiée sur DeviantArt n’est mise à la disposition des ensembles de données d’images, sauf si les utilisateurs ont choisi de le faire. Bien qu’il ne soit pas entièrement infaillible, le mécanisme utilisé consiste à marquer une image avec une balise HTML « noai ». Cela indique aux jeux de données d’IA que l’image ne peut pas être utilisée et que, si elle l’est, l’entreprise enfreint les conditions d’utilisation de DeviantArt.
Vous pouvez trouver la préférence noai en passant votre souris sur l’icône de votre compte personnel et en cliquant sur Paramètres du compte. Cliquez ensuite sur Général dans le menu de gauche et faites défiler vers le bas jusqu’à ce que vous voyiez le titre Dites aux jeux de données d’IA qu’ils ne peuvent pas utiliser votre contenu..
Respecter le travail des artistes
Trouver un bon compromis entre les systèmes d’IA et les artistes dont le travail contribue à les former prendra du temps. Si vous êtes un créateur, ne vous sentez pas impuissant. Avec des réponses fortes de la part des communautés qui utilisent les plateformes artistiques comme DeviantArt, vous pouvez avoir le contrôle sur qui utilise votre art.
Tout le monde ne voudra pas non plus se retirer, certaines personnes n’ont pas de problème à ce que leurs images forment des modèles d’IA. Mais le plus important, c’est que les entreprises d’IA obtiennent le consentement des utilisateurs et créent un espace équitable et respectueux dans lequel les modèles d’IA et les artistes peuvent cohabiter.
