Anthropic PBC a annoncé son intention d'intégrer un filigrane invisible dans le texte et les images générés par Claude.
Le registre signalé le changement aujourd'hui, citant un article du service d'assistance publié lundi. Il s'applique à la série de modèles d'intelligence artificielle Claude et aux services Anthropic qu'elle alimente.
Le mécanisme de filigrane est conçu pour mettre Claude en conformité avec la loi sur l'IA de l'Union européenne. La loi, entrée en vigueur en 2024, comprend une clause volontaire connue sous le nom de Code de bonnes pratiques qu'Anthropic a signée. La disposition oblige les fournisseurs de modèles à marquer le contenu généré par l’IA.
Anthropic indique que le filigrane de texte sera effectué sur les modèles Claude sortis après le 2 août. Il prévoit d'apporter cette fonctionnalité aux modèles précédents plus tard. Selon l'entreprise, le filigrane est invisible et persiste si le texte qui le contient est copié vers d'autres applications. Il peut même rester en place si les utilisateurs apportent des modifications.
La société n'a pas précisé comment fonctionne le filigrane textuel. Cependant, un document de recherche publié par Google DeepMind en 2024 pourrait fournir des indices. L'article décrit une technologie qui modifie les choix de mots d'un modèle de langage pour rendre détectable le texte qu'il génère. Le mécanisme de filigrane d'Anthropic peut utiliser une méthode similaire.
Le mécanisme de filigrane de DeepMind prend en charge non seulement le texte, mais également les images, vidéos et audio générés par l'IA. La technologie, connue sous le nom de SynthID, est intégrée à plusieurs services d'IA grand public de Google LLC. Anthropic prévoit également de marquer les fichiers multimédias générés par Claude. L'article du service d'assistance de la société publié lundi répertorie JPG, PNG et SVG parmi les formats d'image couverts par l'initiative.
Anthropic marquera les images à l'aide d'une technologie appelée C2PA. Il fonctionne en associant les images générées par l'IA à un fichier de métadonnées qui spécifie quel modèle les a créées, quand et si des restrictions de droits d'auteur s'appliquent. Les développeurs peuvent également ajouter d'autres détails.
C2PA comprend plusieurs mécanismes conçus pour empêcher les pirates informatiques de falsifier les métadonnées des images. Il crée un hachage, ou un identifiant unique, de chaque fichier de métadonnées qui facilite la détection des modifications. La technologie peut également détecter lorsque des pirates tentent de remplacer l’intégralité du fichier de métadonnées plutôt que de le modifier.
Anthropic prévoit de publier des outils qui permettront aux utilisateurs de détecter plus facilement le contenu généré par Claude. Cependant, la société a prévenu que la technologie ne serait pas parfaite. En particulier, il ne détecte pas toujours les filigranes intégrés dans des extraits de texte courts ou fortement modifiés.
OpenAI Group PBC a également signé le code de bonnes pratiques volontaire de l'AI Act. La disposition est entrée en vigueur la semaine dernière, ce qui signifie que le développeur ChatGPT pourrait bientôt lancer son propre mécanisme de filigrane de texte. OpenAI créé une mise en œuvre d'une telle fonctionnalité en 2024 et siège au comité de pilotage du consortium qui développe C2PA.