Refiant lève 5 millions de dollars pour affiner les modèles d'IA avec une efficacité énergétique « inspirée de la nature »

L'objectif de Refiant est simple, mais extrêmement ambitieux : il veut convaincre l'industrie de l'IA d'arrêter de dépenser des milliards de dollars dans la construction de centres de données massifs et gourmands en énergie et de se concentrer plutôt sur la création de modèles plus petits et plus efficaces. Pour ce faire, elle a développé des algorithmes de compression « inspirés de la nature » qui, selon elle, peuvent réduire de plus de 80 % les besoins énergétiques de la plupart des modèles.

La startup estime que le boom actuel des infrastructures d’IA est tout simplement insoutenable. Les grands géants de la technologie tels qu'Amazon.com Inc., Microsoft Corp., Google LLC, Meta Platforms Inc. et Oracle Corp. se sont engagés collectivement à dépenser près de 700 milliards de dollars en centres de données cette année, tandis que leurs demandes en matériel ont conduit à des pénuries paralysantes de composants clés comme les puces mémoire.

La raison du boom des infrastructures d’IA réside dans le large consensus selon lequel les modèles les plus puissants ne peuvent fonctionner que sur des clusters massifs d’unités de traitement graphique. Ils doivent être refroidis par des systèmes de refroidissement spécialisés et gourmands en énergie, qui consomment d’énormes quantités d’énergie.

Refiant affirme que cela a conduit à une situation dans laquelle seules les entreprises les plus riches sont aujourd’hui en mesure d’héberger les grands modèles linguistiques les plus avancés. Cela oblige tout le monde à envoyer ses données sensibles vers des serveurs hébergés dans le cloud et appartenant à ces géants de la technologie.

La startup estime que cela crée non seulement un risque pour la vie privée, mais encourage également une plus grande inefficacité des charges de travail d’IA, car les géants du cloud en tirent d’immenses profits. En outre, on craint que l’industrie de l’IA s’approche rapidement d’un plafond, car les besoins énergétiques des centres de données dépassent la disponibilité électrique.

La compression de modèle offre une solution intéressante à ce problème. La sauce secrète de Refiant réside dans la façon dont il gère les poids et le recyclage des modèles. La startup explique que les techniques de compression traditionnelles doivent sacrifier l'intelligence et la précision du modèle d'IA, et pour contourner ce problème, elle a développé une nouvelle approche mathématique qui imite l'optimisation biologique.

Le co-fondateur Viroshan Naicker est un mathématicien expérimenté qui a passé des années à rechercher des réseaux et des systèmes quantiques. Il soutient qu’il est mathématiquement possible de faire beaucoup plus avec beaucoup moins d’énergie. « La nature ne construit pas par la force brute. Au lieu de cela, l'évolution optimise », a-t-il déclaré. « Nous avons appliqué ce principe à l'IA et les résultats parlent d'eux-mêmes. »

La société a fourni la preuve de cette affirmation lorsqu'elle a récemment démontré comment elle avait compressé un modèle de 120 milliards de paramètres pour fonctionner sur un ordinateur portable MacBook Pro standard avec seulement 12 Go de mémoire vive. Normalement, un tel modèle nécessiterait un minimum de 80 Go de VRAM haut de gamme.

Il est impressionnant de constater que pratiquement rien n’a été sacrifié en procédant ainsi. Selon Naicker, le modèle a conservé environ 95 à 99 % de sa fidélité d'origine et était capable de traiter environ 3 000 jetons par heure. Elle est presque 100 fois plus économe en énergie que la configuration standard du centre de données utilisée pour héberger des modèles de cette taille.

Les démonstrations sont une chose, et l'objectif de Refiant est désormais de montrer qu'il peut réussir à faire évoluer son approche mathématique de la compression de modèles. Il a déclaré qu'il était en pourparlers avec un certain nombre d'entreprises technologiques qui souhaitent exécuter des modèles d'IA sur leur propre matériel sur site afin de maintenir la « souveraineté » et d'éviter l'escalade des coûts de l'infrastructure d'IA hébergée dans le cloud. Pendant ce temps, il s'efforce d'appliquer sa technique à des taux de compression encore plus élevés et à des fenêtres contextuelles plus longues.

« La plus grande contrainte de l'IA n'est pas la demande, mais l'énergie », a déclaré Joseph Goodman, associé directeur de VoLo Earth. « Ce qui manque, c'est un moyen de calcul fondamentalement plus efficace, mais l'architecture de Refiant remplace la mise à l'échelle par force brute par une approche beaucoup plus efficace, inspirée de la nature, qui réduit la consommation d'énergie tout en augmentant les capacités. C'est le genre de percée nécessaire pour rendre l'IA durable à l'échelle mondiale. »

Newsletter

Rejoignez notre newsletter pour des astuces chaque semaine