L’avenir de l’inférence de l’intelligence artificielle n’est pas une priorité ; c'est omniprésent et banalisé.
Cela peut sembler étrange de la part d’une personne travaillant dans le secteur des semi-conducteurs d’IA. La sagesse conventionnelle suggère que la marchandisation détruit la valeur, donc si l’inférence de l’IA devenait peu coûteuse et largement disponible, le marché diminuerait.
Mais l’histoire suggère le contraire. Les technologies qui remodèlent les industries restent rarement rares. L’électricité, le haut débit, le cloud computing et le stockage ont tous suivi le même chemin. À mesure qu’ils sont devenus plus abordables, plus fiables et plus faciles à déployer, la demande n’a pas diminué. Il a explosé.
L’inférence de l’IA approche du même point d’inflexion. La prochaine phase de l’IA ne sera pas définie en préservant l’inférence comme une capacité rare et premium avec une rentabilité unitaire élevée. Elle sera définie en réduisant suffisamment le coût de l’inférence pour que les organisations cessent de rationner son utilisation et commencent à intégrer l’IA dans tout ce qu’elles font.
Il ne s’agit pas d’une course vers le bas. C'est l'aube d'un marché plus vaste.
Le piège du luxe
L’IA est actuellement tarifée, commercialisée et déployée comme un produit de luxe. L'industrie reste concentrée sur des accélérateurs rares, des systèmes haut de gamme, des déploiements coûteux et sur l'extraction des performances maximales de chaque ressource disponible.
Cette dynamique limite également l’adoption, encourageant les entreprises à considérer l’IA comme une ressource précieuse. Les équipes d'ingénierie rationalisent l'utilisation des jetons, limitent les appels d'interface de programmation d'applications et limitent les déploiements pour empêcher les factures de cloud computing de devenir incontrôlables. Même Microsoft Corp. limiterait l’utilisation de l’IA.
Pour que l’IA devienne véritablement omniprésente, les organisations ne devraient pas avoir à déterminer si une autre interaction avec l’IA est économiquement justifiée. Même si l’économie des unités inférieures peut sembler menaçante pour une industrie construite autour de l’informatique haut de gamme, l’inverse est plus susceptible d’être vrai.
La truffe à 27$ et le chocolat à 99 cents
Les anciens fournisseurs de matériel craignent que la baisse des coûts unitaires ne réduise le marché total de l’IA. Mais la baisse des coûts d’inférence crée également de nouveaux clients, charges de travail et modèles économiques.
Imaginez un chocolatier gastronomique qui vend des truffes artisanales à 27 $ pièce. La truffe artisanale bénéficie d'une marge élevée, mais sa clientèle est limitée.
Comparez cela à une barre de chocolat à 99 cents. Le marché du chocolat ne se rétrécit pas parce que le produit est bon marché ; il se développe parce que des millions de personnes peuvent se le permettre. Cette échelle, à son tour, prend en charge des produits, des modèles de distribution et des activités entièrement nouveaux.
À mesure que l’inférence devient plus abordable, les organisations qui ne pouvaient auparavant pas justifier d’importants déploiements d’IA le peuvent soudainement. Les services d'IA existants deviennent plus rentables car chaque amélioration de l'efficacité de l'inférence réduit les coûts d'exploitation et améliore la rentabilité des applications déjà en production.
Les entreprises peuvent commencer à repenser leurs services autour d’une utilisation continue de l’IA – y compris l’intelligence ambiante, les systèmes autonomes et les assistants permanents – car les aspects économiques permettent enfin de les exploiter à grande échelle. La marchandisation ne réduit pas la valeur de l'inférence ; cela permet à l’inférence de créer de la valeur dans bien plus d’endroits.
Au-delà du dragster numérique
Pensez aux automobiles. Un dragster à haut carburant est une merveille d'ingénierie de plusieurs millions de dollars, capable de performances extraordinaires. Mais presque personne ne veut en conduire un pour se rendre au travail tous les matins et aucune entreprise de logistique ne construirait sa flotte de livraison autour d'un tel véhicule.
L’économie mondiale repose sur des véhicules de masse fiables et efficaces comme la Toyota Camry et le Ford Transit. Ils sont abordables, faciles à entretenir, fiables à grande échelle et conçus pour un usage quotidien.
L’infrastructure de l’IA doit atteindre un point similaire. Un marché de masse pour l'inférence ne peut pas être défini uniquement par le système qui produit le résultat de référence le plus impressionnant dans des conditions idéales. Les organisations se soucient davantage de ce qu’un système peut fournir de manière cohérente, économique et à grande échelle. La question n’est pas de savoir ce qui est le plus rapide mais ce qui est le plus productif et efficace.
Mesurer les résultats, pas l'activité
Les métriques utilisées pour évaluer l’IA doivent évoluer en conséquence. Les lignes de code générées, les requêtes par seconde et les scores de référence sont des mesures d'ingénierie utiles, mais elles ne sont pas identiques aux résultats commerciaux.
Les entreprises n'investissent pas dans l'IA parce qu'elles souhaitent générer plus de code ou de jetons. Ils investissent parce qu’ils veulent en faire plus. Lorsque l’inférence devient plus abordable, les organisations peuvent consacrer moins de temps à optimiser chaque invite et jeton et plus de temps à se concentrer sur le travail rendu possible par l’IA.
La marchandisation nécessite plus qu’une inférence moins coûteuse. Cela nécessite un changement dans la façon dont l’industrie définit elle-même la performance. Plutôt que de mesurer le niveau d'activité d'un système en termes de débit, les futures mesures de la véritable valeur commerciale devraient se concentrer sur des résultats tels que les taux d'achèvement des tâches, l'accélération de l'activité et les économies de temps et d'argent.
L’infrastructure de l’IA pour l’économie mondiale doit être conçue pour faire partie des opérations commerciales quotidiennes. Il doit être suffisamment abordable pour être déployé à grande échelle, suffisamment efficace pour fonctionner en continu et suffisamment pratique pour s'intégrer dans les environnements de serveurs existants.
La véritable révolution de l’IA commence lorsque l’inférence devient si courante que personne n’y réfléchit à deux fois avant de l’utiliser, non pas parce que l’inférence a perdu de sa valeur, mais parce qu’elle est devenue suffisamment précieuse pour tout le monde.
Marshall Choy est directeur commercial de la société de semi-conducteurs Rebellions Inc. Il a écrit cet article pour SiliconANGLE.