PrismML lance Bonsai 2 27B, un modèle d'IA haute intelligence si petit qu'il s'adapte au matériel grand public

Prism ML Inc. a annoncé jeudi le lancement de Bonsai 2 27B, la deuxième génération de son intelligence artificielle générative multimodale ultra-compacte suffisamment petite pour tenir sur les PC et certains appareils mobiles haut de gamme.

La société a déclaré avoir utilisé le ternaire, qui utilise trois parties, pour réduire son modèle basé sur Qwen3.8 27B. Qwen3.8 pèse environ 56 Go dans sa taille totale de 16 bits non compressée, et Bonsai 2 le réduit à environ 5,9 Go tout en conservant environ 98,2 % de ses capacités.

Bien qu’il soit possible de réduire les modèles d’IA à l’aide d’autres techniques de compression appelées quantification, ces méthodes suppriment généralement la précision, les connaissances et d’autres capacités systématiques. L'empreinte mémoire minimale de Qwen3.8 est d'environ 9,4 gigaoctets.

Ternary fournit une méthode de compression intéressante lors de la réduction des « poids » ou des paramètres qui composent le modèle. Les poids sont les cadrans numériques du modèle qui contrôlent la manière dont il traite les informations et génère des résultats. Dans les modèles grandeur nature, ceux-ci sont représentés par 16 bits ; avec l'approche de PrismML, ceux-ci sont simplifiés en ternaire, ou trois bits, représentés par +1, 0 et -1. Cela permet à l’entreprise de stocker des informations dans une empreinte mémoire beaucoup plus réduite tout en conservant une intelligence raisonnablement élevée.

Essentiellement, cela permet au Bonsai 2 de dépasser largement sa catégorie de poids avec une très petite taille.

Sur les benchmarks, Bonsai 2 a montré des performances proches sur les appels d'agents et d'outils par rapport à Qwen3.8 à moins de 3 points, à 77,6 et 79,8 respectivement ; avec des scores globaux de 81,6 et 82,2 pour le codage sur HumanEval+, LiveCodeBench v6, MBPP+ et BigCodeBench ; et 82.7 et 81.3 pour les connaissances et le raisonnement sur MMLU-Redux, GPQA Diamond et AA-LCR.

Le modèle peut fonctionner sur une carte Nvidia GeForce GTX 5090 sans quantification, atteignant 143 jetons par seconde et 46,8 jetons par seconde sur la puce M5 Max d'Apple Inc. La société a déclaré que le modèle consomme extrêmement peu d'énergie par jeton, soit 0,714 mégawattheures, ce qui le rend 40 % plus économe en énergie que les autres modèles 8B fonctionnant avec une précision maximale, c'est-à-dire non compressé.

Les modèles ultra-petits permettent aux utilisateurs d’exécuter l’IA localement sur leurs propres machines sans envoyer d’inférence au cloud. Chaque fois que des données sont envoyées sur Internet, il peut y avoir un retard dans la réception d'une réponse ou des informations sensibles peuvent être envoyées à un tiers. L'apport d'intelligence sur une machine locale élimine le partage de données avec des tiers, maintient les invites et les réponses locales, contribue à respecter les réglementations strictes en matière de confidentialité et peut améliorer la sécurité.

Par exemple, une simple traduction, un résumé et une organisation de recherche pourraient être exécutés sur un appareil, tandis que la compréhension et la recherche de tâches à long terme pourraient devoir être envoyées vers un modèle cloud coûteux. Pour un utilisateur quotidien, ou même un cas d'utilisation en entreprise, exécuter un modèle local beaucoup moins coûteux et respectueux de la confidentialité lorsqu'une tâche est simple et implique des informations sensibles, tout en évoluant vers des modèles hautement intelligents basés sur le cloud pour gérer un travail complexe, à forte sensibilité et axé sur les objectifs.

Le nouveau modèle fonctionne sur les unités de traitement graphique Nvidia via CUDA et sur les appareils Apple, notamment Mac, iPhone et iPad, via MLX, via des noyaux low-bit. Les poids des modèles sont disponibles aujourd'hui sous licences Apache 2.0.

Newsletter

Rejoignez notre newsletter pour des astuces chaque semaine