Infinity lève 15 millions de dollars pour exécuter l'inférence IA sur n'importe quel chipset

La société de recherche sur les infrastructures d'IA en phase de démarrage, Infinity Inc., a déclaré avoir levé 15 millions de dollars en financement de démarrage pour développer un logiciel qui prépare automatiquement de nouvelles puces d'intelligence artificielle pour exécuter des charges de travail d'inférence.

Le cycle valorise l'entreprise à 100 millions de dollars sur une base post-argent. Infinity utilisera le capital pour élargir son équipe d'ingénierie, faire évoluer sa plate-forme de recherche automatisée et accélérer les partenariats avec les fabricants de puces, notamment d-Matrix Corp. La société a déclaré qu'elle générait déjà des millions de dollars de revenus annuels récurrents grâce à des partenariats de conception de puces.

La technologie de base de l'entreprise est Ignition, un agent d'IA qui génère, teste et optimise les logiciels de bas niveau nécessaires pour exécuter efficacement des modèles sur différents processeurs. Infinity cible un obstacle de longue date pour les concurrents potentiels de Nvidia Corp. : même lorsque leur matériel est compétitif, il leur manque un écosystème logiciel mature comparable à Cuda de Nvidia. La société a déclaré que sa technologie pouvait aider à relâcher l'emprise de Nvidia sur le marché des processeurs d'IA en générant ce qui est effectivement une pile logicielle de niveau Cuda en quelques heures ou jours.

Ignition automatise « la création de débogueurs, de profileurs, de compilateurs, de noyaux, l'orchestration des noyaux dans l'inférence et de nombreuses autres étapes », a déclaré le fondateur et directeur général Jeremy Nixon.

Les noyaux informatiques sont des routines logicielles spécialisées qui effectuent des opérations mathématiques de base sur les puces IA. Traditionnellement, les ingénieurs doivent les écrire et les régler pour chaque combinaison d'architecture et de modèle de processeur, ce qui rend difficile pour le nouveau matériel de suivre le rythme de l'évolution rapide de la technologie de l'IA.

Infinity a déclaré que les ingénieurs humains déterminent les outils qu'Ignition doit créer, tandis que l'agent gère la mise en œuvre. Pour travailler avec des jeux d'instructions propriétaires, la société construit des décompilateurs, qui traduisent le code exécutable en code source de haut niveau pouvant être manipulé à l'aide de langages de programmation standard.

« Les humains décident quels outils l'IA va construire, comme un compilateur de configuration de la mémoire, tandis qu'Ignition s'occupe de la construction », a déclaré Nixon.

Des résultats rapides

La société a déclaré qu'Ignition avait augmenté le débit d'inférence pour le modèle Qwen3-8B de 34 % par rapport au framework vLLM largement utilisé après une journée d'optimisation automatisée. Nixon a déclaré que le test utilisait un seul processeur graphique Nvidia H100 et n'avait pas encore été validé de manière indépendante.

Dans le cadre d'un projet avec d-Matrix, Infinity a déclaré que son logiciel atteignait jusqu'à 92 % des performances théoriques maximales de l'accélérateur Corsair de l'entreprise en 10 heures. Il y est parvenu en répartissant les opérations de multiplication matricielle sur les 32 unités de calcul. Infinity a déclaré que Qwen3, Qwen3.5 et Gemma4 fonctionnaient entièrement sur la puce dans un délai de 10 jours.

Infinity teste les logiciels générés avec des outils qui appliquent la mémoire requise et le comportement numérique. « Nous construisons des systèmes de vérification précis « bit par bit », des détecteurs d'encombrement de mémoire et bien plus encore », a déclaré Nixon.

La startup décrit Ignition comme un système d'auto-amélioration récursive, ce qui signifie qu'il enregistre les succès et les échecs, construit des outils pour préserver les techniques réussies et construit une représentation des problèmes précédemment résolus pour rendre les optimisations ultérieures plus efficaces.

Le modèle de revenus d'Infinity lie la rémunération aux améliorations qu'elle produit plutôt qu'aux frais de licence logicielle. Nixon a déclaré que les accords d'optimisation donnent généralement à Infinity environ 20 % d'économies sur les achats informatiques supplémentaires, calculées à partir des gains de débit du modèle par rapport à une référence convenue.

La société a été fondée il y a un an par Nixon, ancien chercheur de Google Brain et co-fondateur du centre communautaire hybride AGI House Labs Inc., du laboratoire d'IA appliquée et de la société de capital-risque. Infinity a déclaré que le nouveau financement soutiendrait également les discussions avec d'autres sociétés de puces.

Newsletter

Rejoignez notre newsletter pour des astuces chaque semaine