La startup de web scraping Firecrawl clôture un investissement de 75 millions de dollars

Firecrawl Inc., un fournisseur d'outils de web scraping pour les agents d'intelligence artificielle, aujourd'hui annoncé qu'il a levé 75 millions de dollars de financement.

Les agents IA s'appuient sur les informations du Web pour un large éventail de tâches. En théorie, ils peuvent accéder à ces données à l’aide d’un navigateur classique. En pratique, cependant, la collecte de grands volumes de données sur des sites Web implique de nombreux défis techniques. Firecrawl a construit une plate-forme qui facilite ces défis pour les développeurs.

La première condition préalable à la collecte des données dont un agent IA a besoin pour une tâche est de trouver la page Web qui les contient. Firecrawl fournit un moteur de recherche optimisé par agent qui peut filtrer les pages Web en fonction de leur date de création, du type de fichiers qu'elles hébergent et d'autres paramètres. L'entreprise affirme que l'outil est plus efficace que les moteurs de recherche destinés aux utilisateurs humains.

Certaines pages Web se chargent en plusieurs phases plutôt qu'en même temps. Lorsque les web scrapes traditionnels rencontrent de telles pages, ils tentent souvent de télécharger leur contenu avant la fin du chargement, ce qui peut entraîner des erreurs de qualité des données. Firecrawl affirme que sa plate-forme évite de tels problèmes grâce à une fonction dite d'attente intelligente.

Dans de nombreux cas, certaines parties d'un site Web ne se chargent que si les utilisateurs font défiler, cliquent sur un élément de l'interface ou soumettent un formulaire. Firecrawl affirme que sa plateforme peut effectuer ces actions automatiquement. Les développeurs peuvent personnaliser la manière dont le logiciel interagit avec les pages Web en saisissant des invites décrivant ce qu'il doit faire.

La plateforme promet également de faciliter plusieurs tâches de collecte de données connexes. Firecrawl peut extraire des détails clés des fichiers PDF, Word et autres fichiers hébergés sur des sites Web qui posent un défi aux scrapers Web traditionnels. Il est également capable de surveiller les pages Web qui vous intéressent pour détecter les modifications. Une startup de logiciel en tant que service, par exemple, pourrait configurer Firecrawl pour suivre les mises à jour de la page de tarification des produits d'un rival.

La société a annoncé aujourd'hui l'étape de financement d'un nouveau service cloud appelé Alexandria. Il combine des données Web avec des informations provenant de fournisseurs tiers et des ensembles de données organisés par Firecrawl. Un ensemble de données contient des dizaines de millions de résumés d’articles scientifiques, tandis qu’un autre comprend un nombre similaire de fichiers de code et de documentation.

Les agents IA peuvent utiliser Alexandria pour combler les lacunes des données Web. Un assistant de programmation, par exemple, pourrait enrichir des exemples de code provenant d'un forum de développeurs avec des explications provenant de l'un des ensembles de données techniques organisés par Firecrawl.

Les agents disposent également d’autres moyens de combiner des informations provenant de plusieurs sources. Cependant, ces approches nécessitent souvent que les développeurs créent un connecteur personnalisé pour chaque source. Firecrawl affirme que toutes les données d'Alexandria sont disponibles via une seule interface d'application, ce qui réduit le besoin de code personnalisé.

L'entreprise utilisera son nouveau financement pour améliorer le service. Selon Firewall, une grande partie du capital sera consacrée à l'ajout d'informations provenant de davantage de fournisseurs de données tiers. Il prévoit de lancer « prochainement » un système de licence de contenu en libre-service pour accélérer le processus.

Newsletter

Rejoignez notre newsletter pour des astuces chaque semaine