La division Cloud de Google LLC a présenté aujourd'hui l'agent Gemini, un assistant d'intelligence artificielle unifié qui peut agir de manière autonome, générer du code et effectuer un travail sur n'importe quel appareil, y compris le Web, le mobile et le bureau.
La nouvelle expérience d'IA agentique est accessible n'importe où et via n'importe quel canal, y compris la ligne de commande, Google Workspace, Microsoft 365 ou Slack. Il fonctionne même dans des applications tierces et ne nécessite aucune interface dédiée. Il est conçu pour être « omniprésent » et fonctionner partout où se trouve l’utilisateur.
Thomas Kurian, directeur général de Google Cloud, a déclaré que Gemini pouvait répondre à des questions, gérer un travail de connaissances, créer des images et des médias ou prendre des idées et les transformer en produits finis.
« Vous lui donnez des objectifs, pas des instructions. Vous déléguez un résultat et revenez au travail terminé », a-t-il expliqué. « Pour qu'un agent puisse faire cela, il doit être connecté à vos flux de travail personnels, à vos systèmes d'enregistrement et aux contrôles de votre entreprise. »
La nouvelle expérience agent suit également une tendance commune dans l’industrie de l’IA : l’exécution persistante. Cela signifie qu'il conserve un ensemble unique de mémoires, de contexte et de personnalisation sur tous les canaux de communication avec tous ses sous-agents. Il agit comme un coéquipier qui se souvient de tout ce que l'utilisateur lui dit et peut créer des agents collaborateurs plus petits avec leurs propres identités et expertises dédiées, avec leurs propres e-mails @agents.company.com et leur propre stockage persistant. Ils ont également accès uniquement au contexte fourni par l’utilisateur ou les membres de l’équipe.
Google Cloud a ajouté que l'agent Gemini offre une flexibilité dans le choix du modèle. Chaque tâche s'exécute sur un modèle adapté à la tâche à accomplir. Les tâches simples peuvent s'exécuter sur Gemini Flash, un petit modèle rapide pour les tâches quotidiennes simples ou un modèle phare comme Argon pour le travail à long terme. Les modèles Anthropic PBC Claude sont également disponibles aujourd'hui, et d'autres modèles privés et ouverts de premier plan arriveront plus tard.
Sous le capot : compétences et outils
Kurian s'est appuyé sur la vision de Google consistant à fournir une compréhension complète du contexte commercial, de la tarification aux portefeuilles de produits en passant par les normes départementales. Gemini observe et contient l'étendue des connaissances institutionnelles qui rendent une entreprise unique et la met au premier plan, en fondant les réponses sur les données de l'entreprise.
Gemini se connecte en toute sécurité via des outils de collaboration tels que Confluence, Microsoft Office, Teams, Slack et Workspace. Il fonctionne également via des outils tels que Git et Jira, des plates-formes d'entreprise telles que Salesforce et ServiceNow, des bases de données telles que BigQuery, Databricks, Postgres et Snowflake, ainsi que des fichiers sur les ordinateurs de bureau.
Les utilisateurs peuvent également développer des compétences réutilisables qui agissent comme des instructions, des connaissances et des flux de travail qui agissent comme des invites qui apprennent aux agents comment effectuer des tâches spécifiques en plusieurs étapes. Gemini est livré immédiatement avec une bibliothèque mondiale de compétences, mais les utilisateurs peuvent ajouter et publier leurs propres compétences personnalisées dans un registre d'entreprise partagé, et développer des compétences personnalisées en demandant à un agent de prendre une tâche et de la convertir en un modèle réutilisable.
Le système apprend également de chaque question qui lui est posée et de chaque objectif. La mémoire de session, même lorsqu'elle dure plusieurs jours, communique avec les personnes et travaille avec d'autres agents, tout en lisant les documents. Il continue également à mettre à jour sa compréhension de la manière dont les utilisateurs l'utilisent et de ce qu'il devrait produire. Google a déclaré qu'il passait autant de temps à apprendre ce que font les utilisateurs qu'à utiliser des outils.
Google a ajouté qu'il avait fourni des compétences spécialisées conçues pour des domaines spécifiques, à commencer par les données. Par exemple, la société étend Gemini avec des compétences et des outils d'apprentissage automatique pour les scientifiques et les ingénieurs des données. En décrivant un résultat dans un langage simple, Gemini peut générer du code PySpark, fournir un bloc-notes pour le modifier et le tester, former un modèle et résoudre les problèmes par lui-même.
Pour les utilisateurs professionnels, Gemini peut utiliser les compétences opérationnelles en matière de reporting BigQuery et le catalogue de connaissances pour créer et enregistrer des requêtes. Cela permet de créer des rapports opérationnels en temps réel sur simple demande. Une fois enregistrées, les équipes peuvent générer des rapports sans encourir de coûts supplémentaires en jetons, produisant ainsi des réponses cohérentes et vérifiées à chaque fois.
Le contrôle des coûts au premier plan
Google Cloud a souligné que même si les prix par jeton ont considérablement diminué depuis 2024, d'environ 98 %, le volume de l'IA d'entreprise a considérablement augmenté.
Google a annoncé des options de dépenses flexibles en août et celles-ci sont mises en ligne aujourd'hui.
En interne, l'orchestration multimodèle conçue pour choisir le bon modèle pour le travail ou diviser les travaux complexes en modèles rapides pour les petites tâches et en modèles frontières pour les pièces difficiles, réduit encore les coûts. Dans ce cadre, le routage intelligent trie automatiquement les charges de travail de l'entreprise afin que chacune d'elles s'exécute sur le modèle qui offre des performances maximales au coût le plus bas possible.
Enfin, les utilisateurs peuvent fixer des limites strictes aux dépenses en IA dans la console Cloud Billing. Gemini appliquera cela en surveillant l'utilisation des jetons, et si un plafond de dépenses est déclenché, l'agent fait une pause. L'utilisateur peut reprendre le travail dans la console avec approbation, mais cela nécessite d'accepter qu'il dépasse le plafond budgétaire fixé.
Le suivi s’effectuant par projet, les entreprises peuvent imputer les coûts de l’IA à des départements spécifiques. Cela permet aux entreprises d'auditer et de planifier les budgets par équipe et par service, permettant ainsi une répartition des coûts plus granulaire.