Databricks Inc. a étendu aujourd'hui son modèle de recherche Adaptive Instructed-Retriever pour accélérer les temps de réponse aux demandes des agents d'intelligence artificielle qui nécessitent plusieurs cycles de récupération.
La société a déclaré que le modèle est un élément de base de récupération pour ses Genie Code, Genie One et Genie Agents qui correspond à la qualité de récupération de plusieurs principaux modèles tiers et open source tout en répondant deux fois plus vite que Claude Sonnet 5 d'Anthropic PBC, GPT-5.6 Luna d'OpenAI Group PBC et V4-Flash de Hangzhou DeepSeek Artificial Intelligence Co. Ltd. Les résultats proviennent d'un mélange de sept références internes et externes couvrant différents domaines et niveaux de difficulté de recherche.
Adaptive Instructed-Retriever s'appuie sur Instructed-Retriever-1, un modèle publié plus tôt cette année qui cherchait à améliorer la génération conventionnelle augmentée par récupération en transportant des instructions utilisateur, des exemples et des schémas de source de données tout au long du processus de récupération et de génération de réponses. Databricks a précédemment signalé que l'architecture améliorait les performances de plus de 70 % par rapport au RAG traditionnel sur une suite de tests de réponse aux questions d'entreprise.
Le modèle précédent effectuait des recherches parallèles en une seule étape, ce qui le rendait suffisamment rapide pour de nombreuses requêtes de routine. Adaptive Instructed-Retriever est destiné aux questions qui nécessitent des preuves provenant de plusieurs sources ou qui s'appuient sur des résultats antérieurs. Ce processus nécessite généralement qu'un agent affine les requêtes au fur et à mesure qu'il rassemble des preuves, chaque étape supplémentaire augmentant le temps de réponse et le coût de calcul.
Le nouveau modèle de Databricks tente de gérer ce compromis de manière dynamique. Les développeurs définissent un nombre maximum d'étapes de recherche séquentielles et le modèle détermine combien sont nécessaires pour chaque demande. Il s'arrête lorsqu'il conclut que les preuves disponibles sont suffisantes et poursuit ses recherches lorsqu'un autre cycle est susceptible d'améliorer la réponse.
L'approche est destinée aux agents de données qui doivent localiser des informations dans de vastes espaces de travail changeants. Les recherches simples devraient revenir rapidement, tandis que les tâches de découverte plus difficiles peuvent prendre plus de temps et d'argent. L’objectif est de rendre la recherche plus intelligente afin que les informations puissent être trouvées « sans perdre de temps en exploration par force brute », a déclaré la société dans une explication.
Databricks a formé le modèle avec des environnements de récupération d'entreprise synthétiques et des questions multi-sauts, en réutilisant les données d'Instructed-Retriever-1 pour conserver ses capacités en une seule étape. Il a ensuite appliqué l’apprentissage par renforcement en ligne à l’aide de l’optimisation des politiques d’échantillonnage par importance tronquée. Le système de récompense favorise les trajectoires de recherche précises tout en pénalisant les étapes supplémentaires qui ne produisent pas les gains de qualité correspondants.
La société a déclaré que varier l'ampleur de cette pénalité créait une famille de points de contrôle modèles avec différentes positions sur la courbe qualité-latence. Une pénalité plus lourde favorise moins d'étapes et des réponses plus rapides, tandis qu'une pénalité plus légère permet d'effectuer davantage de recherches pour obtenir une qualité de récupération supérieure. Les clients peuvent choisir un point de contrôle adapté à une application interactive ou à une charge de travail hors ligne plus lente.
Dans un test décrit par Databricks, Adaptive Instructed-Retriever a vérifié qu'une entreprise n'avait pas explicitement répertorié les coûts de restructuration dans son compte de résultat de l'exercice 2022 en deux étapes de recherche. Claude Sonnet 5 a atteint le même score de rappel en trois étapes, et GPT-5.6 Luna en a pris quatre.
Les comparaisons sont basées sur les propres tests de Databricks et incluent des références exclusives, de sorte que les affirmations n'ont pas été vérifiées de manière indépendante. La société n'a pas divulgué le nombre de paramètres du modèle, les prix ou les détails de disponibilité générale dans l'annonce.
Il a été formé à l'aide de Databricks AI Runtime, que les clients peuvent également utiliser pour spécialiser les modèles en fonction de leurs propres exigences en matière de données et de performances. La société a déclaré que des modèles plus petits et spécifiques à des tâches peuvent rivaliser avec les systèmes frontières en apprenant non seulement comment effectuer une recherche, mais aussi quand une recherche plus approfondie en vaut la peine.