Types d'agents IA, triés selon ce que vous souhaiteriez créer
Recherchez les types d’agents IA et chaque résultat vous donne la même liste. Réflexe simple, basé sur un modèle, basé sur des objectifs, basé sur l'utilité, apprentissage. C’est la taxonomie des manuels d’intelligence artificielle, elle est antérieure à tous les modèles que vous envisagez, et elle est répétée sur presque toutes les pages qui se classent dans ce sens car elle est facile à écrire et impossible à discuter.
C’est également inutile pour construire quoi que ce soit. Cette taxonomie trie les agents en fonction de la procédure de décision qui s'exécute en leur sein, et lorsque vous expédiez un logiciel au-dessus d'un modèle de langage, la procédure de décision n'est pas une chose que vous choisissez. Vous écrivez une invite, vous remettez certains outils, et le fait que le résultat se comporte de manière réflexive ou délibérative est une propriété émergente que vous observez par la suite. Vous ne pouvez pas le sélectionner dans un menu.
Les deux propriétés que vous sélectionnez sont ce que l'objet est autorisé à toucher et sa durée d'exécution. Ce sont des décisions que vous prenez explicitement, dans le code, avant que quoi que ce soit ne soit déployé. Ce sont également les deux propriétés qui déterminent ce que cela vous coûte et ce que cela peut casser, c'est pourquoi elles valent la peine d'être possédées.
Triez-en un : ce qu'il peut toucher
Cet axe concerne le rayon de l’explosion et il comporte trois positions.
Rien. Une invite d'entrée, une sortie complète, aucun outil du tout. C’est la forme que prennent réellement la plupart des choses appelées agents, et il n’y a aucune honte à cela. Le coût par appel est prévisible, l’échec est une mauvaise réponse et personne n’a besoin d’une piste d’audit pour dormir.
Lecture seule. Le modèle peut rechercher des éléments : un index de recherche, votre documentation, une base de données dans laquelle il ne peut pas écrire. Il s’agit d’une récupération, et la propriété intéressante est que se tromper reste peu coûteux. Une mauvaise recherche produit une mauvaise réponse, qui est le même mode d'échec que la bande précédente avec plus de surface sur laquelle cela se produit.
Écrire. Le modèle peut changer quelque chose en dehors de lui-même. Effectuez le remboursement, envoyez l'e-mail, mettez à jour le dossier, fusionnez la succursale. C’est le seul groupe où la catégorie change véritablement, parce qu’une erreur persiste désormais dans un système dont dépend quelqu’un d’autre, et survit à la conversation qui l’a produite.
Presque toutes les questions difficiles concernant les agents concernent en réalité ce troisième groupe. La discipline utile consiste à énumérer les outils d'écriture avant de choisir un modèle, un framework ou un fournisseur, et à décider pour chacun s'il peut se déclencher sans surveillance, nécessite une confirmation ou ne peut être que proposé. Il s’agit d’une décision en matière de produit et de responsabilité, et aucune qualité de modèle ne remplace sa prise. Il y a plus d'informations sur la ligne de responsabilité ce qui sépare un agent conversationnel d'un chatbot.
Trier deux : combien de temps il dure
Cet axe concerne l’argent, et c’est celui que les gens estiment le plus mal.
Un coup. Un appel, une réponse. Le coût correspond à la longueur de l’invite plus la longueur de la réponse, et vous pouvez le calculer sur papier.
Boucle limitée. Le modèle appelle un outil, lit le résultat, décide à nouveau et s'arrête après un nombre fixe de tours. Ce qu'il faut comprendre, c'est que tout le contexte accumulé est renvoyé à chaque tour, car les modèles sont apatrides en dessous. Votre contribution n'est pas payée une fois, elle est payée à nouveau à chaque étape, et le dernier tour d'une session coûte un multiple du premier.
Ouvert. La boucle s'exécute jusqu'à ce que le modèle décide qu'elle est terminée. C'est la forme avec le pire comportement en termes de coûts du catalogue, car la croissance est quadratique du nombre d'étapes et le nombre d'étapes est choisi en fonction de l'objet pour lequel vous payez. Tout ce qui se trouve dans cette bande nécessite un plafond strict sur les tours et sur le nombre total de jetons, fixé par vous plutôt que par l'agent.
Plutôt que d’estimer tout cela, mesurez-le. Prenez une transcription réaliste de la forme que vous envisagez, comptez ce qu'une étape tardive envoie réellement avec un compteur de jetons, et transmettez-la via le calculateur de coût LLM au nombre d'étapes que vous attendez. La réponse n’a généralement rien à voir avec le chiffre que les gens atteignent en consultant un seul message, et c’est ce qui décide si vous résumez l’historique, le mettez en cache ou limitez la session.
Le multi-agent est une décision de coordination, pas une mise à niveau
Les systèmes multi-agents sont décrits comme le sommet d'une échelle, l'étape vers laquelle vous obtenez votre diplôme. Ils ne se situent pas au-dessus des systèmes à agent unique. Il s’agit d’un métier différent, et ce que vous échangez, c’est le contexte.
Diviser un agent en plusieurs signifie que chacun ne détient qu’une partie de l’image. Lorsque les sous-problèmes sont réellement séparables, cela représente une économie : chaque agent transmet une invite plus petite, et les petites invites ciblées sont moins chères et plus fiables qu'une seule énorme. Lorsque les sous-problèmes ne sont pas séparables, vous payez pour renvoyer le contexte partagé à chaque agent, vous ajoutez un aller-retour entre chaque paire d'entre eux et vous introduisez le mode d'échec dans lequel deux agents ont des vues contradictoires sur le même état et aucun des deux ne se trompe.
Plusieurs agents gagnent leur place dans trois situations, et il vaut la peine d’être honnête, ils sont plus étroits que ne le suggère l’enthousiasme.
- Les sous-problèmes sont véritablement indépendants, le contexte n'a donc pas besoin d'être partagé en premier lieu.
- Les limites d'autorisation diffèrent. Un agent capable d'écrire ne devrait pas également être celui qui lit des entrées non fiables, et les séparer est un argument de sécurité plutôt qu'un argument de performances.
- Le contexte ne doit pas se mélanger, car une partie de l'œuvre voit des données, une autre partie n'est pas autorisée à voir.
En dehors de ceux-ci, un agent unique avec plus d'outils est généralement la réponse la plus simple, la moins chère et la plus déboguable, et plus simple n'est pas ici un prix de consolation.
La grille dans laquelle vous choisissez réellement
Traversez les deux axes et vous obtenez le petit nombre de formes qui existent en pratique. Un appel unique sans outils, qui est une fonctionnalité et non un agent. Une boucle délimitée avec des outils en lecture seule, qui est une récupération et couvre une grande partie du travail réel. Une boucle délimitée avec des outils d'écriture, qui est la première forme nécessitant des approbations et une piste d'audit. Une boucle ouverte avec des outils d'écriture, qui est la plus performante et celle qui ne devrait jamais être livrée sans plafonds et sans kill switch.
Notez qu'aucun de ces noms n'apparaît sur le classement des pages pour cette question, et que chacun d'entre eux vous indique quelque chose sur ce qu'il faut construire. Les catégories du manuel vous indiquent comment appeler la chose une fois qu'elle existe. Lisez la suite de nos écrits sur la création de ces systèmes.