Ce que les services d'intégration d'IA ne citent pas
Recherchez des services d’intégration d’IA et les résultats sont un répertoire. Listes de fournisseurs, grilles de capacités, logos classés par secteur. Ce que presque aucun d'entre eux ne décrit, c'est le travail lui-même, c'est pourquoi les devis qui reviennent sont si difficiles à comparer : ils sont évalués par rapport à différentes images du travail.
L'intégration est présentée comme une décision concernant le modèle à utiliser. Cette décision prend un après-midi et est réversible. Le reste est de la plomberie, et la plomberie est là où passent les mois, où se situent les coûts et où la chose survit à une année de trafic réel ou cesse tranquillement d'être utilisée.
Il y a quatre questions sous toute intégration. D'où vient le contexte, qui est autorisé à le voir, que se passe-t-il lorsque quelque chose ne répond pas et comment une mauvaise réponse est détectée avant qu'un client ne la lise. Une proposition qui ne répond pas à ces quatre critères n’est pas moins chère. Il vous a transféré ces parties sans vous le dire.
D'où vient le contexte
Un mannequin ne sait rien de votre entreprise jusqu'à ce que quelque chose la place devant lui. Ce quelque chose est une étape de récupération, et c'est la partie du système qui détermine réellement la qualité de la réponse. Le modèle est proche d’une constante parmi les fournisseurs. Votre récupération ne l’est pas.
Les questions ici sont peu glamour et décisives. Quels systèmes détiennent la vérité et lesquels en détiennent une copie périmée. La rapidité avec laquelle un changement dans la source atteint l'index et qu'arrive-t-il à une réponse donnée dans l'intervalle. Si un document qui était correct le trimestre dernier est toujours renvoyé aujourd'hui et si quelque chose le marque comme obsolète. Que le même fait apparaisse à trois endroits avec trois valeurs différentes, ce qui est courant et qu'aucun modèle ne peut résoudre à votre place.
Les pilotes les plus décevants sont des problèmes de récupération portant un costume de mannequin. Le symptôme habituel est un assistant qui a raison sur la forme générale des choses et qui a tort sur le cas spécifique, ce qui est exactement ce qui arrive lorsque les connaissances générales viennent de la formation et que les connaissances spécifiques ne sont jamais arrivées. Nous avons rédigé la conception de récupération que ce site exécute dans un article sur RAG pour les sites de conseil.
Qui est autorisé à le voir
Le moyen le plus rapide de créer une démo fonctionnelle consiste à tout indexer avec un seul compte de service capable de tout lire. Le moyen le plus rapide de créer un incident est de l’expédier.
Les autorisations doivent être appliquées lors de la récupération, et non demandées au modèle dans une instruction. Un modèle auquel on demande poliment de ne pas révéler quelque chose sera généralement conforme et on ne pourra pas s'y fier, car les instructions et le contenu partagent un seul canal et quiconque tape dans la case écrit également dans ce canal. La seule version durable de cela est qu'un document que l'utilisateur ne peut pas lire n'est jamais récupéré dans le contexte en premier lieu.
Cela signifie que l'identité de la personne qui demande doit parcourir toute la chaîne et que l'index doit contenir des métadonnées d'accès qui restent à jour lorsqu'une autorisation change en amont. Il s'agit d'une ingénierie ordinaire, ce n'est pas difficile et elle est systématiquement exclue des propositions car elle est invisible dans une démo où une personne est connectée en tant qu'elle-même.
Que se passe-t-il lorsque rien ne répond
Les fournisseurs de modèles échouent lentement. Une requête ne génère généralement pas d'erreur, elle se bloque, et la différence est importante car un blocage se propage vers le haut, quel que soit l'appelant. L'intégration nécessite donc un comportement défini pour le cas où la réponse n'arrive pas : combien de temps elle attend, ce que voit l'utilisateur, si la demande est réessayée et si une nouvelle tentative peut répéter un effet secondaire déjà survenu.
Ce dernier est le tranchant. Si l'étape qui a expiré a déjà émis un remboursement, envoyé un e-mail ou rédigé un enregistrement, une nouvelle tentative est effectuée deux fois. Tout ce qui change d'état nécessite un identifiant qui fait de la deuxième tentative une non-opération plutôt qu'une deuxième action. Il s'agit d'une pratique courante dans le domaine des paiements et elle est inégalement appliquée dans le câblage des agents, où la nouvelle tentative est souvent ajoutée plus tard par quelqu'un qui corrige une plainte de flou.
Il existe également une réponse de conception qui mérite d'être préparée : ce que fait le système lorsque le modèle est tout simplement indisponible pendant une heure. Un mode dégradé qui renvoie des résultats de recherche, ou une file d'attente, ou un message honnête est une décision. Tomber est aussi une décision, mais personne n’a pris cette décision.
Comment une mauvaise réponse est détectée
Chaque déploiement produit finalement un résultat erroné en toute confiance. La question qui permet de prévoir les coûts n’est pas de savoir à quelle fréquence, mais plutôt de savoir où ira ensuite cette production.
Triez l’intégration en fonction de ce qu’elle peut toucher. Les résultats qu’un humain lit avant d’agir constituent une classe de risque. Les résultats écrits dans un système d’enregistrement, envoyés à un client ou utilisés pour déplacer de l’argent constituent une tout autre classe, et aucun chiffre d’exactitude ne fait disparaître la différence entre ces deux éléments. Énumérez les actions d'écriture avant de choisir quoi que ce soit d'autre et décidez pour chacune si elle peut se déclencher sans surveillance, nécessiter une confirmation par une personne ou ne peut être proposée que. Cet axe est abordé dans un article sur le tri des agents en fonction de ce qu'ils peuvent toucher.
Se pose ensuite la question du constat. Une intégration de modèle se dégrade silencieusement : pas d'exception, pas d'alerte, juste des réponses légèrement moins utiles qu'elles ne l'étaient, parce qu'une source a changé de forme ou qu'une invite a été modifiée ou que le fournisseur a livré une nouvelle version. Pour saisir cela, il faut un ensemble de vraies questions avec de bonnes réponses connues, exécutées selon un calendrier, avec quelqu'un qui lit le résultat. Il est peu coûteux à construire au départ et difficile à moderniser, et c'est la ligne la plus souvent absente d'un devis.
La longueur du contexte est une contrainte, pas une stratégie
Un raccourci récurrent consiste à ignorer la récupération et à tout mettre dans l'invite, au motif que la fenêtre est désormais suffisamment grande. Il s'agit d'une option réelle et elle a des coûts réels : chaque requête transporte l'intégralité de la charge utile, la latence évolue avec elle, et les éléments pertinents enfouis dans un contexte long ne sont pas traités de manière aussi fiable que les éléments sélectionnés pour leur pertinence.
Considérez la fenêtre comme un budget que vous dépensez plutôt que comme un classeur. Si vous voulez voir comment les modèles actuels se comparent réellement sur ce budget, la comparaison de fenêtre contextuelle les répertorie côte à côte, et le compteur de jetons transforme un document que vous envisagez de coller en un nombre avant de vous y engager.
Que demander à un fournisseur
Les propositions à prendre au sérieux y répondent sans être poussées :
Quels systèmes seront lus, comment l'index reste à jour et qu'arrive-t-il à une réponse donnée alors qu'elle est périmée. Comment les autorisations du demandeur sont appliquées lors de la récupération. Quel est le délai d'attente, ce que l'utilisateur voit lorsqu'il se déclenche et quelles actions sont protégées contre une nouvelle tentative répétée. Quelles actions le système peut entreprendre sans personne, nommée individuellement. Qu'est-ce que l'ensemble d'évaluation, qui le lit et quel seuil déclenche une restauration.
Rien de tout cela ne concerne le modèle. Tout cela détermine si l’intégration sera toujours utilisée l’année prochaine, et un fournisseur qui l’a déjà fait sera soulagé d’être interrogé.