← Retour au blog

Conseil en apprentissage automatique et LLM par défaut

Par ··11 min de lecture
machine learning consulting
machine learning consulting firms
machine learning consulting services
MLOps
AI adoption

Recherchez des conseils en apprentissage automatique et chaque résultat est un répertoire. Listes classées des meilleures entreprises, actualisées avec un nouveau mois dans le titre, chacune étant une grille de logos triés par taille et par secteur d'activité. Aucun d'entre eux ne décrit le travail, et aucun d'entre eux ne soulève la question qui décide de l'essentiel du budget : si votre problème nécessite un modèle basé sur votre propre histoire, ou une invite contre celle de quelqu'un d'autre.

Cette question se répondait d'elle-même. Un problème de prédiction était un problème de prédiction et la seule façon d’y parvenir était de construire un modèle. La valeur par défaut a depuis évolué, et elle a évolué jusqu'au bout : un grand nombre de projets commencent désormais par un appel d'API à un modèle de langage, et la décision de le faire est rarement prise explicitement. C'est simplement là que commence la conversation.

Parfois, c’est vrai et l’alternative serait absurde. Il s’agit souvent d’une réponse coûteuse à un problème qui a été résolu à moindre coût, de manière plus prévisible et plus défendable bien avant que quiconque ait entendu parler d’un transformateur. Les distinguer est l'essentiel de ce qu'un engagement compétent fait au cours de la première quinzaine, et cela vaut la peine de pouvoir le faire vous-même avant de commander quoi que ce soit.

Qu'est-ce qui fait encore de quelque chose un problème de ML classique

La forme est reconnaissable et a très peu à voir avec le sujet. Quatre propriétés voyagent ensemble, et lorsque toutes les quatre sont présentes, vous examinez un problème qui nécessite un modèle entraîné.

La décision se répète, en volume, selon un chemin automatisé. Noter chaque transaction, classer chaque résultat de recherche, prévoir la demande par article, par magasin et par semaine. La répétition est ce qui donne de la valeur à un petit gain par décision, et c'est aussi ce qui donne de l'importance au coût par appel.

La sortie est limitée. Une probabilité, une classe d'un ensemble connu, un nombre dans une plage, un classement. Pas de prose, pas de plan, pas d’explication. La réponse a un type, et le type est étroit.

Votre propre histoire est le signal. La raison pour laquelle vous devez vous entraîner sur vos données est que le modèle réside dans vos données : vos clients, votre fraude, votre taux de désabonnement, votre saisonnalité. Un modèle qui a lu Internet n’en sait rien de particulier.

Et la qualité de la réponse est mesurable par rapport aux résultats qui se sont réellement produits. Vous savez qui a baratiné. Vous savez quelles transactions ont été contestées. Cet historique étiqueté est l’atout, et c’est aussi la chose que la plupart des organisations sous-estiment, car il ressemble à de vieux documents plutôt qu’à un modèle.

Le taux de désabonnement, la propension, la prévision de la demande, la notation de la fraude, le risque de crédit, la tarification, le routage, la détection des anomalies par télémétrie, la recommandation et le classement sont tous parfaitement présents ici. Il en va de même pour la plupart de ce que l’on appelle la maintenance prédictive. Le sujet est varié et la forme est identique.

Pourquoi rechercher un modèle de langage, voici la réponse coûteuse

Pas faux dans tous les cas, et coûteux sur plusieurs axes à la fois, dont la plupart sont invisibles dans un prototype.

Le coût évolue en fonction du volume et de la charge utile. Le coût d'un modèle entraîné est presque entièrement payé d'avance, dans la construction, et le coût marginal d'une prédiction est nul. Un modèle linguistique inverse cela : presque rien au départ et une facture attachée à chaque décision, pour toujours, augmentant avec la longueur de ce que vous lui envoyez. Sur une décision qui se déclenche plusieurs fois par jour, la différence n’a pas d’importance. Sur une décision qui se déclenche par requête, par ligne, par événement, c'est la ligne dominante du budget. Si vous souhaitez cela dans vos propres chiffres plutôt que dans le résumé, le calculateur de coûts LLM et le compteur de jetons transforment une invite et un volume en chiffre, et le calculateur de coûts AWS fait de même pour l'hébergement dont un modèle entraîné aurait besoin.

La latence se situe dans une plage différente. Une décision en ligne dans une requête a un budget mesuré en millisecondes, et une réponse générée n'est généralement pas fournie dans ce budget. Pousser l'appel hors du chemin de requête résout la latence et introduit l'asynchronie, qui est un changement de conception plutôt qu'un changement de configuration.

L'étalonnage est celui qui est manqué. Beaucoup de ces problèmes ne veulent pas d’étiquette, ils veulent un score bien élevé : une probabilité que vous pouvez définir, déplacer et raisonner. Les risques, les prix, le routage et tout ce qui implique une file d'attente d'approbation fonctionnent tous de cette façon, car le seuil est une décision commerciale qui est ajustée après le lancement. Un modèle demandé pour une confiance produira un nombre qui ressemble à une probabilité et ne se comporte pas comme telle, et cet écart est invisible lors des tests et coûteux en production.

La stabilité compte plus que ce que les gens pensent. Un modèle entraîné que vous hébergez est un artefact fixe : la même entrée donne la même sortie le trimestre prochain. Un modèle de langage hébergé est une dépendance mobile et la mise à jour d'un fournisseur n'est pas un événement que vous contrôlez. Pour une décision réglementée, ou toute décision que quelqu’un pourrait devoir expliquer ultérieurement, un artefact fixe avec un ensemble d’apprentissage enregistré et un profil d’erreur mesurable constitue une position matériellement plus forte.

Et la supervision est bon marché sur cette forme de problème. Vous avez des étiquettes, vous avez donc une fonction de perte, et vous pouvez mesurer honnêtement un changement avant de l'expédier. L'évaluation d'un système génératif est un projet en soi, sur lequel nous avons écrit séparément. Abandonner cela sur un problème là où vous n’étiez pas obligé de le faire est une véritable perte.

Où un modèle de langage est clairement le bon outil

La version honnête de cet argument doit indiquer où la valeur par défaut est correcte, car c'est souvent le cas.

Une entrée non structurée sans étiquettes est le cas évident. Contrats, tickets, transcriptions d'appels, formulaires numérisés, champs de texte libre que personne n'a jamais validés. L'extraction de la structure de ceux-ci était autrefois un projet de modélisation sur mesure par type de document et constitue désormais en grande partie une invite, et ce changement est réel.

La sortie ouverte est la deuxième. Tout ce dont la réponse est un résumé, un brouillon, une réponse ou une explication n'a pas d'espace de sortie limité sur lequel s'entraîner, donc le cadrage classique ne s'applique pas du tout.

Une longue queue de catégories que vous ne pourriez jamais étiqueter constitue la troisième. Des milliers de cours avec une poignée d'exemples chacun constituent un mauvais problème de formation et un problème raisonnable.

Et les démarrages à froid ont leur place ici. Sans historique étiqueté, un modèle de langage permet aux utilisateurs de disposer d'un système fonctionnel en quelques jours, ce qui permet également de commencer à générer les étiquettes qui vous manquaient. C'est une séquence sonore, à condition que quelqu'un note que la deuxième phase existe.

La combinaison qui gagne habituellement

Le cadrage de l'un ou l'autre est en grande partie faux, et l'arrangement qui tient dans la production utilise les deux pour ce pour quoi chacun est bon.

Utilisez le modèle de langage comme extracteur de fonctionnalités et un modèle formé comme décideur. Le texte du ticket devient une poignée de champs structurés ; un arbre amélioré par gradient, formé sur vos propres résultats, décide de ce qui se passera ensuite. Le composant flexible et coûteux s'exécute une fois par document, le composant calibré bon marché s'exécute pour chaque décision, et la chose que vous devez défendre auprès d'un auditeur est la petite.

Utilisez-le pour amorcer puis distiller. Étiquetez un corpus avec le grand modèle, formez un petit modèle supervisé sur ces étiquettes, servez le petit. Vous payez le coût de génération une fois plutôt que par demande, et vous vous retrouvez avec l'artefact fixe.

Gardez-le pour les exceptions. Un modèle entraîné traite la grande majorité des cas à un coût marginal effectivement nul, et les résidus qui échappent à sa confiance empruntent la voie coûteuse. La plupart des volumes ne touchent jamais au chemin coûteux, ce qui est tout l’intérêt.

Quoi qu’il en soit, les questions de plomberie sont les mêmes que celles auxquelles toute intégration doit répondre, et elles font partie du devis qui décide si l’objet survivra à une année de trafic réel. Nous les avons examinés dans ce que les services d'intégration d'IA ne citent pas, et la question des actions qu'un système peut entreprendre sans surveillance est classée dans types d'agents d'IA.

Ce que contient réellement un engagement classique

La modélisation est la petite partie, et c’est la partie décrite par les grilles de capacités. Le reste est là où passe le temps.

Définir l’étiquette est la première étape et c’est plus difficile qu’il n’y paraît. Qu'est-ce que le taux de désabonnement exact, mesuré sur quelle fenêtre, et c'est la chose sur laquelle vous pouvez prédire la chose sur laquelle vous pouvez agir. Un modèle techniquement excellent d’une mauvaise cible est un gaspillage total et ressemble à un succès à tous les niveaux.

Ensuite, les fuites, qui constituent la cause la plus courante d’échec tardif d’un projet. Une fonctionnalité qui n'est renseignée qu'une fois le résultat obtenu produira un résultat hors ligne spectaculaire et rien en production. Pour les trouver, il faut quelqu'un qui comprenne comment chaque colonne a vu le jour, ce qui est un travail de domaine plutôt qu'un travail de modélisation.

Puis une base de référence, honnêtement construite. La valeur de l'année dernière, la moyenne du segment, la règle que l'équipe opérationnelle utilise déjà dans sa tête. Une part surprenante de modèles ne l’a jamais battu, et ceux qui y parviennent sont beaucoup plus faciles à justifier une fois la comparaison établie.

Ensuite, l'écart entre hors ligne et en ligne, qui consiste à proposer les mêmes fonctionnalités au moment de la prédiction sur lesquelles vous vous êtes entraîné, avec les mêmes définitions, contre des données qui arrivent en retard et parfois pas du tout.

Ensuite le seuil, qui n'est pas une décision de modélisation. Là où vous faites un score, c'est un échange entre ce que coûte un cas manqué et ce que coûte une fausse alarme, et ce sont des chiffres commerciaux qui appartiennent à l'entreprise. Une livraison qui remet un modèle sans cette conversation a remis la moitié de quelque chose.

Puis surveillance de la dérive. Un modèle entraîné se dégrade progressivement à mesure que le monde s’éloigne de son ensemble d’entraînement. Pas d'exception, pas d'alerte, juste des prédictions qui deviennent peu à peu moins utiles, peu coûteuses à instrumenter au début et difficiles à mettre en œuvre ultérieurement.

Que demander aux entreprises figurant sur la liste

Les annuaires sont classés par taille et par logo, ce qui ne vous dit rien de ce dont vous avez besoin. Ces questions séparent les prestataires qui ont fait cela de ceux qui en ont entendu parler.

Demandez quelles preuves les inciteraient à recommander un modèle. Un fournisseur sans réponse vend un modèle quel que soit votre problème.

Demandez quelle est la référence et comment ils vont la mesurer. Demandez ensuite quel résultat serait considéré comme un échec, avant que quoi que ce soit ne soit construit.

Demandez comment l'étiquette est définie et qui la définit. Si cette réponse vous appartient seul, l’engagement est plus mince qu’il n’y paraît.

Demandez où l'inférence sera exécutée, combien cela coûte par décision à votre volume et qu'arrive-t-il à ce chiffre si le volume double.

Demandez à qui appartient l'artefact, les fonctionnalités et l'ensemble de formation à la fin, et si vous pouvez vous recycler sans eux.

Demandez-leur ce qu'ils laisseront derrière eux pour la surveillance et quel seuil déclenche un recyclage ou un retour en arrière.

Aucun de ceux-ci ne concerne le modèle utilisé. Tous décident si la chose est toujours en service l'année prochaine, et une entreprise qui l'a déjà livré sera heureuse d'être sollicitée plutôt que poussée.

Articles similaires