Tarifs de l'API Claude : ce qui vous est réellement facturé
Recherchez les prix de l'API Claude et vous obtenez des tableaux. Les tableaux sont la partie d'une page de tarification la plus susceptible d'être erronée au moment où vous la lisez, car les tarifs changent et les articles de blog ne changent pas. Anthropic publie lui-même les tarifs actuels par modèle, sur sa documentation sur les prix, et cette page est la seule à laquelle il vaut la peine de se fier pour un chiffre.
Ce qui mérite plutôt d’être expliqué, c’est la structure, car elle change à peine et c’est elle qui décide de votre facture. Une fois que vous savez sur quelles dimensions vous êtes facturé, vous pouvez lire n'importe quel tableau publié n'importe quel jour et déterminer ce que vous allez dépenser.
Vous êtes facturé sur plusieurs types de tokens
Le titre est la tarification par jeton divisée en entrée et sortie. Sur chaque modèle, les jetons de sortie coûtent plus cher par jeton que les jetons d'entrée, et généralement par un large multiple. Ce simple fait réorganise la plupart des intuitions en matière de coûts. Un travail qui lit un document volumineux et renvoie un bref verdict est bon marché. Un travail qui lit un bref mémoire et écrit longuement ne l'est pas, même si le second déplace beaucoup moins de jetons au total.
Ainsi, la première question à poser concernant toute fonctionnalité dont vous évaluez le coût n’est pas la quantité de texte impliquée, mais la direction dans laquelle va le texte.
La mise en cache est un tarif distinct, pas une remise
La mise en cache des invites vous permet de réutiliser une partie déjà traitée d'une invite dans plusieurs requêtes, et elle est facturée sur ses propres lignes plutôt que intégrée dans l'entrée. L'écriture dans le cache coûte plus cher que l'envoi des mêmes jetons qu'une entrée ordinaire. La lecture coûte une fraction du tarif d’entrée ordinaire.
Cette forme a une conséquence qui mérite d’être internalisée : la mise en cache est un investissement qui doit être récupéré. Payer la prime une fois, puis relire le contenu mis en cache plusieurs fois représente une économie importante. Le payer et ne jamais le relire est une perte. Les caches expirent également, donc la fréquence d'arrivée de votre trafic compte autant que la taille du bloc mis en cache.
L'API Batch échange la latence contre le coût
Les demandes qui n'ont pas besoin de réponse maintenant peuvent être soumises de manière asynchrone via l'API Batch, qui bénéficie d'une remise sur les entrées et les sorties. Les remblais, les évaluations, l'enrichissement nocturne et la classification en vrac sont les solutions naturelles. Tout ce qu’une personne attend ne l’est pas.
L'utilisation de l'outil ajoute des jetons que vous n'avez pas écrits
Donner un modèle d'outils ajoute des jetons d'entrée au-delà de votre propre invite : les définitions d'outils elles-mêmes et une invite système supplémentaire incluse par l'API pour permettre l'utilisation des outils. Les résultats de l'outil reviennent également en entrée. Rien de tout cela n’est caché, et tout cela est facile à oublier lors de l’estimation à partir de la seule longueur de votre invite.
Les outils côté serveur peuvent également facturer leurs propres frais basés sur l'utilisation en plus des jetons, de sorte qu'une fonctionnalité qui ressemble à un appel d'API peut être facturée sur deux dimensions.
Un jeton n'est pas une quantité fixe de texte
Différentes générations de modèles utilisent différents tokeniseurs, ce qui signifie que la même chaîne ne produit pas le même nombre de jetons sur chaque modèle. Comparer deux modèles uniquement par leur tarif par jeton n’est donc pas une comparaison de ce qu’ils vous coûteront. La comparaison souhaitée est le taux multiplié par les jetons que le modèle produit réellement pour votre texte.
Il s’agit de l’erreur la plus courante dans les estimations de coûts établies à partir d’un tableau de prix, et c’est la raison pour laquelle il faut compter avant de multiplier.
Estimer avant de construire
La méthode n’est pas glamour et fonctionne. Prenez une demande représentative, comptez ses jetons d'entrée avec un compteur de jetons, décidez approximativement combien de temps vous attendez la réponse, puis appliquez les tarifs publiés actuellement et multipliez par votre volume attendu. Notre calculateur de coût LLM effectue le calcul et vous permet de comparer les modèles côte à côte.
Faites cela une fois pour le chemin le plus fréquenté de votre produit et vous constaterez généralement que la facture est dominée par une seule chose, et non répartie uniformément. Trois leviers le font bouger : quel modèle gère la demande, la quantité de contexte que vous renvoyez à chaque appel et la quantité que vous demandez au modèle d'écrire. La mise en cache et le traitement par lots sont des améliorations supplémentaires, et aucune ne sauve une conception qui envoie une grande invite à un modèle coûteux pour produire une longue réponse que personne ne lit.
Pour en savoir plus sur la construction à partir de ces modèles, consultez le reste de nos écrits.