AI Daily
Retour à l'accueil

Astuce · Anthropic Claude Platform Documentation

Réduisez de 50 % les coûts de l'API Claude grâce au traitement par lots pour les analyses à grande échelle

Réduisez de 50 % les coûts de l'API Claude grâce au traitement par lots pour les analyses à grande échelle

Photo: Antonio Vivace sur Unsplash

L'API Message Batches de Claude vous permet de traiter jusqu'à 10 000 requêtes de manière asynchrone pour moitié moins cher que les appels API standard. Idéale pour les professionnels qui doivent analyser des documents en masse, classer de grands ensembles de données ou enrichir des catalogues produits du jour au lendemain sans impacter les limites d'utilisation en temps réel.

L'API Message Batches est conçue pour les travaux non urgents qui bénéficient d'économies massives. Au lieu d'envoyer les requêtes API une par une et de payer le prix fort pour chacune, vous soumettez jusqu'à 10 000 requêtes en un seul lot, et Anthropic les traite de manière asynchrone sous 24 heures — à 50 % du tarif standard par jeton. Voici comment cela fonctionne concrètement : imaginez que vous êtes un stratège de contenu avec 5 000 tickets de support client à classer en catégories (urgent, facturation, technique, retour produit). Plutôt que de faire passer chaque ticket individuellement par Claude, vous regroupez les 5 000 tickets dans un lot avec un custom_id unique pour chaque requête. Vous soumettez le lot, Anthropic s'occupe du traitement, et les résultats sont livrés sous forme de sortie au format JSONL dans la journée. Le même travail avec des appels API standard coûterait le double. Pour mettre cela en œuvre, utilisez le SDK Anthropic pour créer un objet de requête par lot, spécifiez votre modèle (Claude Opus, Sonnet ou Haiku), ajoutez vos messages et max_tokens pour chaque requête, puis soumettez. Vous interrogez le statut ou configurez des webhooks pour être notifié lorsque le traitement est terminé. Chaque résultat est étiqueté avec son custom_id afin que vous puissiez faire correspondre les sorties à vos données d'origine. La magie se démultiplie lorsque vous combinez le traitement par lots avec la mise en cache des invites. Si chaque ticket de votre lot inclut le même prompt système (« Vous êtes un classificateur de tickets de support »), mettez ce prompt en cache une seule fois. Les requêtes suivantes réutilisent le contenu mis en cache avec une réduction de 90 % du coût des jetons — ce qui signifie des économies totales allant jusqu'à 95 % par rapport aux appels API standard. Pour les équipes qui traitent des centaines de milliers d'enregistrements chaque mois, cette combinaison transforme les dépenses API d'une contrainte budgétaire en un avantage concurrentiel.

Sources & crédits

Source originale: Anthropic Claude Platform Documentation

Réduisez de 50 % les coûts de l'API Claude grâce au traitement par lots pour les analyses à grande échelle — AI Daily