Astuce · Anthropic Official Blog & Claude Platform Documentation
Réduisez de 50 % les coûts de l'API Claude grâce au traitement par lots pour l'analyse de documents à grande échelle
Photo: kenny cheng sur Unsplash
L'API Message Batches de Claude vous permet de soumettre jusqu'à 10 000 requêtes de manière asynchrone à moitié prix par rapport aux appels en temps réel — idéale pour traiter de grands ensembles de documents, classer des tickets ou enrichir des données pendant la nuit. Plutôt que de payer le prix fort pour chaque requête API individuelle, le traitement par lots réduit les coûts de 50 % tout en finalisant la plupart des lots en moins d'une heure, permettant à votre équipe de gérer des flux de travail massifs sans complexité d'infrastructure.
L'API Message Batches de Claude est conçue pour les équipes professionnelles qui traitent de grands volumes de données non sensibles au temps réel. Au lieu d'effectuer des appels API individuels qui consomment chacun des ressources de calcul complètes, le traitement par lots regroupe des centaines ou des milliers de requêtes, permettant à l'infrastructure d'Anthropic d'optimiser l'allocation des ressources sur l'ensemble du groupe. Le résultat : vous payez 50 % de moins par requête.
Voici comment cela fonctionne concrètement. Imaginez que vous gérez des tickets de support client — disons 5 000 qui arrivent chaque jour et nécessitent une classification des sentiments et un étiquetage par catégories. Avec l'API synchrone, vous enverriez chaque ticket un par un, en payant le prix fort (3 $ par million de jetons d'entrée) et en atteignant les limites de débit. Avec l'API Batches, vous soumettez les 5 000 tickets d'un coup dans un fichier JSONL, vous attribuez à chacun un custom_id unique, et vous laissez Anthropic les traiter au cours des 1 à 24 heures suivantes à 1,50 $ par million de jetons d'entrée à la place. La plupart des lots sont finalisés en moins d'une heure ; tous sont terminés dans les 24 heures. Vous téléchargez ensuite les résultats au format JSONL, en faisant correspondre les sorties aux tickets via les custom_id.
Pour les pipelines d'enrichissement de données, les économies se cumulent. Un flux de travail typique traitant 500 000 enregistrements par mois permet d'économiser plus de 1 000 $/mois en utilisant le traitement par lots plutôt que les appels synchrones. Combiné à la mise en cache des invites (qui stocke votre invite système côté serveur avec une réduction de 90 % sur les jetons mis en cache), les économies totales atteignent 95 % sur certaines charges de travail.
La configuration est simple : formatez vos requêtes dans un fichier JSONL avec un custom_id unique par requête, envoyez-les à l'endpoint des lots, interrogez l'état de finalisation, puis récupérez les résultats. Chaque requête peut échouer indépendamment — le champ request_counts de l'objet de lot suit en temps réel les comptes de réussite, d'erreur, d'annulation et de traitement. Pour les équipes qui exécutent déjà Claude en production, basculer les tâches non urgentes vers le traitement par lots est l'une des optimisations au meilleur retour sur investissement disponibles en 2026.
Sources & crédits
Source originale: Anthropic Official Blog & Claude Platform Documentation