Astuce · Google Cloud Blog & Gemini API Documentation
Extrayez des données structurées de documents avec la contrainte de schéma JSON de Gemini
Photo: Markus Spiske sur Unsplash
Le mode de sortie structurée de Gemini force les réponses à respecter un schéma JSON prédéfini, éliminant l'incohérence de l'analyse de texte libre. Cette technique transforme le traitement de documents — factures, rapports, contrats, formulaires — d'un scraping de texte fragile en une extraction de données fiable et prête pour la production, qui s'intègre directement aux bases de données et aux flux d'automatisation.
Demander à un modèle de langage d'extraire des données d'un document renvoie généralement du texte que vous devez ensuite analyser : parfois c'est du JSON, parfois un paragraphe, parfois quelque chose entre les deux. Cette imprévisibilité casse les pipelines automatisés. Le mode de sortie structurée de Gemini résout ce problème en contraignant la sortie du modèle à se conformer à un schéma que vous définissez à l'avance. Au lieu d'analyser ce que Gemini renvoie, vous spécifiez la structure exacte — noms de champs, types de données, champs obligatoires, énumérations — et le modèle renvoie une sortie typée et valide à chaque fois.
Le flux de travail commence par la définition de votre schéma. Pour un système d'extraction de factures, vous pourriez spécifier : titre (chaîne), numéro_facture (chaîne), date (chaîne), lignes_articles (tableau d'objets avec nom_article, quantité, prix_unitaire, sous_total), montant_total (nombre), et conditions_paiement (chaîne). Vous transmettez ce schéma avec votre document à Gemini, et le modèle renvoie un JSON qui se conforme strictement à cette structure. Aucune erreur d'analyse, aucun décalage de type, aucun cas limite où un champ apparaît inopinément comme une chaîne alors que votre système attend un nombre.
La différence pratique dans les flux de travail réels est immédiate. Une équipe de comptabilité fournisseurs traitant 200 factures par mois extrayait auparavant les données dans une feuille de calcul, corrigeait manuellement les erreurs de format, puis téléversait le tout dans son système comptable. Avec la sortie structurée, ils téléversent le PDF de la facture dans Gemini, obtiennent un JSON validé en quelques secondes, et le transmettent directement dans leur système — zéro intervention manuelle. Une équipe de conformité classifiant des documents juridiques renvoie non seulement la classification, mais aussi les métadonnées extraites (parties impliquées, type de contrat, date de renouvellement, plafonds de responsabilité) dans une structure prédéfinie qui s'intègre à leur système de gestion documentaire.
Les modèles Gemini 2.0 et ultérieurs gèrent des documents jusqu'à 1 million de jetons, ce qui signifie que vous pouvez envoyer des rapports multipages entiers, des contrats ou des états financiers en une seule requête sans découpage ni perte de contexte. Le modèle préserve également la structure visuelle — les tableaux restent des tableaux, non aplatis en listes — ce qui est crucial pour une extraction précise des données de mises en page complexes. Pour les développeurs, cela élimine le besoin d'analyse regex fragile ou de validateurs de sortie artisanaux. La contrainte s'opère au niveau du modèle, faisant de Gemini un moteur d'extraction de données fiable, et non un générateur de texte qu'il faut ensuite nettoyer.
Sources & crédits
Source originale: Google Cloud Blog & Gemini API Documentation