AI Daily
Volver al inicio

Consejo · Google Cloud Blog & Gemini API Documentation

Extrae datos estructurados de documentos con la restricción de esquema JSON de Gemini

Extrae datos estructurados de documentos con la restricción de esquema JSON de Gemini

Foto: Markus Spiske en Unsplash

El modo de salida estructurada de Gemini obliga a las respuestas a ajustarse a un esquema JSON predefinido, eliminando la inconsistencia del análisis de texto de formato libre. Esta técnica transforma el procesamiento de documentos —facturas, informes, contratos, formularios— de un frágil scraping de texto a una extracción de datos confiable y lista para producción que se integra directamente con bases de datos y flujos de automatización.

Pedirle a un modelo de lenguaje que extraiga datos de un documento normalmente devuelve texto que luego tienes que analizar: a veces es JSON, a veces un párrafo, a veces algo intermedio. Esta imprevisibilidad rompe los pipelines automatizados. El modo de salida estructurada de Gemini resuelve esto restringiendo la salida del modelo para que se ajuste a un esquema que defines de antemano. En lugar de analizar lo que sea que Gemini devuelva, especificas la estructura exacta —nombres de campos, tipos de datos, campos obligatorios, enumeraciones— y el modelo devuelve una salida válida y tipada cada vez. El flujo de trabajo comienza definiendo tu esquema. Para un sistema de extracción de facturas, podrías especificar: título (cadena), número_de_factura (cadena), fecha (cadena), partidas (matriz de objetos con nombre_del_artículo, cantidad, precio_unitario, subtotal), monto_total (número) y condiciones_de_pago (cadena). Pasas este esquema junto con tu documento a Gemini, y el modelo devuelve JSON que se ajusta estrictamente a esa estructura. Sin errores de análisis, sin desajustes de tipos, sin casos límite donde un campo aparece inesperadamente como cadena cuando tu sistema espera un número. La diferencia práctica en los flujos de trabajo reales es inmediata. Un equipo de cuentas por pagar que procesa 200 facturas mensuales antes extraía datos a una hoja de cálculo, corregía manualmente los errores de formato y luego los subía a su sistema de contabilidad. Con la salida estructurada, suben el PDF de la factura a Gemini, reciben JSON validado en segundos y lo canalizan directamente a su sistema —cero intervención manual. Un equipo de cumplimiento que clasifica documentos legales devuelve no solo la clasificación, sino también metadatos extraídos (partes involucradas, tipo de contrato, fecha de renovación, límites de responsabilidad) en una estructura predefinida que se integra con su sistema de gestión documental. Gemini 2.0 y modelos posteriores manejan documentos de hasta 1 millón de tokens, lo que significa que puedes enviar informes completos de varias páginas, contratos o estados financieros en una sola solicitud sin dividirlos ni perder contexto. El modelo también preserva la estructura visual —las tablas siguen siendo tablas, no se aplastan en listas—, lo cual es fundamental para una extracción precisa de datos a partir de diseños complejos. Para los desarrolladores, esto elimina la necesidad de un análisis regex frágil o validadores de salida hechos a mano. La restricción ocurre a nivel del modelo, lo que convierte a Gemini en un motor confiable de extracción de datos, no en un generador de texto que luego tengas que limpiar.

Fuentes y créditos

Fuente original: Google Cloud Blog & Gemini API Documentation