AI Daily
होम पर वापस जाएं

टिप · Google Cloud Blog & Gemini API Documentation

जेमिनी के JSON स्कीमा कंस्ट्रेंट से दस्तावेज़ों से संरचित डेटा निकालें

जेमिनी के JSON स्कीमा कंस्ट्रेंट से दस्तावेज़ों से संरचित डेटा निकालें

फोटो: Markus Spiske Unsplash पर

जेमिनी का संरचित आउटपुट मोड प्रतिक्रियाओं को पूर्व-परिभाषित JSON स्कीमा में बाध्य करता है, जिससे स्वतंत्र-रूप पाठ पार्सिंग की असंगति समाप्त होती है। यह तकनीक दस्तावेज़ प्रसंस्करण—चालान, रिपोर्ट, अनुबंध, फॉर्म—को नाजुक टेक्स्ट स्क्रैपिंग से विश्वसनीय, उत्पादन-तैयार डेटा निष्कर्षण में बदल देती है जो सीधे डेटाबेस और स्वचालन कार्यप्रवाहों के साथ एकीकृत होता है।

किसी भाषा मॉडल से दस्तावेज़ से डेटा निकालने के लिए कहना आमतौर पर ऐसा पाठ लौटाता है जिसे आपको फिर पार्स करना पड़ता है: कभी-कभी यह JSON होता है, कभी-कभी एक पैराग्राफ, कभी-कभी बीच का कुछ। यह अप्रत्याशितता स्वचालित पाइपलाइनों को तोड़ देती है। जेमिनी का संरचित आउटपुट मोड मॉडल आउटपुट को आपके द्वारा पहले से परिभाषित स्कीमा के अनुरूप बाधित करके इसे हल करता है। जेमिनी जो भी लौटाता है उसे पार्स करने के बजाय, आप सटीक संरचना—फ़ील्ड नाम, डेटा प्रकार, आवश्यक फ़ील्ड, एनम—निर्दिष्ट करते हैं, और मॉडल हर बार मान्य, टाइप किया हुआ आउटपुट लौटाता है। कार्यप्रवाह आपकी स्कीमा को परिभाषित करने से शुरू होता है। एक चालान निष्कर्षण प्रणाली के लिए, आप निर्दिष्ट कर सकते हैं: title (स्ट्रिंग), invoice_number (स्ट्रिंग), date (स्ट्रिंग), line_items (item_name, quantity, unit_price, subtotal के साथ ऑब्जेक्टों की ऐरे), total_amount (नंबर), और payment_terms (स्ट्रिंग)। आप इस स्कीमा को अपने दस्तावेज़ के साथ जेमिनी को भेजते हैं, और मॉडल उस संरचना का सख्ती से पालन करने वाला JSON लौटाता है। कोई पार्सिंग त्रुटियाँ नहीं, कोई प्रकार बेमेल नहीं, कोई किनारा मामला नहीं जहां कोई फ़ील्ड अप्रत्याशित रूप से स्ट्रिंग के रूप में दिखाई दे जब आपकी प्रणाली एक नंबर की अपेक्षा करती है। वास्तविक कार्यप्रवाहों में व्यावहारिक अंतर तुरंत स्पष्ट है। प्रति माह 200 चालान प्रोसेस करने वाली एक देय खाता टीम पहले डेटा को स्प्रेडशीट में निकालती थी, प्रारूप त्रुटियों को मैन्युअल रूप से ठीक करती थी, फिर अपने लेखा प्रणाली में अपलोड करती थी। संरचित आउटपुट के साथ, वे चालान PDF को जेमिनी पर अपलोड करते हैं, सेकंडों में मान्य JSON प्राप्त करते हैं, और इसे सीधे अपनी प्रणाली में पाइप करते हैं—शून्य मैन्युअल हस्तक्षेप। कानूनी दस्तावेज़ों को वर्गीकृत करने वाली एक अनुपालन टीम को न केवल वर्गीकरण मिलता है, बल्कि पूर्व-परिभाषित संरचना में निकाला गया मेटाडेटा (शामिल पक्ष, अनुबंध प्रकार, नवीनीकरण तिथि, दायित्व सीमाएँ) भी मिलता है जो उनकी दस्तावेज़ प्रबंधन प्रणाली के साथ एकीकृत होता है। जेमिनी 2.0 और बाद के मॉडल 1 मिलियन टोकन तक के दस्तावेज़ संभालते हैं, जिसका अर्थ है कि आप चंकिंग या संदर्भ खोए बिना एक ही अनुरोध में पूरी बहु-पृष्ठ रिपोर्ट, अनुबंध या वित्तीय विवरण भेज सकते हैं। मॉडल दृश्य संरचना भी संरक्षित करता है—तालिकाएँ तालिकाएँ ही रहती हैं, सूचियों में चपटी नहीं होतीं—जो जटिल लेआउट से सटीक डेटा निष्कर्षण के लिए महत्वपूर्ण है। डेवलपर्स के लिए, यह नाजुक regex पार्सिंग या हाथ से बनाए गए आउटपुट सत्यापनकर्ताओं की आवश्यकता को समाप्त करता है। बाधा मॉडल स्तर पर होती है, जिससे जेमिनी एक विश्वसनीय डेटा निष्कर्षण इंजन बन जाता है, न कि एक टेक्स्ट जनरेटर जिसे आपको फिर साफ करना पड़ता है।

स्रोत और क्रेडिट

मूल स्रोत: Google Cloud Blog & Gemini API Documentation