· Pandaily
StepFun ने 1M टोकन कॉन्टेक्स्ट वाला Step 5 Preview LLM जारी किया
फोटो: Alina Grubnyak Unsplash पर
StepFun ने 20 सितंबर 2026 को Step 5 Preview की घोषणा की, जो 600 अरब पैरामीटर वाला विरल Mixture-of-Experts मॉडल है और प्रति टोकन 27 अरब सक्रिय पैरामीटर रखता है। मॉडल में दस लाख टोकन का कॉन्टेक्स्ट विंडो है और Artificial Analysis के Intelligence Index पर इसका स्कोर 44 है। इसकी कीमत प्रति दस लाख इनपुट टोकन 1 डॉलर और प्रति दस लाख आउटपुट टोकन 2.70 डॉलर है, साथ ही 95% कैश छूट उपलब्ध है।
StepFun ने 20 सितंबर 2026 को आधिकारिक रूप से Step 5 Preview लॉन्च किया और उसी दिन API एक्सेस खोल दिया। यह मॉडल एक विरल Mixture-of-Experts आर्किटेक्चर पर आधारित है, जिसे लंबी अवधि के एजेंट वर्कलोड के लिए डिज़ाइन किया गया है, जिनमें AI कोडिंग, सॉफ्टवेयर इंजीनियरिंग, वित्तीय विश्लेषण और पेशेवर ज्ञान-आधारित कार्य शामिल हैं। यह टेक्स्ट और इमेज इनपुट का समर्थन करता है और इसका कॉन्टेक्स्ट विंडो दस लाख टोकन का है-जिससे लंबे दस्तावेज़ और विस्तृत कोड रिपॉज़िटरी एक ही API कॉल में समा जाते हैं।
मॉडल में व्यापक नेटवर्क के बजाय 92-लेयर का नैरो-डीप Transformer लेआउट इस्तेमाल किया गया है। StepFun का तर्क है कि गहरे आर्किटेक्चर लंबे प्रीफिल ऑपरेशन के दौरान तर्क के लिए जानकारी के लंबे पथ उपलब्ध कराते हैं। दस लाख टोकन वाले सत्रों की गणनात्मक मांगों को संभालने के लिए Step 5 Preview में Sparse Grouped-Query Attention के साथ ब्लॉक-वाइज़ टोकन मर्जिंग शामिल की गई है, जो इंडेक्सर और टॉप-k चयन की लागत को घने बेसलाइन के लगभग आठवें हिस्से तक कम कर देती है।
Artificial Analysis Intelligence Index पर Step 5 Preview का स्कोर 44 है, जो Kimi K3 Max के बराबर है और इसे GPT-5.6 Sol जैसे फ्रंटियर मॉडलों की तुलना में काफी कम लागत पर प्रतिस्पर्धी बनाता है। मॉडल 99.8 टोकन प्रति सेकंड की गति से आउटपुट उत्पन्न करता है और पहले टोकन तक पहुंचने का समय 2.96 सेकंड है। कीमत प्रति दस लाख इनपुट टोकन 1 डॉलर और प्रति दस लाख आउटपुट टोकन 2.70 डॉलर तय की गई है, साथ ही 95% कैश छूट उपलब्ध है।
ओपन वेट 15 अक्टूबर 2026 के लिए निर्धारित हैं, हालांकि Hugging Face रिपॉज़िटरी में फिलहाल केवल एक .gitattributes फ़ाइल मौजूद है। StepFun के अनुसार, प्रशिक्षण में ऑन-पॉलिसी लॉन्ग-हॉरिज़न रीइन्फोर्समेंट लर्निंग पर ज़ोर दिया गया, जिसमें लोड-अवेयर शेड्यूलिंग, MTP-3 स्पेक्युलेटिव डिकोडिंग, FP8 MoE और KV-कैश ऑफलोड जैसी तकनीकें शामिल हैं, जिससे लॉन्ग-हॉरिज़न रीइन्फोर्समेंट लर्निंग कार्यों में तीन गुना से अधिक एंड-टू-एंड त्वरण हासिल हुआ।
स्रोत और क्रेडिट
मूल स्रोत: Pandaily