सभी गाइड्स
समाचार9 मिनट पढ़ें · अपडेट किया गया 27 अगस्त 2026

Qwen3.8-Flash-Next: एक 1M-टोकन ओपन-वेट मॉडल, और वह लाइसेंस डिटेल जिसे ज़्यादातर कवरेज छोड़ रही है

Alibaba की Qwen टीम ने 26 अगस्त 2026 को Qwen3.8-Flash-Next रिलीज़ किया, एक ओपन-वेट मॉडल जो 1M-टोकन कॉन्टेक्स्ट विंडो और एक नए non-parametric embedding table के इर्द-गिर्द बना है। यह Qwen4 के लिए एक असली आर्किटेक्चर प्रीव्यू है, सिर्फ़ एक और साइज़-टियर नहीं। यहां बताया गया है कि यह असल में क्या है, इसकी क़ीमत क्या है, क्या आप इसे ख़ुद चला सकते हैं, और वह एक लाइसेंसिंग डिटेल जिसे कई आउटलेट्स ने ग़लत बता दिया है।

त्वरित उत्तर

Qwen3.8-Flash-Next एक ओपन-वेट मॉडल है जिसे Alibaba ने 26 अगस्त 2026 को रिलीज़ किया, यह आने वाले Qwen4 परिवार के लिए एक स्पष्ट आर्किटेक्चर प्रीव्यू के तौर पर बनाया गया है, न कि मौजूदा Qwen3.8 लाइन का कोई सामान्य साइज़ अपडेट। यह एक 125B-पैरामीटर बैकबोन को 4B multi-token-prediction मॉड्यूल और प्रति टोकन 6B एक्टिव-पैरामीटर बजट के साथ जोड़ता है, और लंबे कॉन्टेक्स्ट पर तेज़ बने रहने के लिए hybrid linear/full attention इस्तेमाल करता है।

इसका सबसे बड़ा आंकड़ा है कॉन्टेक्स्ट लंबाई: नेटिव रूप से 262,144 टोकन, जिसे YaRN के ज़रिए बढ़ाकर 1,000,000 तक किया जा सकता है, जिसे साफ़ तौर पर ऑन करना पड़ता है और यह डिफ़ॉल्ट नहीं है। यह लगभग 750,000 शब्दों के बराबर है, एक ही लगातार विंडो में, जो किसी पूरे लिटरेचर रिव्यू या किताब-जितने बड़े सोर्स-ढेर को एक ही बार में प्रोसेस करने वाले किसी भी व्यक्ति के लिए काम का है।

यह Apache 2.0 नहीं है। वेट्स Qwen Community License 1.0 के तहत आते हैं, जो Qwen3.8-27B के Apache 2.0 शर्तों से कहीं ज़्यादा सीमित लाइसेंस है। कुछ शुरुआती लेखों में यह भाव झलकता है कि दोनों मॉडल एक जैसा लाइसेंस शेयर करते हैं; ऐसा नहीं है। कमर्शियल इस्तेमाल से पहले शर्तें ज़रूर जांच लें।

आप लगभग तय तौर पर इसे घर पर नहीं चला सकते। Unsloth की अपनी गाइडलाइन 1-बिट क्वांटाइज़ेशन पर भी न्यूनतम व्यवहार्य फ़ुटप्रिंट को लगभग 75GB कंबाइंड RAM और VRAM बताती है, यानी व्यावहारिक रूप से एक हाई-एंड Mac Studio या मल्टी-GPU वर्कस्टेशन, कोई एक कंज़्यूमर कार्ड नहीं।

Qwen3.8-Flash-Next की GitHub रिपॉज़िटरी README, जो इसे Qwen4 में इस्तेमाल होने वाले आर्किटेक्चर के एक शुरुआती प्रीव्यू के तौर पर बताती है
QwenLM/Qwen3.8-Flash-Next, GitHub पर, 27 अगस्त 2026 को जांचा गया।

असल में क्या रिलीज़ हुआ, और Alibaba इसे "प्रीव्यू" क्यों कहता है

Qwen3.8-Flash-Next एक sparse mixture-of-experts मॉडल है: एक 125B-पैरामीटर बैकबोन जिसे 512 एक्सपर्ट्स (प्रति टोकन 10 एक्टिव प्लस 1 शेयर्ड, हर एक्सपर्ट 640-डायमेंशनल) के ज़रिए रूट किया जाता है, साथ में एक 51B-पैरामीटर N-gram embedding table और एक 4B multi-token-prediction (MTP) मॉड्यूल है, जिससे 48 लेयर्स में प्रति टोकन असल में 6B एक्टिव पैरामीटर कंप्यूट होते हैं। Hugging Face का अपना मॉडल कार्ड पूरे पैकेज को 180B पैरामीटर बताता है; कुछ सर्विंग-फ़्रेमवर्क डॉक्यूमेंटेशन इसकी बजाय सिर्फ़ बैकबोन प्लस embedding table के लिए 176B बताते हैं, और MTP मॉड्यूल को अलग गिनते हैं, इसलिए स्रोत के हिसाब से दोनों आंकड़े दिखें तो हैरान मत होइए। Alibaba इस मॉडल को Qwen4 के आर्किटेक्चर की एक शुरुआती झलक के तौर पर पेश कर रहा है, जिसे पूरे Qwen4 मॉडल परिवार के तैयार होने से काफ़ी पहले पूरी ओपन वेट्स के रूप में रिलीज़ किया गया है, न कि Qwen3.8-27B (छोटा, Apache-लाइसेंस वाला मॉडल जिसे इस साइट ने 17 अगस्त को कवर किया था) के किसी नंबर वाले उत्तराधिकारी के तौर पर। दोनों मॉडल एक ही टोकनाइज़र और विज़न टावर, और एक ही 262,144-टोकन बेस कॉन्टेक्स्ट शेयर करते हैं, लेकिन वे अलग-अलग सवालों के जवाब देते हैं: Qwen3.8-27B "वह छोटा मॉडल जिसे आप असल में लोकली चला सकते हैं" वाला विकल्प है, और Flash-Next "एक कुशल विशाल मॉडल कितनी दूर तक जा सकता है" वाला आर्किटेक्चर डेमो है। इन दोनों को एक ही रिलीज़ मान लेना, जैसा कि कुछ शुरुआती कवरेज करती है, हर एक की अलग बात को कम करके आंकता है।

N-gram table: सिर्फ़ "ज़्यादा पैरामीटर" नहीं

51B-पैरामीटर N-gram embedding table इस रिलीज़ का वह हिस्सा है जिसे आम कवरेज में सबसे ज़्यादा "यह बड़ा है" तक समेट दिए जाने का ख़तरा है, और यह इसकी असल भूमिका को कम करके आंकता है। यह एक deterministically addressed lookup table है, जो लोकल टोकन n-grams से इंडेक्स होता है, न कि कोई सीखा हुआ mixture-of-experts लेयर जो gating network से होकर रूट करे। चूंकि table के addresses फ़ॉरवर्ड पास चलने से पहले ही मालूम होते हैं, इसलिए संबंधित हिस्सा साधारण होस्ट RAM या SSD स्टोरेज से प्रीफ़ेच किया जा सकता है जबकि बाक़ी मॉडल अभी भी कंप्यूट कर रहा होता है, जिससे लगभग शून्य अतिरिक्त लेटेंसी जुड़ती है। यह नेटवर्क के बग़ल में बैठे एक बहुत बड़े कैश्ड फ़्रेज़ डिक्शनरी जैसा व्यवहार करता है, न कि अतिरिक्त MoE कंप्यूट जैसा, यही वजह है कि इसे 6B एक्टिव-पैरामीटर आंकड़े में नहीं गिना जाता। अटेंशन के लिए, Qwen ने इसे एक hybrid डिज़ाइन के साथ जोड़ा: हर एक फ़ुल-अटेंशन लेयर पर तीन Gated DeltaNet (लीनियर-अटेंशन) लेयर्स, साथ में Qwen Sparse Attention, जिसके बारे में Alibaba के अपने बेंचमार्क दावा करते हैं कि यह पूरे 1M-टोकन कॉन्टेक्स्ट पर 7.6-10.2x तेज़ prefill और 4.9-6.6x तेज़ decoding देता है। ये आंकड़े Qwen के अपने हैं, स्वतंत्र रूप से दोबारा जांचे नहीं गए, इसलिए इस गुणक को तय नहीं बल्कि दिशा-सूचक मानिए।

1M-टोकन कॉन्टेक्स्ट को सही तरीक़े से पाना

मॉडल का नेटिव कॉन्टेक्स्ट 262,144 टोकन है; दावा किए गए 1,000,000-टोकन तक पहुंचने के लिए static YaRN scaling को साफ़ तौर पर ऑन करना ज़रूरी है, यह सिर्फ़ इसलिए अपने-आप नहीं हो जाता कि वेट्स इसे सपोर्ट करते हैं। अगर आप Hugging Face से या किसी क्वांटाइज़्ड कम्युनिटी बिल्ड से डिफ़ॉल्ट कॉन्फ़िग खींच रहे हैं और स्केलिंग सेटिंग्स नहीं जांचते, तो यह क़दम आसानी से छूट सकता है। अगर आपका सेटअप छोटा 262K वाला आंकड़ा दिखाता है, तो यह अपेक्षित व्यवहार है, कोई ख़राब डाउनलोड नहीं।

Qwen3.8-Flash-Next का Hugging Face मॉडल कार्ड, जिसमें qwen-community-1.0 लाइसेंस टैग, 180B पैरामीटर साइज़, और BF16 टेंसर टाइप दिख रहा है
Qwen3.8-Flash-Next का मॉडल कार्ड, huggingface.co, 27 अगस्त 2026 को जांचा गया।

लाइसेंस और एक्सेस: उलझन कहां है

Qwen3.8-Flash-Next, Qwen Community License 1.0 के तहत आता है, न कि उस Apache 2.0 लाइसेंस के तहत जो Qwen3.8-27B को कवर करता है। The Decoder की इस रिलीज़ की कवरेज में यह भाव झलकता है कि दोनों मॉडलों के बीच ओपन-लाइसेंसिंग की बराबरी है; यह सही नहीं है, और इस रिलीज़ में यही वह एक तथ्य है जिसे आपको ख़ुद GitHub पर रिपॉज़िटरी की अपनी LICENSE फ़ाइल के मुक़ाबले दोबारा जांचना सबसे ज़्यादा ज़रूरी है, इससे पहले कि आप इस पर कुछ भी कमर्शियल बनाएं। Qwen की अपनी घोषणा वाली पोस्ट इस रिलीज़ को ख़ास तौर पर एक रिसर्च और कम्युनिटी-टेस्टिंग प्रीव्यू के तौर पर पेश करती है, जो संकरे लाइसेंस से मेल खाता है: Alibaba आर्किटेक्चर पर फ़ीडबैक चाहता है, ज़रूरी नहीं कि अभी अनियंत्रित कमर्शियल दोबारा-इस्तेमाल।

  • Hugging Face: Qwen/Qwen3.8-Flash-Next, साथ ही Unsloth और अन्य से कम्युनिटी FP8, NVFP4, और GGUF क्वांटाइज़ेशन।
  • ModelScope, Alibaba का अपना मॉडल हब, वही वेट्स मिरर करता है।
  • QwenCloud API, OpenAI- और Anthropic-कम्पेटिबल एंडपॉइंट्स, The Decoder की Qwen की अपनी प्राइसिंग पोस्ट की कवरेज के अनुसार लगभग $0.16 प्रति मिलियन इनपुट टोकन और $0.47 प्रति मिलियन आउटपुट टोकन पर क़ीमत।
  • सर्विंग फ़्रेमवर्क: vLLM और SGLang के पास डे-वन रेसिपी हैं; llama.cpp सपोर्ट किसी टैग्ड रिलीज़ की बजाय एक अनमर्ज्ड पुल रिक्वेस्ट (#27742) के तौर पर मौजूद है, इसलिए अगर आप ख़ास तौर पर llama.cpp पर बना रहे हैं तो कुछ खुरदरापन उम्मीद कीजिए।

क्या आप इसे ख़ुद सचमुच चला सकते हैं?

व्यावहारिक रूप से, तभी जब आपके पास सचमुच दमदार हार्डवेयर हो। Unsloth की अपनी क्वांटाइज़ेशन गाइडलाइन आक्रामक 1-बिट क्वांटाइज़ेशन पर भी न्यूनतम सीमा को लगभग 75GB कंबाइंड RAM और VRAM बताती है, जिसका व्यावहारिक मतलब है 96GB-या-उससे-बड़ा Mac Studio, कोई मल्टी-GPU वर्कस्टेशन, या इसके लिए बना एक क्लाउड इंस्टेंस, कोई एक कंज़्यूमर GPU नहीं। अगर यह आपके पास नहीं है, तो QwenCloud API ही मॉडल को सिर्फ़ पढ़ने की बजाय असल में इस्तेमाल करने का व्यावहारिक रास्ता है।

वह एंगल जिसे कोई और कवर नहीं कर रहा: रिसर्च वर्क के लिए 1M टोकन का मतलब

1M-टोकन कॉन्टेक्स्ट विंडो लगभग 750,000 शब्दों के बराबर है, एक ही लगातार पास में, जो किसी पूरे लिटरेचर रिव्यू, किताब-जितने बड़े मैनुस्क्रिप्ट, या किसी बड़े मल्टी-डॉक्यूमेंट सोर्स-ढेर को टेक्स्ट के एक ही ब्लॉक के तौर पर रखने के लिए काफ़ी है, जिसे मॉडल एक ही बार में पूरा पढ़ लेता है। यह Gemini Notebook के बड़े सोर्स-ढेर को संभालने के तरीक़े से सचमुच अलग तरीक़ा है: इसका Pro टियर प्रति नोटबुक 300 सोर्स और प्रति सोर्स 500,000 शब्द की इजाज़त देता है, लेकिन यह हर सोर्स को हर क्वेरी के लिए एक ही कॉन्टेक्स्ट विंडो में लोड नहीं करता। यह सोर्स को इंडेक्स करता है और हर सवाल के लिए संबंधित हिस्सों को रिट्रीव करता है, यही वजह है कि सैकड़ों सोर्स लोड होने पर भी जवाब की क्वालिटी बनी रहती है। Flash-Next जैसा मॉडल जो सब कुछ लगातार पढ़ता है, वह ऐसे क्रॉस-डॉक्यूमेंट कनेक्शन पकड़ सकता है जो सोर्स के आर-पार फैले हों और जिन्हें रिट्रीवल कभी-कभी चूक जाता है; वहीं Gemini Notebook जैसा रिट्रीवल-आधारित टूल उस स्केल (सैकड़ों लंबे डॉक्यूमेंट) पर तेज़ और सुसंगत बना रहता है जिसे किसी भी एक कॉन्टेक्स्ट विंडो में फ़िट करना अव्यावहारिक होगा, चाहे 1M टोकन हों या न हों। कोई भी तरीक़ा पूरी तरह बेहतर नहीं है: लगातार कॉन्टेक्स्ट एक सीमित, आपस में क़रीबी रूप से जुड़े डॉक्यूमेंट सेट के लिए सही है जिसे आप शुरू से आख़िर तक पढ़वाना चाहते हैं, जबकि रिट्रीवल एक बिखरी हुई, ढीली-ढाली जुड़ी लाइब्रेरी के लिए सही है जिसे आप टुकड़ा-टुकड़ा क्वेरी करते हैं। अगर आप किसी लंबे-कॉन्टेक्स्ट ओपन मॉडल को ख़ुद होस्ट करने और किसी सोर्स-ग्राउंडेड टूल के इस्तेमाल के बीच चुनाव कर रहे हैं, तो असली ट्रेडऑफ़ यही है, सिर्फ़ टोकन-गिनती की तुलना नहीं।

लोग यह भी पूछते हैं

क्या 51B-पैरामीटर N-gram table मॉडल के एक्टिव कंप्यूट का हिस्सा है?

नहीं। यह एक non-parametric, deterministically addressed lookup table है जिसे फ़ॉरवर्ड पास से पहले ही RAM या SSD से प्रीफ़ेच किया जा सकता है, जिससे लगभग शून्य अतिरिक्त लेटेंसी जुड़ती है। यह 6B एक्टिव-पैरामीटर वाले आंकड़े से बाहर रहता है, जो मॉडल के असल प्रति-टोकन कंप्यूट को बताता है।

क्या मैं Qwen3.8-Flash-Next को किसी एक कंज़्यूमर GPU पर चला सकता हूं?

नहीं। Unsloth की अपनी गाइडलाइन 1-बिट क्वांटाइज़ेशन पर भी न्यूनतम व्यवहार्य फ़ुटप्रिंट को लगभग 75GB कंबाइंड RAM और VRAM बताती है, जिसका व्यावहारिक मतलब है एक हाई-एंड Mac Studio या मल्टी-GPU सेटअप। बिना इस हार्डवेयर के QwenCloud API व्यावहारिक विकल्प है।

क्या Qwen3.8-Flash-Next, Qwen3.8-27B की तरह Apache 2.0 के तहत ओपन सोर्स है?

नहीं, और यह इस रिलीज़ के बारे में सबसे ज़्यादा उलझाया जाने वाला तथ्य है। Qwen3.8-Flash-Next, Qwen Community License 1.0 इस्तेमाल करता है, जो Qwen3.8-27B के Apache 2.0 शर्तों से कहीं ज़्यादा सीमित लाइसेंस है। कमर्शियल इस्तेमाल से पहले शर्तों की पुष्टि रिपॉज़िटरी की अपनी LICENSE फ़ाइल से कर लें।

क्या मुझे पूरा 1,000,000-टोकन कॉन्टेक्स्ट अपने-आप मिल जाता है?

नहीं। मॉडल का नेटिव कॉन्टेक्स्ट 262,144 टोकन है। 1,000,000 टोकन तक पहुंचने के लिए आपके इंफ़रेंस सेटअप में साफ़ तौर पर static YaRN scaling ऑन करनी पड़ती है; यह डिफ़ॉल्ट रूप से ऑन नहीं होती।

Alibaba एक पूरी तरह ओपन-वेट मॉडल को "प्रीव्यू" क्यों कह रहा है?

क्योंकि इसे साफ़ तौर पर आने वाले पूरे Qwen4 मॉडल परिवार के लिए तय आर्किटेक्चर की एक शुरुआती झलक के तौर पर पेश किया गया है, जिसे उस रिलीज़ से पहले ही ओपन वेट्स के रूप में जारी किया गया है, न कि मौजूदा Qwen3.8 लाइन के किसी मानक नंबर वाले अपडेट के तौर पर।

आगे पढ़ें