ऑन-डिवाइस

MLX के साथ iPhone पर Qwen 3.5 4B चलाना

अपडेट: 29 सितंबर 2026 · पढ़ने का समय: 6 मिनट · ORVENA LABS

अगर आप लैपटॉप पर Qwen चलाते हैं, तो आप इस मॉडल परिवार को पहले से जानते हैं। यह iPhone पर Qwen चलाने का ठोस सेटअप है: कौन सा वेरिएंट, उसका क्वांटाइज़ेशन कैसे हुआ है, उसे कितनी मेमोरी और स्टोरेज चाहिए, एक जवाब से अगले जवाब के बीच रनटाइम क्या करता है, और चार अरब पैरामीटर वाला मॉडल आपके कैलेंडर से जुड़ने के बाद क्या कर सकता है और क्या नहीं।

Orvena iPhone 15 Pro और उससे नए फ़ोन के लिए मुफ़्त है। मॉडल ख़ुद फ़ोन पर चलता है। डाउनलोड

मॉडल

Qwen 3.5 4B, Alibaba की Qwen टीम के छोटे Qwen 3.5 मॉडलों में से एक है (इस परिवार में 0.8B, 2B और 9B आकार भी हैं), जो 2026 की शुरुआत में Apache 2.0 लाइसेंस के तहत जारी हुआ। इसमें लगभग चार अरब पैरामीटर हैं, एक विज़न एनकोडर है जिससे यह चित्र पढ़ सकता है, एक थिंकिंग मोड है जो डिफ़ॉल्ट रूप से चालू रहता है, 262,144 टोकन का नेटिव कॉन्टेक्स्ट है, और इसे टूल कॉलिंग के लिए प्रशिक्षित किया गया है। Alibaba 201 भाषाएँ और बोलियाँ गिनाता है। फ़ोन पर सबसे ज़्यादा मायने रखने वाली दो ख़ूबियाँ हैं टूल कॉलिंग और आकार: यह मोटे तौर पर सबसे बड़ा मॉडल है जो 8 GB मेमोरी में आराम से चल जाता है।

Orvena mlx-community/Qwen3.5-4B-4bit डाउनलोड करता है, जो एक ही रिवीज़न पर पिन किया गया है। डाउनलोड में दस फ़ाइलें हैं जिनका कुल आकार 3.06 GB है, जिनमें से वेट्स 3.03 GB के हैं; ऐप इसे राउंड करके "3.1 GB" दिखाता है। दूसरा विकल्प, "Qwen 3.5 4B Mixed", कुछ सबसे संवेदनशील लेयर (एम्बेडिंग, आधे MLP डाउन प्रोजेक्शन और कुछ अटेंशन वैल्यू प्रोजेक्शन) आठ बिट पर और बाक़ी चार बिट पर रखता है। इसका आकार 3.57 GB है और यह टूल कॉल के ज़्यादा सटीक आर्ग्युमेंट देता है, और चार बिट क्वांटाइज़ेशन की कमी सबसे पहले वहीं दिखती है। आप "मॉडल" पेज पर दोनों के बीच बदल सकते हैं।

चार बिट क्यों

सोलह बिट प्रति वेट पर चार अरब पैरामीटर लगभग 8 GB के होते हैं, यानी फ़ोन की पूरी मेमोरी। चार बिट पर वेट्स डिस्क पर लगभग 3 GB और मेमोरी में उससे थोड़ा ज़्यादा लेते हैं, जिससे iOS, ऐप और जवाब देते समय मॉडल को चाहिए वर्किंग मेमोरी के लिए जगह बचती है। हार्डवेयर की शर्त की वजह यही है: Orvena पहली बार खुलने पर फ़ोन की भौतिक मेमोरी जाँचता है और लगभग 8 GB से कम पर डाउनलोड का विकल्प नहीं देता। जिन फ़ोनों में इतनी मेमोरी है वे हैं iPhone 15 Pro और 15 Pro Max, 16e समेत हर iPhone 16, और iPhone 17 और 17e। iPhone Air और 17 Pro मॉडलों में 12 GB है। Apple की सूची में Apple Intelligence के लिए iPhone 18 Pro, 18 Pro Max और iPhone Duo भी हैं; किसी भी फ़ोन पर आख़िरी फ़ैसला सेटअप के दौरान होने वाली मेमोरी जाँच करती है।

रनटाइम

इन्फ़रेंस MLX के ज़रिए चलता है, जो Apple का अपने सिलिकॉन के लिए बना ऐरे फ़्रेमवर्क है, और इसमें Swift बाइंडिंग इस्तेमाल होती हैं। मॉडल फ़ोन की यूनिफ़ाइड मेमोरी के साथ GPU पर चलता है, इसलिए प्रोसेसरों के बीच वेट्स कॉपी नहीं करने पड़ते। एक बार लोड होने के बाद वेट्स एक जवाब से अगले जवाब तक मेमोरी में बने रहते हैं; iOS की मेमोरी चेतावनी कैश साफ़ करती है, मॉडल को नहीं हटाती।

दो कैश की वजह से फ़ोन अपनी कच्ची रफ़्तार से ज़्यादा तेज़ महसूस होता है। मॉडल लोड होते समय Orvena प्रॉम्प्ट के स्थिर हिस्से, यानी सिस्टम प्रॉम्प्ट और टूल के विवरण, की गणना करके वह स्थिति सँभाल लेता है, ताकि नई बातचीत को उन टोकन की क़ीमत दोबारा न चुकानी पड़े। एक बातचीत के भीतर key-value कैश हर जवाब से अगले जवाब तक साथ चलता है, इसलिए हर जवाब को पूरा इतिहास नहीं, सिर्फ़ आपका नया संदेश और टूल परिणाम पढ़ने होते हैं।

फ़ोन पर कॉन्टेक्स्ट विंडो मॉडल के पूरे 262k के बजाय 16,384 टोकन पर सीमित है। यह बातचीत के लगभग 12,000 शब्द हैं, और यह सीमा इसलिए है क्योंकि फ़ोन पर लंबा प्रॉम्प्ट पढ़ना ही धीमा हिस्सा है और लंबे कॉन्टेक्स्ट का कैश ही मेमोरी ख़त्म करता है। जब बातचीत विंडो से बड़ी हो जाती है, तो Orvena सबसे हाल के पूरे सवाल-जवाब रखता है और सबसे पुराने छोड़ देता है, उनका सारांश नहीं बनाता। अगर कोई अकेला टूल परिणाम इतना बड़ा हो कि विंडो में न समाए, तो यह कहता है "The latest tool result is too large for this model's context window. Try a narrower request." (ताज़ा टूल परिणाम इस मॉडल की कॉन्टेक्स्ट विंडो के लिए बहुत बड़ा है, छोटा अनुरोध आज़माएँ)।

थिंकिंग चालू होने पर पूरे जवाब के लिए सैंपलिंग temperature 1.0 और top-p 0.95 पर होती है, और थिंकिंग बंद होने पर temperature 0.7 और top-p 0.8 पर।

थिंकिंग मोड

Qwen 3.5 जवाब देने से पहले तर्क करता है, जब तक उसे मना न किया जाए। Orvena इस तर्क के लिए एक टोकन बजट तय करता है: 8 GB वाले फ़ोन पर 288 टोकन और 12 GB वाले पर 576, Low Power Mode में इसका आधा। बजट ख़त्म होते ही ऐप मॉडल को थिंकिंग बंद करके जवाब शुरू करने पर मजबूर करता है, ताकि कोई कठिन सवाल अनिश्चित समय तक अटका न रहे। "मॉडल" पेज पर दो सेटिंग हैं, "स्वचालित" और "बंद", और सेटिंग्स, "उन्नत" में 128 से 2,048 टोकन के बीच का कस्टम बजट भी मिलता है। थिंकिंग से सबसे ज़्यादा फ़ायदा कई चरणों वाले टूल कामों में होता है, जैसे ऐसा अलार्म जो यात्रा समय पर निर्भर हो, और इसमें कुछ सेकंड लगते हैं; किसी झटपट तथ्य वाले सवाल के लिए "बंद" साफ़ तौर पर तेज़ है।

टूल कॉलिंग

मॉडल को टूल JSON फ़ंक्शन स्कीमा के रूप में बताए जाते हैं और मॉडल का अपना चैट टेम्पलेट उन्हें प्रॉम्प्ट में डालता है, इसलिए मॉडल उसी फ़ॉर्मैट में कॉल करता है जिस पर उसे प्रशिक्षित किया गया था। Orvena टूल धीरे-धीरे सामने लाकर प्रॉम्प्ट छोटा रखता है: मॉडल कुछ मुख्य टूल और छोटे सारांशों से शुरू करता है, फिर जिस स्किल की उसे ज़रूरत हो, जैसे कैलेंडर, रिमाइंडर, नक्शे, स्वास्थ्य, उसे लोड करता है, और तभी पूरे स्कीमा देखता है। एक अनुरोध में मॉडल के 32 राउंड तक लग सकते हैं। हर कॉल को घोषित स्कीमा से जाँचा जाता है; किसी अघोषित नाम की कॉल या गड़बड़ आर्ग्युमेंट वाली कॉल चुपचाप हटाई नहीं जाती, बल्कि मॉडल को एक त्रुटि के रूप में लौटाई जाती है जिसे वह पढ़कर सुधार सकता है।

जिस गणना से सच में फ़र्क़ पड़ता है, वह मॉडल नहीं, टूल करते हैं। जब आप ऐसा अलार्म माँगते हैं जो आपको समय पर कहीं पहुँचा दे, तो यात्रा टूल निकलने का समय निकालता है और मॉडल सिर्फ़ उसे बताता है।

स्पीड

Orvena का अभी कोई प्रकाशित बेंचमार्क नहीं है। टेक्स्ट लिखे जाते ही स्ट्रीम होता है, और छोटे जवाब के पहले शब्द एक-दो सेकंड में दिखने लगते हैं। आप यह ज़रूर देखेंगे कि लंबी बातचीत में जवाब शुरू होने में ज़्यादा समय लगता है, क्योंकि फ़ोन पर प्रॉम्प्ट पढ़ना ही महँगा हिस्सा है, और थिंकिंग से एक साफ़ दिखने वाला ठहराव जुड़ जाता है।

भाषाएँ और चित्र

मॉडल उसी भाषा में जवाब देता है जिसमें आप लिखते हैं। छोटे संदेशों में भी यह भरोसेमंद रहे, इसके लिए Orvena Apple के ऑन-डिवाइस लैंग्वेज रिकग्नाइज़र से हर संदेश की भाषा पहचानता है और उसे बताने वाला एक रनटाइम नोट जोड़ देता है; मॉडल जो भी लिखकर लौटाता है उससे यह नोट हटा दिया जाता है, इसलिए यह आपको कभी नहीं दिखता। जोड़ी गई फ़ोटो फ़ोन पर ही विज़न एनकोडर से होकर गुज़रती हैं।

Mac पर Qwen चलाने से तुलना

Mac पर आप Qwen 3.5 के बड़े आकार चुन सकते हैं, और वे ज़्यादा ताक़तवर मॉडल हैं। फ़ोन पर आज 4B ही व्यावहारिक सीमा है। फ़ोन जो जोड़ता है वह है मॉडल के आस-पास की हर चीज़: आपका कैलेंडर, रिमाइंडर, अलार्म, फ़ोटो, स्वास्थ्य सारांश, नक्शे, और मॉडल की हर कार्रवाई का रिकॉर्ड, जिसे आप पढ़ सकते हैं और पूर्ववत कर सकते हैं। अगर आप अपने फ़ोन से बड़ा मॉडल इस्तेमाल करना चाहते हैं, तो Premium iOS 27 पर Apple का Private Cloud Compute जोड़ता है, जिसमें कोई कुंजी सेट नहीं करनी पड़ती, या आपकी अपनी कुंजी के साथ कोई भी OpenRouter मॉडल, और कोई भी बातचीत डिवाइस से बाहर जाने से पहले Orvena सहमति माँगता है।

आम सवाल

Orvena Qwen का कौन सा वेरिएंट डाउनलोड करता है?

डिफ़ॉल्ट रूप से पिन किए गए रिवीज़न पर mlx-community/Qwen3.5-4B-4bit, दस फ़ाइलों में 3.06 GB। ज़्यादा सटीक टूल कॉल के लिए "मॉडल" पेज पर चार और आठ बिट वाला मिश्रित वेरिएंट भी उपलब्ध है, जिसका आकार 3.57 GB है।

क्या मैं अपना GGUF या MLX मॉडल लोड कर सकता हूँ?

नहीं। डाउनलोड कैटलॉग में दो विकल्प हैं, और हर एक को सूची में डालने से पहले असली डिवाइस पर टूल-लूप टेस्ट से परखा जाता है। iOS 27 पर "मॉडल" पेज Apple Intelligence भी देता है, जो iOS में बिल्ट-इन है। Orvena एक असिस्टेंट है, कोई आम मॉडल रनर नहीं।

वेट्स कहाँ से आते हैं, और क्या उनकी जाँच होती है?

Orvena के मिरर से, और उसके न चलने पर Hugging Face से। मॉडल सक्रिय होने से पहले हर फ़ाइल को पिन किए गए आकार और SHA-256 हैश से मिलाया जाता है। डाउनलोड बैकग्राउंड में चलता है, रुक जाए तो वहीं से फिर शुरू होता है, और iCloud बैकअप से बाहर रखा जाता है।

क्या मेरे डेटा से Qwen को प्रशिक्षित किया जाता है?

नहीं। मॉडल आपके फ़ोन पर चलता है। आप जो भी टाइप करते हैं या बोलते हैं, वह Alibaba या Orvena को नहीं भेजा जाता। कोई टूल अपनी सेवा को सिर्फ़ उतना भेजता है जितना उसे चाहिए, जैसे वेब खोज की क्वेरी DuckDuckGo को, और आपकी बातचीत फ़ोन से तभी बाहर जाती है जब आप Private Cloud Compute चुनें या ख़ुद कोई क्लाउड मॉडल जोड़ें।

Qwen 3.5 4B, फ़ोन पर, आपके कैलेंडर के साथ।

Orvena App Store पर iPhone 15 Pro और उससे नए फ़ोन के लिए मुफ़्त है। 3.1 GB का डाउनलोड एक ही बार होता है, और मॉडल फ़ोन पर चलता है।

App Store से डाउनलोड करें