Cum rulezi Qwen 3.5 4B pe un iPhone cu MLX
Dacă rulezi Qwen pe un laptop, cunoști deja familia. Aceasta este configurația concretă cu care rulezi Qwen pe iPhone: ce variantă, cum este cuantizată, câtă memorie și cât spațiu de stocare îi trebuie, ce face runtime-ul între replici și ce poate și ce nu poate face un model de patru miliarde de parametri odată ce este conectat la calendarul tău.
Modelul
Qwen 3.5 4B este unul dintre modelele mici Qwen 3.5 ale echipei Qwen de la Alibaba (familia are și dimensiunile 0.8B, 2B și 9B), publicat la începutul lui 2026 sub licența Apache 2.0. Are aproximativ patru miliarde de parametri, un encoder vizual cu care poate citi imagini, un mod de gândire activat implicit, un context nativ de 262.144 de tokenuri și antrenament pentru apelarea instrumentelor. Alibaba indică 201 limbi și dialecte. Pe un telefon, cele două proprietăți care contează cel mai mult sunt apelarea instrumentelor și dimensiunea: acesta este cam cel mai mare model care rulează cu spațiu de rezervă în 8 GB de memorie.
Orvena descarcă mlx-community/Qwen3.5-4B-4bit, fixat pe o singură revizie. Descărcarea are zece fișiere care însumează 3,06 GB, dintre care ponderile au 3,03 GB; aplicația rotunjește la "3,1 GB". O a doua opțiune, "Qwen 3.5 4B Mixed", păstrează pe opt biți unele dintre cele mai sensibile straturi (embedding-urile, jumătate dintre proiecțiile MLP down și o parte dintre proiecțiile de valoare din atenție), iar restul pe patru. Are 3,57 GB și produce argumente mai precise pentru apelurile de instrumente, adică exact acolo unde cuantizarea pe patru biți se vede prima. Poți comuta între cele două pe pagina Modele.
De ce patru biți
La șaisprezece biți per pondere, patru miliarde de parametri înseamnă aproximativ 8 GB, adică toată memoria telefonului. La patru biți, ponderile au aproximativ 3 GB pe disc și puțin mai mult în memorie, lăsând loc pentru iOS, aplicație și memoria de lucru de care modelul are nevoie în timp ce răspunde. Acesta este motivul cerinței hardware: la prima lansare, Orvena verifică memoria fizică a telefonului și nu oferă descărcarea sub aproximativ 8 GB. Telefoanele care o au sunt iPhone 15 Pro și 15 Pro Max, toate modelele iPhone 16, inclusiv 16e, precum și iPhone 17 și 17e. iPhone Air și modelele 17 Pro au 12 GB. Apple mai listează iPhone 18 Pro, 18 Pro Max și iPhone Duo pentru Apple Intelligence; pe orice telefon, decide verificarea memoriei din timpul configurării.
Runtime-ul
Inferența rulează prin MLX, framework-ul Apple pentru calcul cu tablouri pe propriile cipuri, folosind interfața pentru Swift. Modelul rulează pe GPU, cu memoria unificată a telefonului, așa că ponderile nu sunt copiate între procesoare. Odată încărcate, ponderile rămân în memorie între replici; un avertisment de memorie de la iOS golește cache-urile, dar nu și modelul.
Două cache-uri fac telefonul să pară mai rapid decât ar sugera viteza lui brută. Când modelul se încarcă, Orvena calculează partea fixă a promptului, adică promptul de sistem și descrierile instrumentelor, și păstrează acea stare, așa că o conversație nouă nu mai plătește încă o dată pentru aceste tokenuri. În cadrul unei conversații, cache-ul cheie-valoare este păstrat de la o replică la alta, așa că fiecare răspuns trebuie să citească doar ultimul tău mesaj și rezultatele instrumentelor, nu întregul istoric.
Pe telefon, fereastra de context este limitată la 16.384 de tokenuri, în loc de cele 262k pe care le are modelul complet. Asta înseamnă aproximativ 12.000 de cuvinte de conversație, iar limita există pentru că citirea unui prompt lung este partea lentă pe un telefon, iar cache-ul pentru un context lung este cel care epuizează memoria. Când o conversație depășește fereastra, Orvena păstrează cele mai recente schimburi complete și le lasă deoparte pe cele mai vechi, în loc să le rezume. Dacă un singur rezultat al unui instrument este prea mare ca să încapă, afișează "The latest tool result is too large for this model's context window. Try a narrower request." (cel mai recent rezultat nu încape în fereastra de context a modelului; încearcă o cerere mai restrânsă).
Eșantionarea folosește temperatura 1,0 cu top-p 0,95 pentru tot răspunsul când gândirea este activată și temperatura 0,7 cu top-p 0,8 când gândirea este dezactivată.
Modul de gândire
Qwen 3.5 raționează înainte să răspundă, dacă nu i se spune altfel. Orvena îi dă acestui raționament un buget de tokenuri: 288 de tokenuri pe un telefon cu 8 GB și 576 pe unul cu 12 GB, la jumătate în modul Consum redus. Când bugetul se termină, aplicația forțează modelul să își încheie gândirea și să înceapă răspunsul, așa că o întrebare grea nu îl poate bloca la nesfârșit. Pagina Modele are două setări, Automat și Dezactivat, iar în Configurări, Avansat poți seta un buget personalizat între 128 și 2.048 de tokenuri. Gândirea ajută cel mai mult la sarcinile cu instrumente în mai mulți pași, de exemplu o alarmă care depinde de timpul de deplasare, și costă câteva secunde; pentru o întrebare factuală rapidă, Dezactivat este vizibil mai rapid.
Apelarea instrumentelor
Instrumentele îi sunt descrise modelului ca scheme de funcții JSON și sunt introduse în prompt de propriul șablon de chat al modelului, așa că modelul emite apelurile în formatul pe care l-a învățat la antrenare. Orvena păstrează promptul mic dezvăluind instrumentele treptat: modelul începe cu câteva instrumente de bază și rezumate scurte, apoi încarcă abilitatea de care are nevoie, calendar, mementouri, hărți, sănătate și așa mai departe, și abia atunci vede schemele complete. O cerere poate lua până la 32 de runde ale modelului. Fiecare apel este verificat față de schema declarată; un apel către un nume nedeclarat sau cu argumente greșite este returnat modelului ca o eroare pe care o poate citi și corecta, în loc să fie ignorat în tăcere.
Calculele care contează sunt făcute de instrumente, nu de model. Când ceri o alarmă care să te ducă undeva la timp, instrumentul pentru deplasare calculează ora la care trebuie să pleci, iar modelul doar o comunică.
Viteza
Nu există încă un benchmark publicat pentru Orvena. Textul apare pe măsură ce este scris, iar primele cuvinte ale unui răspuns scurt apar în una sau două secunde. Ce vei observa este că într-o conversație lungă durează mai mult până începe răspunsul, pentru că citirea promptului este partea costisitoare pe un telefon, și că gândirea adaugă o pauză vizibilă.
Limbi și imagini
Modelul răspunde în limba în care scrii. Ca acest lucru să funcționeze fiabil și la mesajele scurte, Orvena detectează limba fiecărui mesaj cu recunoașterea de limbă de pe dispozitiv a Apple și adaugă o notă de rulare care o precizează; nota este eliminată din tot ce scrie modelul înapoi, așa că nu o vezi niciodată. Pozele atașate trec prin encoderul vizual, pe telefon.
Comparație cu rularea Qwen pe un Mac
Pe un Mac poți alege dimensiunile mai mari din Qwen 3.5, iar acelea sunt modele mai puternice. Pe un telefon, 4B este astăzi plafonul practic. Ce adaugă telefonul este tot ce se află în jurul modelului: calendarul, mementourile, alarmele, pozele, rezumatele de sănătate, hărțile și o evidență a fiecărei acțiuni făcute de model, pe care o poți citi și anula. Dacă vrei un model mai mare pe telefon, Premium adaugă Private Cloud Compute de la Apple pe iOS 27, fără nicio cheie de configurat, sau orice model OpenRouter cu propria ta cheie, iar Orvena îți cere consimțământul înainte ca vreo conversație să plece de pe dispozitiv.
Întrebări frecvente
Ce variantă Qwen descarcă Orvena?
Implicit mlx-community/Qwen3.5-4B-4bit, la o revizie fixată, 3,06 GB în zece fișiere. O variantă mixtă pe patru și opt biți, de 3,57 GB, este disponibilă pe pagina Modele pentru apeluri de instrumente mai precise.
Pot încărca propriul model GGUF sau MLX?
Nu. Catalogul de descărcare are două intrări, iar fiecare este verificată cu teste de bucle de instrumente pe dispozitive fizice înainte să fie listată. Pe iOS 27, pagina Modele oferă și Apple Intelligence, care este integrat în iOS. Orvena este un asistent, nu un program generic de rulare a modelelor.
De unde vin ponderile și sunt verificate?
De pe serverul-oglindă al Orvena, cu Hugging Face ca rezervă. Fiecare fișier este verificat după dimensiunea fixată și hash-ul SHA-256 înainte ca modelul să fie activat. Descărcarea rulează în fundal, se reia dacă este întreruptă și este exclusă din copia de rezervă iCloud.
Datele mele sunt folosite pentru antrenarea Qwen?
Nu. Modelul rulează pe telefonul tău. Nimic din ce scrii sau spui nu este trimis către Alibaba sau către Orvena. Un instrument trimite ce îi trebuie propriului serviciu, de exemplu o interogare de căutare pe web către DuckDuckGo, iar conversația ta pleacă de pe telefon doar dacă alegi Private Cloud Compute sau conectezi tu un model din cloud.
Orvena este gratuită în App Store pentru iPhone 15 Pro și modele mai noi. Descărcarea de 3,1 GB se face o singură dată, iar modelul rulează pe telefon.
Descarcă din App Store