Na uređaju

Pokretanje modela Qwen 3.5 4B na iPhoneu uz MLX

AŽURIRANO 29. RUJNA 2026. · 6 MIN ČITANJA · ORVENA LABS

Ako Qwen pokrećete na prijenosnom računalu, tu obitelj modela već poznajete. Ovo je konkretna postavka koja pokreće Qwen na iPhoneu: koja varijanta, kako je kvantizirana, koliko memorije i prostora za pohranu treba, što izvršno okruženje radi između dvaju odgovora i što model s četiri milijarde parametara može, a što ne može kad se poveže s vašim kalendarom.

Orvena je besplatna za iPhone 15 Pro i novije modele. Model radi na samom telefonu. Preuzmi

Model

Qwen 3.5 4B jedan je od malih modela Qwen 3.5 koje je izradio Alibabin tim Qwen (obitelj ima i veličine 0.8B, 2B i 9B), a objavljen je početkom 2026. pod licencom Apache 2.0. Ima oko četiri milijarde parametara, vizualni enkoder pa može čitati slike, način razmišljanja koji je uključen prema zadanim postavkama, izvorni kontekst od 262.144 tokena i treniran je za pozivanje alata. Alibaba navodi 201 jezik i dijalekt. Na telefonu su najvažnija dva svojstva: pozivanje alata i veličina. Ovo je otprilike najveći model koji s rezervom radi u 8 GB memorije.

Orvena preuzima mlx-community/Qwen3.5-4B-4bit, vezan uz jednu fiksnu reviziju. Preuzimanje čini deset datoteka ukupne veličine 3,06 GB, od čega su težine 3,03 GB; aplikacija to zaokružuje na "3,1 GB". Druga opcija, "Qwen 3.5 4B Mixed", neke od najosjetljivijih slojeva (ugradnje, polovicu projekcija prema dolje u MLP-u i dio projekcija vrijednosti u slojevima pažnje) drži u osam bita, a ostatak u četiri. Ima 3,57 GB i daje točnije argumente poziva alata, a upravo se ondje najprije pokazuju nedostaci kvantizacije u četiri bita. Između njih se možete prebacivati na stranici Modeli.

Zašto četiri bita

Uz šesnaest bita po težini, četiri milijarde parametara zauzimaju oko 8 GB, što je cijela memorija telefona. Uz četiri bita težine zauzimaju oko 3 GB na disku i nešto više u memoriji, pa ostaje mjesta za iOS, aplikaciju i radnu memoriju koja modelu treba dok odgovara. Odatle i hardverski zahtjev: Orvena pri prvom pokretanju provjerava fizičku memoriju telefona i ne nudi preuzimanje ako je ima manje od otprilike 8 GB. Telefoni koji je imaju su iPhone 15 Pro i 15 Pro Max, svi modeli iPhone 16, uključujući 16e, te iPhone 17 i 17e. iPhone Air i modeli 17 Pro imaju 12 GB. Apple navodi i iPhone 18 Pro, 18 Pro Max i iPhone Duo kao uređaje za Apple Intelligence; na svakom telefonu odlučuje provjera memorije tijekom postavljanja.

Izvršno okruženje

Inferencija se izvodi putem MLX-a, Appleova okvira za rad s nizovima podataka na vlastitim čipovima, preko sučelja za Swift. Model radi na GPU-u s objedinjenom memorijom telefona, pa se težine ne kopiraju između procesora. Nakon učitavanja težine ostaju u memoriji između izmjena; upozorenje o memoriji iz sustava iOS briše predmemorije, ali ne i model.

Dvije predmemorije čine da telefon djeluje brže nego što bi njegova sirova propusnost dala naslutiti. Kad se model učita, Orvena izračuna fiksni dio upita (sistemski upit i opise alata) i zadrži to stanje, pa novi razgovor te tokene ne plaća ponovno. Unutar razgovora predmemorija ključeva i vrijednosti prenosi se iz izmjene u izmjenu, pa svaki odgovor mora pročitati samo vašu najnoviju poruku i rezultate alata, a ne cijelu povijest.

Kontekstni prozor na telefonu ograničen je na 16.384 tokena, umjesto punih 262k koje model podržava. To je oko 12.000 riječi razgovora, a ograničenje postoji zato što je čitanje dugog upita spori dio posla na telefonu, a predmemorija za dugi kontekst ono što potroši memoriju. Kad razgovor preraste prozor, Orvena zadržava najnovije cijele izmjene i izostavlja najstarije umjesto da ih sažima. Ako jedan rezultat alata ne stane, prikazuje "The latest tool result is too large for this model's context window. Try a narrower request." (najnoviji rezultat alata prevelik je za kontekstni prozor ovog modela; pokušajte s užim zahtjevom).

Uzorkovanje koristi temperaturu 1,0 i top-p 0,95 za cijeli odgovor kad je razmišljanje uključeno, a temperaturu 0,7 i top-p 0,8 kad je isključeno.

Način razmišljanja

Qwen 3.5 rasuđuje prije odgovora, osim ako mu se kaže da to ne čini. Orvena tom rasuđivanju daje proračun tokena: 288 tokena na telefonu s 8 GB i 576 na telefonu s 12 GB, upola manje u Modu slabog napajanja. Kad se proračun potroši, aplikacija prisiljava model da zatvori razmišljanje i započne odgovor, pa se teško pitanje ne može zaglaviti unedogled. Stranica Modeli ima dvije postavke, Automatski i Isključeno, a u Postavkama, pod Napredno, može se zadati prilagođeni proračun između 128 i 2.048 tokena. Razmišljanje najviše pomaže kod višekoračnih zadataka s alatima, primjerice alarma koji ovisi o vremenu putovanja, i košta nekoliko sekundi; za kratko činjenično pitanje opcija Isključeno osjetno je brža.

Pozivanje alata

Alati se modelu opisuju kao JSON sheme funkcija, a u upit ih umeće vlastiti predložak razgovora modela, pa model poziva alate u formatu na kojem je treniran. Orvena upit drži malim tako što alate otkriva postupno: model počinje s nekoliko osnovnih alata i kratkim sažecima, zatim učitava vještinu koja mu treba (kalendar, podsjetnike, karte, zdravlje i tako dalje) i tek tada vidi pune sheme. Jedan zahtjev može obuhvatiti do 32 kruga modela. Svaki se poziv provjerava prema deklariranoj shemi; poziv nedeklariranog naziva ili s neispravnim argumentima vraća se modelu kao pogreška koju može pročitati i ispraviti, umjesto da se tiho odbaci.

Računanje koje je važno obavljaju alati, a ne model. Kad zatražite alarm uz koji ćete negdje stići na vrijeme, alat za putovanje izračunava kad trebate krenuti, a model to samo prenosi.

Brzina

Za Orvenu još nema objavljenog mjerenja performansi. Tekst se prikazuje dok nastaje, a prve riječi kratkog odgovora pojavljuju se unutar sekunde ili dvije. Primijetit ćete da u dugom razgovoru prođe više vremena prije nego što odgovor počne, jer je čitanje upita skupi dio posla na telefonu, i da razmišljanje dodaje vidljivu stanku.

Jezici i slike

Model odgovara na jeziku na kojem pišete. Kako bi to bilo pouzdano i za kratke poruke, Orvena Appleovim prepoznavanjem jezika na uređaju utvrđuje jezik svake poruke i dodaje napomenu koja ga navodi; napomena se uklanja iz svega što model napiše, pa je nikad ne vidite. Priložene fotografije prolaze kroz vizualni enkoder na telefonu.

Usporedba s pokretanjem Qwena na Macu

Na Macu možete odabrati veće modele Qwen 3.5, a oni su jači. Na telefonu je 4B danas praktična gornja granica. Telefon dodaje sve oko modela: vaš kalendar, podsjetnike, alarme, fotografije, zdravstvene sažetke, karte i zapis svake radnje koju model poduzme, a koju možete pročitati i poništiti. Ako s telefona želite veći model, Premium dodaje Appleov Private Cloud Compute na sustavu iOS 27, bez postavljanja ključa, ili bilo koji OpenRouter model s vašim vlastitim ključem, a Orvena traži pristanak prije nego što ijedan razgovor napusti uređaj.

Česta pitanja

Koju varijantu modela Qwen Orvena preuzima?

Zadano mlx-community/Qwen3.5-4B-4bit u fiksnoj reviziji, 3,06 GB u deset datoteka. Na stranici Modeli dostupna je i varijanta s miješanom preciznošću od četiri i osam bita, 3,57 GB, za točnije pozive alata.

Mogu li učitati vlastiti GGUF ili MLX model?

Ne. Katalog preuzimanja ima dvije stavke, a svaka se prije uvrštavanja provjerava testovima petlje alata na fizičkim uređajima. Na sustavu iOS 27 stranica Modeli nudi i Apple Intelligence, koji je ugrađen u iOS. Orvena je asistent, a ne općeniti alat za pokretanje modela.

Odakle dolaze težine i provjeravaju li se?

Sa zrcalnog poslužitelja aplikacije Orvena, a Hugging Face služi kao rezerva. Svaka se datoteka prije aktivacije modela provjerava prema fiksnoj veličini i SHA-256 hashu. Preuzimanje se odvija u pozadini, nastavlja se ako se prekine i izuzeto je iz sigurnosne kopije na iCloudu.

Koriste li se moji podaci za treniranje modela Qwen?

Ne. Model radi na vašem telefonu. Ništa što upišete ili izgovorite ne šalje se ni Alibabi ni tvrtki Orvena Labs. Alat šalje ono što mu treba vlastitoj usluzi, primjerice upit za pretraživanje weba tražilici DuckDuckGo, a vaš razgovor napušta telefon samo ako odaberete Private Cloud Compute ili sami povežete model u oblaku.

Qwen 3.5 4B, na telefonu, s vašim kalendarom.

Orvena je besplatna u trgovini App Store za iPhone 15 Pro i novije modele. Preuzimanje od 3,1 GB obavlja se jednom, a model radi na telefonu.

Preuzmite u trgovini App Store