Qwen 3.5 4B darbināšana iPhone tālrunī ar MLX
Ja darbināt Qwen klēpjdatorā, šo modeļu saimi jau pazīstat. Šeit ir konkrēta konfigurācija, kas darbina Qwen iPhone tālrunī: kurš variants, kā tas kvantizēts, cik daudz atmiņas un krātuves tam vajag, ko izpildvide dara starp atbildēm un ko četru miljardu parametru modelis spēj un nespēj, kad tas ir pieslēgts jūsu kalendāram.
Modelis
Qwen 3.5 4B ir viens no mazajiem Qwen 3.5 modeļiem, ko izstrādājusi Alibaba Qwen komanda (saimē ir arī 0.8B, 2B un 9B izmēri), un tas publicēts 2026. gada sākumā ar Apache 2.0 licenci. Tam ir aptuveni četri miljardi parametru, redzes kodētājs, lai tas varētu lasīt attēlus, pēc noklusējuma ieslēgts domāšanas režīms, sākotnējais konteksta logs 262 144 tokenu garumā un apmācība rīku izsaukšanai. Alibaba norāda 201 valodu un dialektu. Tālrunī svarīgākās ir divas īpašības: rīku izsaukšana un izmērs. Tas ir aptuveni lielākais modelis, kas ar rezervi darbojas 8 GB atmiņā.
Orvena lejupielādē mlx-community/Qwen3.5-4B-4bit, piesaistītu vienai konkrētai revīzijai. Lejupielāde ir desmit faili, kopā 3,06 GB, no kuriem svari aizņem 3,03 GB; lietotne to noapaļo līdz "3,1 GB". Otrs variants, "Qwen 3.5 4B Mixed", dažus jutīgākos slāņus (iegultņu slāni, pusi no MLP down projekcijām un daļu uzmanības value projekciju) patur astoņos bitos, bet pārējos četros. Tas aizņem 3,57 GB un dod precīzākus rīku izsaukumu argumentus, jo tieši tur četru bitu kvantizācijas ietekme parādās vispirms. Starp abiem variantiem varat pārslēgties lapā Modeļi.
Kāpēc četri biti
Ar sešpadsmit bitiem uz svaru četri miljardi parametru aizņem aptuveni 8 GB, un tā ir visa tālruņa atmiņa. Ar četriem bitiem svari diskā aizņem aptuveni 3 GB un atmiņā nedaudz vairāk, atstājot vietu iOS, lietotnei un darba atmiņai, kas modelim vajadzīga, kamēr tas atbild. Tas ir aparatūras prasības iemesls: Orvena pirmajā palaišanas reizē pārbauda tālruņa fizisko atmiņu un nepiedāvā lejupielādi, ja tās ir mazāk par aptuveni 8 GB. Tik daudz atmiņas ir iPhone 15 Pro un 15 Pro Max, visiem iPhone 16, ieskaitot 16e, kā arī iPhone 17 un 17e. iPhone Air un 17 Pro modeļiem ir 12 GB. Apple Intelligence atbalstīto ierīču sarakstā Apple min arī iPhone 18 Pro, 18 Pro Max un iPhone Duo; jebkurā tālrunī izšķirošā ir atmiņas pārbaude iestatīšanas laikā.
Izpildvide
Secināšana notiek ar MLX, Apple masīvu ietvaru savām mikroshēmām, izmantojot Swift saistījumus. Modelis darbojas grafikas procesorā (GPU) un izmanto tālruņa vienoto atmiņu, tāpēc svari nav jākopē starp procesoriem. Pēc ielādes svari starp atbildēm paliek atmiņā; iOS atmiņas brīdinājums iztīra kešatmiņas, bet ne modeli.
Divas kešatmiņas liek tālrunim šķist ātrākam, nekā liecinātu tā tīrā caurlaidspēja. Kad modelis tiek ielādēts, Orvena aprēķina uzvednes nemainīgo daļu (sistēmas uzvedni un rīku aprakstus) un saglabā šo stāvokli, tāpēc jaunai sarunai par šiem tokeniem vairs nav jāmaksā. Sarunas laikā atslēgu un vērtību kešatmiņa tiek pārnesta no vienas atbildes uz nākamo, tāpēc katrai atbildei jānolasa tikai jūsu jaunākā ziņa un rīku rezultāti, nevis visa vēsture.
Konteksta logs tālrunī ir ierobežots līdz 16 384 tokeniem, nevis modeļa pilnajiem 262k. Tie ir aptuveni 12 000 vārdu sarunas, un ierobežojums pastāv tāpēc, ka garas uzvednes nolasīšana ir tālruņa lēnākā daļa un tieši gara konteksta kešatmiņa izsmeļ atmiņu. Kad saruna kļūst garāka par logu, Orvena patur jaunākās pilnās replikas un izlaiž vecākās, nevis veido to kopsavilkumu. Ja viens rīka rezultāts ir par lielu, lai ietilptu, tiek parādīts ziņojums angļu valodā "The latest tool result is too large for this model's context window. Try a narrower request." (jaunākais rīka rezultāts ir par lielu šī modeļa konteksta logam, mēģiniet šaurāku pieprasījumu).
Ja domāšana ir ieslēgta, visai atbildei tiek izmantota temperatūra 1,0 un top-p 0,95, bet, ja domāšana ir izslēgta, temperatūra 0,7 un top-p 0,8.
Domāšanas režīms
Qwen 3.5 pirms atbildes spriež, ja vien tam nav likts to nedarīt. Orvena šai spriešanai piešķir tokenu budžetu: 288 tokenus tālrunī ar 8 GB atmiņu un 576 tālrunī ar 12 GB, bet režīmā Low Power Mode uz pusi mazāk. Kad budžets beidzas, lietotne liek modelim pabeigt domāšanu un sākt atbildi, tāpēc sarežģīts jautājums nevar iestrēgt bezgalīgi. Lapā Modeļi ir divi iestatījumi, Automātiski un Izslēgts, bet sadaļā Iestatījumi, Papildu var iestatīt pielāgotu budžetu no 128 līdz 2 048 tokeniem. Domāšana visvairāk palīdz daudzpakāpju rīku uzdevumos, piemēram, ja modinātājs ir atkarīgs no ceļa laika, un maksā dažas sekundes; ātram faktu jautājumam režīms Izslēgts ir manāmi ātrāks.
Rīku izsaukšana
Rīki modelim tiek aprakstīti kā JSON funkciju shēmas, un uzvednē tos ievieto paša modeļa tērzēšanas veidne, tāpēc modelis izsaukumus veido tajā formātā, kurā tas ir apmācīts. Orvena uztur uzvedni nelielu, atklājot rīkus pakāpeniski: modelis sāk ar dažiem pamatrīkiem un īsiem kopsavilkumiem, tad ielādē vajadzīgo prasmi (kalendāru, atgādinājumus, kartes, veselību un tā tālāk) un tikai tad redz pilnās shēmas. Viens pieprasījums var aizņemt līdz 32 modeļa izsaukumiem. Katrs izsaukums tiek pārbaudīts pret deklarēto shēmu; izsaukums ar nedeklarētu nosaukumu vai kļūdainiem argumentiem netiek klusi atmests, bet tiek atgriezts modelim kā kļūda, ko tas var izlasīt un izlabot.
Aprēķinus, kuriem ir nozīme, veic rīki, nevis modelis. Kad lūdzat modinātāju, lai kaut kur nokļūtu laikā, ceļa rīks aprēķina, kad jāizbrauc, un modelis to tikai paziņo.
Ātrums
Publicēta Orvena ātruma etalontesta vēl nav. Teksts parādās pakāpeniski, tiklīdz tas tiek uzrakstīts, un īsas atbildes pirmie vārdi parādās sekundes vai divu laikā. Pamanīsiet, ka garā sarunā atbilde sākas vēlāk, jo uzvednes nolasīšana tālrunī ir dārgākā daļa, un ka domāšana rada redzamu pauzi.
Valodas un attēli
Modelis atbild tajā valodā, kurā rakstāt. Lai tas uzticami darbotos arī ar īsām ziņām, Orvena katras ziņas valodu nosaka ar Apple valodas atpazīšanas rīku ierīcē un pievieno izpildlaika piezīmi, kurā valoda ir norādīta; piezīme tiek izņemta no visa, ko modelis raksta atpakaļ, tāpēc jūs to nekad neredzat. Pievienotos fotoattēlus apstrādā redzes kodētājs tālrunī.
Salīdzinājumā ar Qwen darbināšanu Mac datorā
Mac datorā varat izvēlēties lielākus Qwen 3.5 izmērus, un tie ir spēcīgāki modeļi. Tālrunī 4B šodien ir praktiskā robeža. Tālrunis savukārt pievieno visu, kas ir ap modeli: jūsu kalendāru, atgādinājumus, modinātājus, fotoattēlus, veselības kopsavilkumus, kartes un katras modeļa veiktās darbības ierakstu, ko varat izlasīt un atsaukt. Ja tālrunī vēlaties lielāku modeli, Premium ar iOS 27 pievieno Apple Private Cloud Compute, kam nav jāiestata atslēga, vai jebkuru OpenRouter modeli ar jūsu atslēgu, un Orvena prasa piekrišanu, pirms kāda saruna atstāj ierīci.
Biežāk uzdotie jautājumi
Kuru Qwen variantu Orvena lejupielādē?
Pēc noklusējuma mlx-community/Qwen3.5-4B-4bit piesaistītā revīzijā, 3,06 GB desmit failos. Lapā Modeļi ir pieejams arī jaukts četru un astoņu bitu variants, 3,57 GB, precīzākiem rīku izsaukumiem.
Vai varu ielādēt savu GGUF vai MLX modeli?
Nē. Lejupielāžu katalogā ir divi ieraksti, un katrs pirms iekļaušanas sarakstā tiek pārbaudīts ar rīku cikla testiem fiziskās ierīcēs. Ar iOS 27 lapā Modeļi ir pieejams arī Apple Intelligence, kas ir iebūvēts iOS. Orvena ir asistents, nevis universāls modeļu darbinātājs.
No kurienes nāk svari, un vai tie tiek pārbaudīti?
No Orvena spoguļservera, ar Hugging Face kā rezerves avotu. Katrs fails pirms modeļa aktivizēšanas tiek pārbaudīts pret piesaistīto izmēru un SHA-256 jaucējvērtību. Lejupielāde notiek fonā, pēc pārtraukuma atsākas un netiek iekļauta iCloud rezerves kopijā.
Vai mani dati tiek izmantoti Qwen apmācībai?
Nē. Modelis darbojas jūsu tālrunī. Nekas, ko rakstāt vai sakāt, netiek sūtīts ne Alibaba, ne Orvena. Rīks nosūta savam pakalpojumam to, kas tam vajadzīgs, piemēram, meklēšanas vaicājumu uz DuckDuckGo, un jūsu saruna atstāj tālruni tikai tad, ja izvēlaties Private Cloud Compute vai paši pieslēdzat mākoņa modeli.
Orvena ir pieejams App Store bez maksas, iPhone 15 Pro un jaunākiem modeļiem. 3,1 GB lejupielāde notiek vienreiz, un modelis darbojas tālrunī.
Lejupielādēt no App Store