Kaip paleisti Qwen 3.5 4B iPhone telefone su MLX
Jei Qwen naudojate nešiojamajame kompiuteryje, šią modelių šeimą jau pažįstate. Čia aprašyta konkreti sąranka, kaip paleisti Qwen iPhone telefone: koks variantas, kaip jis kvantuotas, kiek atminties ir vietos jam reikia, ką vykdymo aplinka daro tarp atsakymų ir ką keturių milijardų parametrų modelis gali, o ko negali, kai yra prijungtas prie jūsų kalendoriaus.
Modelis
Qwen 3.5 4B yra vienas iš mažųjų Qwen 3.5 modelių, kuriuos sukūrė Alibaba komanda Qwen (šeimoje dar yra 0,8B, 2B ir 9B dydžiai); jis paskelbtas 2026 m. pradžioje pagal Apache 2.0 licenciją. Modelis turi apie keturis milijardus parametrų, vaizdo koduotuvą, todėl gali skaityti vaizdus, pagal numatytuosius nustatymus įjungtą mąstymo režimą, 262 144 žetonų savąjį konteksto ilgį ir yra apmokytas iškviesti įrankius. Alibaba nurodo 201 kalbą ir tarmę. Telefone svarbiausios dvi savybės: įrankių iškvietimas ir dydis. Tai maždaug didžiausias modelis, kuris su atsarga telpa į 8 GB atminties.
Orvena atsisiunčia mlx-community/Qwen3.5-4B-4bit, užfiksuotą vienoje revizijoje. Atsisiuntimą sudaro dešimt failų, iš viso 3,06 GB, iš kurių svoriai užima 3,03 GB; programėlė tai suapvalina iki "3,1 GB". Antroji parinktis, "Qwen 3.5 4B Mixed", kai kuriuos jautriausius sluoksnius (įterpinius, pusę MLP down projekcijų ir dalį dėmesio mechanizmo value projekcijų) laiko aštuonių bitų tikslumo, o likusius keturių. Ji užima 3,57 GB ir pateikia tikslesnius įrankių iškvietimų argumentus, o būtent ten keturių bitų kvantavimo trūkumai išryškėja pirmiausia. Tarp jų galite perjungti skiltyje "Modeliai".
Kodėl keturi bitai
Kai vienam svoriui skiriama šešiolika bitų, keturi milijardai parametrų užima apie 8 GB, o tai yra visa telefono atmintis. Su keturiais bitais svoriai diske užima apie 3 GB, o atmintyje šiek tiek daugiau, todėl lieka vietos iOS, programėlei ir darbinei atminčiai, kurios modeliui reikia atsakant. Iš čia ir techninės įrangos reikalavimas: pirmą kartą paleista Orvena patikrina fizinę telefono atmintį ir nesiūlo atsisiuntimo, jei jos yra mažiau nei maždaug 8 GB. Tiek atminties turi iPhone 15 Pro ir 15 Pro Max, visi iPhone 16, įskaitant 16e, bei iPhone 17 ir 17e. iPhone Air ir 17 Pro modeliai turi 12 GB. Apple taip pat nurodo, kad Apple Intelligence veikia iPhone 18 Pro, 18 Pro Max ir iPhone Duo; bet kuriuo atveju sprendžia atminties patikra nustatymo metu.
Vykdymo aplinka
Inferencija vyksta per MLX, Apple masyvų karkasą jos pačios lustams, naudojant Swift sąsajas. Modelis veikia GPU su bendrąja telefono atmintimi, todėl svorių nereikia kopijuoti tarp procesorių. Įkelti svoriai lieka atmintyje tarp atsakymų; iOS atminties įspėjimas išvalo podėlius, bet ne modelį.
Du podėliai leidžia telefonui atrodyti greitesniam, nei rodytų vien jo pralaidumas. Kai modelis įkeliamas, Orvena apskaičiuoja fiksuotą raginimo dalį (sistemos raginimą ir įrankių aprašus) ir išsaugo šią būseną, todėl naujam pokalbiui už tuos žetonus nebereikia mokėti iš naujo. Pokalbio metu rakto ir reikšmės podėlis perkeliamas iš vieno atsakymo į kitą, todėl kiekvienam atsakymui tereikia perskaityti naujausią jūsų žinutę ir įrankių rezultatus, o ne visą istoriją.
Konteksto langas telefone apribotas 16 384 žetonais, o ne visais modelio 262k. Tai apie 12 000 pokalbio žodžių. Riba nustatyta todėl, kad ilgo raginimo skaitymas telefone yra lėčiausia dalis, o ilgo konteksto podėlis ir išeikvoja atmintį. Kai pokalbis išauga už lango ribų, Orvena išlaiko ištisus naujausius klausimus ir atsakymus, o seniausius praleidžia, užuot juos apibendrinusi. Jei vienas įrankio rezultatas per didelis, kad tilptų, ji parašo "The latest tool result is too large for this model's context window. Try a narrower request." (naujausias įrankio rezultatas per didelis šio modelio konteksto langui, pateikite siauresnę užklausą).
Kai mąstymas įjungtas, visam atsakymui naudojama 1,0 temperatūra ir 0,95 top-p, o kai išjungtas, 0,7 temperatūra ir 0,8 top-p.
Mąstymo režimas
Qwen 3.5 prieš atsakydamas samprotauja, nebent jam nurodoma to nedaryti. Orvena šiam samprotavimui skiria žetonų biudžetą: 288 žetonus 8 GB telefone ir 576 telefone su 12 GB, o energijos taupymo režimu (Low Power Mode) perpus mažiau. Kai biudžetas baigiasi, programėlė priverčia modelį užbaigti mąstymą ir pradėti atsakymą, todėl sudėtingas klausimas negali užstrigti neribotai. Skiltyje "Modeliai" yra du nustatymai, "Automatinis" ir "Išjungta", o Nustatymų skiltyje "Išplėstiniai" galima nustatyti pasirinktinį biudžetą nuo 128 iki 2 048 žetonų. Mąstymas labiausiai padeda daugiapakopėse užduotyse su įrankiais, pavyzdžiui, kai žadintuvas priklauso nuo kelionės laiko, ir kainuoja kelias sekundes; greitam faktiniam klausimui su "Išjungta" atsakymas pastebimai greitesnis.
Įrankių iškvietimas
Įrankiai modeliui aprašomi kaip JSON funkcijų schemos ir į raginimą įterpiami paties modelio pokalbio šablonu, todėl modelis iškvietimus pateikia tokiu formatu, kokiu buvo apmokytas. Orvena raginimą išlaiko mažą, atskleisdama įrankius palaipsniui: modelis pradeda nuo kelių pagrindinių įrankių ir trumpų santraukų, tada įkelia reikiamą įgūdį (kalendorių, priminimus, žemėlapius, sveikatą ir t. t.) ir tik tada mato visas schemas. Viena užklausa gali užtrukti iki 32 modelio ciklų. Kiekvienas iškvietimas tikrinamas pagal deklaruotą schemą; iškvietimas su nedeklaruotu pavadinimu ar netaisyklingais argumentais ne tyliai atmetamas, o grąžinamas modeliui kaip klaida, kurią jis gali perskaityti ir ištaisyti.
Svarbius skaičiavimus atlieka įrankiai, o ne modelis. Kai prašote žadintuvo, kad laiku kur nors nuvyktumėte, kelionės įrankis apskaičiuoja, kada reikia išvykti, o modelis tik tai praneša.
Greitis
Paskelbto Orvena našumo testo kol kas nėra. Tekstas rodomas tuo metu, kai rašomas, o pirmieji trumpo atsakymo žodžiai pasirodo per sekundę ar dvi. Pastebėsite, kad ilgame pokalbyje atsakymas prasideda vėliau, nes raginimo skaitymas telefone yra brangiausia dalis, ir kad mąstymas prideda matomą pauzę.
Kalbos ir vaizdai
Modelis atsako ta kalba, kuria rašote. Kad tai patikimai veiktų ir su trumpomis žinutėmis, Orvena kiekvienos žinutės kalbą nustato Apple kalbos atpažinimo priemone įrenginyje ir prideda vykdymo metu pastabą, kurioje ji nurodyta; pastaba pašalinama iš visko, ką modelis parašo atgal, todėl jūs jos niekada nematote. Pridėtos nuotraukos apdorojamos vaizdo koduotuvu telefone.
Palyginti su Qwen paleidimu Mac kompiuteryje
Mac kompiuteryje galite rinktis didesnius Qwen 3.5 dydžius, ir tai yra stipresni modeliai. Telefone 4B šiandien yra praktinė riba. Telefonas prideda viską, kas yra aplink modelį: jūsų kalendorių, priminimus, žadintuvus, nuotraukas, sveikatos suvestines, žemėlapius ir kiekvieno modelio atlikto veiksmo įrašą, kurį galite perskaityti ir anuliuoti. Jei telefone norite didesnio modelio, Premium su iOS 27 prideda Apple Private Cloud Compute, kuriam nereikia nustatyti jokio rakto, arba bet kurį OpenRouter modelį su jūsų pačių raktu, o Orvena paprašo sutikimo, prieš bet kuriam pokalbiui paliekant įrenginį.
Dažni klausimai
Kurį Qwen variantą atsisiunčia Orvena?
Pagal numatytuosius nustatymus mlx-community/Qwen3.5-4B-4bit užfiksuotos revizijos, 3,06 GB dešimtyje failų. Skiltyje "Modeliai" galima rinktis ir mišraus keturių bei aštuonių bitų tikslumo variantą (3,57 GB), kuris tiksliau iškviečia įrankius.
Ar galiu įkelti savo GGUF ar MLX modelį?
Ne. Atsisiuntimų kataloge yra du įrašai, ir kiekvienas prieš įtraukiant išbandomas įrankių ciklo testais tikruose įrenginiuose. Su iOS 27 skiltyje "Modeliai" taip pat siūloma į iOS integruota Apple Intelligence. Orvena yra asistentas, o ne bendrosios paskirties modelių paleidimo programa.
Iš kur gaunami svoriai ir ar jie patikrinami?
Iš Orvena veidrodinio serverio, o atsarginis šaltinis yra Hugging Face. Kiekvienas failas prieš aktyvuojant modelį patikrinamas pagal užfiksuotą dydį ir SHA-256 maišos reikšmę. Atsisiuntimas vyksta fone, nutrūkęs tęsiamas ir neįtraukiamas į iCloud atsarginę kopiją.
Ar mano duomenys naudojami Qwen mokyti?
Ne. Modelis veikia jūsų telefone. Niekas, ką rašote ar sakote, nesiunčiama nei Alibaba, nei Orvena. Įrankis į savo paslaugą siunčia tai, ko jam reikia, pavyzdžiui, paieškos užklausą į DuckDuckGo, o jūsų pokalbis palieka telefoną tik tada, jei pasirenkate Private Cloud Compute arba patys prijungiate debesies modelį.
Orvena nemokama App Store iPhone 15 Pro ir naujesniuose telefonuose. 3,1 GB atsisiuntimas atliekamas vieną kartą, o modelis veikia telefone.
Atsisiųsti iš App Store