Spustenie Qwen 3.5 4B v iPhone cez MLX
Ak spúšťate Qwen na notebooku, túto rodinu modelov už poznáte. Toto je konkrétne nastavenie, s ktorým Qwen beží v iPhone: aký variant, ako je kvantizovaný, koľko pamäte a úložiska potrebuje, čo robí runtime medzi výmenami a čo model so štyrmi miliardami parametrov dokáže a nedokáže, keď ho pripojíte k svojmu kalendáru.
Model
Qwen 3.5 4B je jeden z malých modelov Qwen 3.5 od tímu Qwen spoločnosti Alibaba (rodina má aj veľkosti 0,8B, 2B a 9B), zverejnený začiatkom roka 2026 pod licenciou Apache 2.0. Má približne štyri miliardy parametrov, obrazový enkodér, vďaka ktorému dokáže čítať obrázky, režim premýšľania, ktorý je predvolene zapnutý, natívny kontext 262 144 tokenov a je trénovaný na volanie nástrojov. Alibaba uvádza 201 jazykov a dialektov. V telefóne sú najdôležitejšie dve vlastnosti, volanie nástrojov a veľkosť: je to zhruba najväčší model, ktorý v 8 GB pamäte beží s rezervou.
Orvena sťahuje mlx-community/Qwen3.5-4B-4bit v jednej pevne určenej revízii. Stiahnutie tvorí desať súborov s celkovou veľkosťou 3,06 GB, z toho váhy majú 3,03 GB; aplikácia to zaokrúhľuje na "3,1 GB". Druhá možnosť, "Qwen 3.5 4B Mixed", ponecháva niektoré najcitlivejšie vrstvy (embeddingy, polovicu down projekcií MLP a niektoré value projekcie v attention) v ôsmich bitoch a zvyšok v štyroch. Má 3,57 GB a vytvára presnejšie argumenty volaní nástrojov, teda práve to, na čom sa štvorbitová kvantizácia prejaví najskôr. Medzi oboma môžete prepínať na stránke Modely.
Prečo štyri bity
Pri šestnástich bitoch na váhu zaberú štyri miliardy parametrov asi 8 GB, čo je celá pamäť telefónu. Pri štyroch bitoch majú váhy na disku asi 3 GB a v pamäti o niečo viac, takže zostáva miesto pre iOS, aplikáciu a pracovnú pamäť, ktorú model počas odpovede potrebuje. Z toho vyplýva hardvérová požiadavka: Orvena pri prvom spustení skontroluje fyzickú pamäť telefónu a pod zhruba 8 GB stiahnutie neponúkne. Túto pamäť majú iPhone 15 Pro a 15 Pro Max, všetky iPhone 16 vrátane 16e a iPhone 17 a 17e. iPhone Air a modely 17 Pro majú 12 GB. Apple pre Apple Intelligence uvádza aj iPhone 18 Pro, 18 Pro Max a iPhone Duo; pri akomkoľvek telefóne rozhoduje kontrola pamäte počas nastavenia.
Runtime
Inferencia beží cez MLX, framework spoločnosti Apple na výpočty s poľami pre jej vlastné čipy, s využitím väzieb pre Swift. Model beží na GPU so zjednotenou pamäťou telefónu, takže sa váhy medzi procesormi nekopírujú. Po načítaní zostávajú váhy v pamäti aj medzi výmenami; varovanie o nedostatku pamäte z iOS vymaže vyrovnávacie pamäte, ale model nie.
Vďaka dvom vyrovnávacím pamätiam pôsobí telefón rýchlejšie, než by naznačoval jeho samotný výkon. Pri načítaní modelu Orvena vypočíta pevnú časť promptu, teda systémový prompt a popisy nástrojov, a tento stav si ponechá, takže nová konverzácia za tieto tokeny znova neplatí. V rámci konverzácie sa vyrovnávacia pamäť kľúčov a hodnôt (KV cache) prenáša z výmeny na výmenu, takže každá odpoveď musí prečítať len vašu poslednú správu a výsledky nástrojov, nie celú históriu.
Kontextové okno je v telefóne obmedzené na 16 384 tokenov namiesto plných 262k, ktoré model zvládne. To je asi 12 000 slov konverzácie a limit existuje preto, lebo čítanie dlhého promptu je v telefóne najpomalšia časť a pamäť vyčerpá práve vyrovnávacia pamäť pre dlhý kontext. Keď konverzácia presiahne okno, Orvena ponechá najnovšie celé výmeny a najstaršie vynechá, namiesto toho, aby ich zhrnula. Ak sa nezmestí ani jediný výsledok nástroja, zobrazí "The latest tool result is too large for this model's context window. Try a narrower request." (posledný výsledok nástroja je pre kontextové okno tohto modelu príliš veľký, skúste užšiu požiadavku).
Vzorkovanie používa pri zapnutom premýšľaní pre celú odpoveď teplotu 1,0 s top-p 0,95 a pri vypnutom premýšľaní teplotu 0,7 s top-p 0,8.
Režim premýšľania
Qwen 3.5 pred odpoveďou uvažuje, pokiaľ mu to nezakážete. Orvena tomuto uvažovaniu prideľuje rozpočet tokenov: 288 tokenov v telefóne s 8 GB a 576 v telefóne s 12 GB, v režime nízkej spotreby polovicu. Keď sa rozpočet minie, aplikácia prinúti model ukončiť premýšľanie a začať odpovedať, takže sa ťažká otázka nemôže zaseknúť donekonečna. Stránka Modely má dve nastavenia, Automaticky a Vypnuté, a v Nastaveniach v časti Rozšírené pribudne vlastný rozpočet od 128 do 2 048 tokenov. Premýšľanie najviac pomáha pri viackrokových úlohách s nástrojmi, napríklad pri budíku, ktorý závisí od času cesty, a stojí pár sekúnd; pri rýchlej faktickej otázke je možnosť Vypnuté citeľne rýchlejšia.
Volanie nástrojov
Nástroje sú modelu opísané ako schémy funkcií v JSON a do promptu ich vloží vlastná šablóna chatu modelu, takže model generuje volania vo formáte, na ktorom bol trénovaný. Orvena udržiava prompt malý tým, že nástroje odhaľuje postupne: model začína s niekoľkými základnými nástrojmi a krátkymi zhrnutiami, potom si načíta zručnosť, ktorú potrebuje (kalendár, pripomienky, mapy, zdravie a podobne), a až potom vidí úplné schémy. Jedna požiadavka môže zabrať až 32 kôl modelu. Každé volanie sa kontroluje voči deklarovanej schéme; volanie nedeklarovaného názvu alebo volanie s chybnými argumentmi sa modelu vráti ako chyba, ktorú si môže prečítať a opraviť, namiesto toho, aby sa potichu zahodilo.
Výpočty, na ktorých záleží, robia nástroje, nie model. Keď požiadate o budík, s ktorým niekam prídete načas, nástroj na výpočet cesty určí čas odchodu a model ho len oznámi.
Rýchlosť
Zverejnený benchmark pre Orvenu zatiaľ neexistuje. Text sa zobrazuje priebežne, ako vzniká, a prvé slová krátkej odpovede sa objavia do sekundy či dvoch. Všimnete si, že pri dlhej konverzácii trvá dlhšie, kým sa odpoveď začne, pretože čítanie promptu je v telefóne najnáročnejšia časť, a že premýšľanie pridáva viditeľnú pauzu.
Jazyky a obrázky
Model odpovedá v jazyku, v ktorom píšete. Aby to spoľahlivo fungovalo aj pri krátkych správach, Orvena rozpozná jazyk každej správy pomocou rozpoznávača jazyka od Apple priamo v zariadení a pripojí poznámku, ktorá ho uvádza; táto poznámka sa odstráni zo všetkého, čo model napíše späť, takže ju nikdy neuvidíte. Priložené fotky spracuje obrazový enkodér priamo v telefóne.
Porovnanie so spúšťaním Qwen na Macu
Na Macu si môžete vybrať väčšie veľkosti Qwen 3.5 a sú to silnejšie modely. V telefóne je dnes praktickým stropom 4B. Telefón však pridáva všetko okolo modelu: váš kalendár, pripomienky, budíky, fotky, zdravotné prehľady, mapy a záznam o každej akcii modelu, ktorý si môžete prečítať a vrátiť späť. Ak chcete z telefónu väčší model, Premium pridá v iOS 27 Private Cloud Compute od Apple bez nastavovania kľúča alebo ľubovoľný model OpenRouter s vaším vlastným kľúčom a Orvena si vyžiada súhlas skôr, než akákoľvek konverzácia opustí zariadenie.
Časté otázky
Ktorý variant Qwen Orvena sťahuje?
Predvolene mlx-community/Qwen3.5-4B-4bit v pevne určenej revízii, 3,06 GB v desiatich súboroch. Na stránke Modely je dostupný aj zmiešaný štvor- a osembitový variant s veľkosťou 3,57 GB pre presnejšie volania nástrojov.
Môžem načítať vlastný model GGUF alebo MLX?
Nie. Katalóg na stiahnutie má dve položky a každá sa pred zaradením overuje testami slučky nástrojov na fyzických zariadeniach. V iOS 27 ponúka stránka Modely aj Apple Intelligence, ktorá je súčasťou iOS. Orvena je asistent, nie univerzálny spúšťač modelov.
Odkiaľ pochádzajú váhy a sú overené?
Zo zrkadla, ktoré prevádzkuje Orvena, s Hugging Face ako záložným zdrojom. Každý súbor sa pred aktiváciou modelu porovná s pevne určenou veľkosťou a hashom SHA-256. Sťahovanie beží na pozadí, po prerušení pokračuje a je vylúčené zo zálohy iCloud.
Používajú sa moje údaje na trénovanie Qwen?
Nie. Model beží vo vašom telefóne. Nič, čo napíšete alebo poviete, sa neposiela spoločnosti Alibaba ani tvorcom aplikácie Orvena. Nástroj posiela to, čo potrebuje, svojej vlastnej službe, napríklad vyhľadávací dopyt do DuckDuckGo, a vaša konverzácia opustí telefón, len ak si zvolíte Private Cloud Compute alebo sami pripojíte cloudový model.
Orvena je zadarmo v App Store pre iPhone 15 Pro a novší. Model s veľkosťou 3,1 GB sa stiahne raz a beží v telefóne.
Stiahnuť v App Store