Jak spustit Qwen 3.5 4B v telefonu iPhone pomocí MLX
Pokud Qwen spouštíte na notebooku, tuhle rodinu modelů už znáte. Tady je konkrétní nastavení, se kterým Qwen běží v telefonu iPhone: jaká varianta, jak je kvantizovaná, kolik paměti a úložiště potřebuje, co runtime dělá mezi jednotlivými výměnami a co model se čtyřmi miliardami parametrů umí a neumí, jakmile ho připojíte ke kalendáři.
Model
Qwen 3.5 4B je jeden z malých modelů Qwen 3.5 od týmu Qwen ze společnosti Alibaba (rodina má i velikosti 0,8B, 2B a 9B), vydaný na začátku roku 2026 pod licencí Apache 2.0. Má přibližně čtyři miliardy parametrů, obrazový enkodér, takže umí číst obrázky, režim přemýšlení, který je ve výchozím stavu zapnutý, nativní kontext 262 144 tokenů a trénink na volání nástrojů. Alibaba uvádí 201 jazyků a dialektů. V telefonu jsou nejdůležitější dvě vlastnosti, volání nástrojů a velikost: je to zhruba největší model, který v 8 GB paměti běží s rezervou.
Orvena stahuje mlx-community/Qwen3.5-4B-4bit, připnutý na jednu konkrétní revizi. Stahuje se deset souborů o celkové velikosti 3,06 GB, z toho váhy tvoří 3,03 GB; aplikace to zaokrouhluje na "3,1 GB". Druhá možnost, "Qwen 3.5 4B Mixed", ponechává některé nejcitlivější vrstvy (embeddingy, polovinu projekcí MLP down a část projekcí value v attention) v osmi bitech a zbytek ve čtyřech. Má 3,57 GB a vytváří přesnější argumenty volání nástrojů, tedy právě tam, kde se čtyřbitová kvantizace projeví nejdřív. Mezi oběma můžete přepínat na stránce Modely.
Proč čtyři bity
Při šestnácti bitech na váhu zabírají čtyři miliardy parametrů přibližně 8 GB, což je celá paměť telefonu. Ve čtyřech bitech mají váhy na disku asi 3 GB a v paměti o něco víc, takže zbývá místo pro iOS, aplikaci a pracovní paměť, kterou model při odpovídání potřebuje. Odtud hardwarový požadavek: Orvena při prvním spuštění zkontroluje fyzickou paměť telefonu a pod zhruba 8 GB stažení nenabídne. Tolik paměti mají iPhone 15 Pro a 15 Pro Max, každý iPhone 16 včetně 16e a iPhone 17 a 17e. iPhone Air a modely 17 Pro mají 12 GB. Apple pro Apple Intelligence uvádí také iPhone 18 Pro, 18 Pro Max a iPhone Duo; na jakémkoli telefonu rozhoduje kontrola paměti během nastavení.
Běhové prostředí
Inference běží přes MLX, framework Apple pro práci s poli na vlastních čipech Apple, pomocí vazeb pro Swift. Model běží na GPU s jednotnou pamětí telefonu, takže se váhy mezi procesory nekopírují. Po načtení zůstávají váhy v paměti i mezi výměnami; varování iOS o nedostatku paměti vyprázdní mezipaměti, ale model ne.
Díky dvěma mezipamětem působí telefon rychleji, než by odpovídalo jeho hrubé propustnosti. Při načtení modelu Orvena spočítá pevnou část promptu, tedy systémový prompt a popisy nástrojů, a tento stav si ponechá, takže nová konverzace za tyto tokeny znovu neplatí. V rámci konverzace se mezipaměť klíčů a hodnot (KV cache) přenáší z výměny na výměnu, takže každá odpověď musí přečíst jen vaši poslední zprávu a výsledky nástrojů, ne celou historii.
Kontextové okno je v telefonu omezené na 16 384 tokenů místo plných 262k, které model zvládá. To je asi 12 000 slov konverzace a limit existuje proto, že čtení dlouhého promptu je v telefonu ta pomalá část a mezipaměť pro dlouhý kontext je to, co vyčerpá paměť. Když konverzace okno přeroste, Orvena ponechá nejnovější celé výměny a nejstarší vynechá, místo aby je shrnula. Pokud se nevejde ani jediný výsledek nástroje, zobrazí "The latest tool result is too large for this model's context window. Try a narrower request." (poslední výsledek nástroje je pro kontextové okno modelu příliš velký, zkuste užší požadavek).
Vzorkování používá při zapnutém přemýšlení pro celou odpověď teplotu 1,0 s top-p 0,95 a při vypnutém přemýšlení teplotu 0,7 s top-p 0,8.
Režim přemýšlení
Qwen 3.5 před odpovědí uvažuje, pokud mu to nezakážete. Orvena tomuto uvažování přiděluje rozpočet tokenů: 288 tokenů na telefonu s 8 GB a 576 na telefonu s 12 GB, v Úsporném režimu polovinu. Když se rozpočet vyčerpá, aplikace model přinutí přemýšlení ukončit a začít odpovídat, takže se těžká otázka nemůže zaseknout donekonečna. Stránka Modely má dvě nastavení, Automaticky a Vypnuto, a v Nastavení v části Pokročilé lze nastavit vlastní rozpočet mezi 128 a 2 048 tokeny. Přemýšlení nejvíc pomáhá u vícekrokových úloh s nástroji, například u budíku, který závisí na době cesty, a stojí pár sekund; u rychlé faktické otázky je Vypnuto znatelně rychlejší.
Volání nástrojů
Nástroje jsou modelu popsány jako schémata funkcí v JSON a do promptu je vkládá vlastní chatová šablona modelu, takže model generuje volání ve formátu, na kterém byl trénován. Orvena udržuje prompt malý tím, že nástroje odkrývá postupně: model začíná s několika základními nástroji a krátkými souhrny, pak načte dovednost, kterou potřebuje (kalendář, připomínky, mapy, zdraví a tak dále), a teprve potom vidí úplná schémata. Požadavek může zabrat až 32 kol modelu. Každé volání se kontroluje proti deklarovanému schématu; volání nedeklarovaného názvu nebo volání s chybnými argumenty se modelu vrátí jako chyba, kterou si může přečíst a opravit, místo aby tiše zmizelo.
Výpočty, na kterých záleží, dělají nástroje, ne model. Když chcete budík, se kterým někam dorazíte včas, nástroj pro cestování spočítá čas odchodu a model ho jen oznámí.
Rychlost
Zveřejněný benchmark pro Orvenu zatím neexistuje. Text se zobrazuje průběžně, jak vzniká, a první slova krátké odpovědi se objeví do jedné až dvou sekund. Všimnete si, že u dlouhé konverzace trvá déle, než odpověď začne, protože čtení promptu je v telefonu ta nákladná část, a že přemýšlení přidává viditelnou pauzu.
Jazyky a obrázky
Model odpovídá v jazyce, ve kterém píšete. Aby to bylo spolehlivé i u krátkých zpráv, Orvena rozpozná jazyk každé zprávy pomocí rozpoznávače jazyka Apple přímo v zařízení a připojí běhovou poznámku, která ho uvádí; poznámka se odstraní ze všeho, co model napíše zpět, takže ji nikdy neuvidíte. Přiložené fotky zpracovává obrazový enkodér přímo v telefonu.
Srovnání se spouštěním Qwen na Macu
Na Macu si můžete vybrat větší velikosti Qwen 3.5 a jsou to silnější modely. V telefonu je dnes praktickým stropem 4B. Telefon ale přidává všechno kolem modelu: váš kalendář, připomínky, budíky, fotky, zdravotní souhrny, mapy a záznam každé akce modelu, který si můžete přečíst a vrátit zpět. Pokud chcete z telefonu větší model, Premium přidá v iOS 27 Private Cloud Compute od společnosti Apple, bez nastavování klíče, nebo jakýkoli model z OpenRouteru s vaším vlastním klíčem, a Orvena si před odesláním jakékoli konverzace ze zařízení vyžádá souhlas.
Časté otázky
Kterou variantu Qwen Orvena stahuje?
Ve výchozím stavu mlx-community/Qwen3.5-4B-4bit v připnuté revizi, 3,06 GB v deseti souborech. Na stránce Modely je k dispozici smíšená čtyř- a osmibitová varianta o velikosti 3,57 GB pro přesnější volání nástrojů.
Můžu načíst vlastní model GGUF nebo MLX?
Ne. Katalog ke stažení má dvě položky a každá je před zařazením otestována testy smyčky nástrojů na fyzických zařízeních. V iOS 27 stránka Modely nabízí také Apple Intelligence, která je součástí iOS. Orvena je asistent, ne univerzální spouštěč modelů.
Odkud pocházejí váhy a jsou ověřené?
Ze zrcadla, které provozuje Orvena, s Hugging Face jako záložním zdrojem. Každý soubor se před aktivací modelu ověří proti připnuté velikosti a hashi SHA-256. Stahování běží na pozadí, po přerušení pokračuje a je vyloučené ze zálohy na iCloud.
Používají se moje data k trénování Qwen?
Ne. Model běží ve vašem telefonu. Nic z toho, co napíšete nebo řeknete, nedostane Alibaba ani Orvena. Nástroj pošle, co potřebuje, své vlastní službě, například dotaz pro vyhledávání na webu do DuckDuckGo, a vaše konverzace opustí telefon, jen když zvolíte Private Cloud Compute nebo sami připojíte cloudový model.
Orvena je v App Storu zdarma pro iPhone 15 Pro a novější. Stažení 3,1 GB proběhne jednou a model pak běží v telefonu.
Stáhnout v App Store