Sul dispositivo

Eseguire Qwen 3.5 4B su iPhone con MLX

AGGIORNATO IL 29 SETTEMBRE 2026 · 6 MIN DI LETTURA · ORVENA LABS

Se usi Qwen su un portatile, conosci già la famiglia. Questa è la configurazione concreta per eseguire Qwen su iPhone: quale variante, come è quantizzata, quanta memoria e quanto spazio richiede, cosa fa il runtime tra un turno e l'altro, e cosa può e non può fare un modello da quattro miliardi di parametri una volta collegato al tuo calendario.

Orvena è gratuita per iPhone 15 Pro e modelli successivi. Il modello funziona direttamente sul telefono. Scarica

Il modello

Qwen 3.5 4B è uno dei modelli Qwen 3.5 piccoli del team Qwen di Alibaba (la famiglia comprende anche le taglie 0.8B, 2B e 9B), pubblicato all'inizio del 2026 con licenza Apache 2.0. Ha circa quattro miliardi di parametri, un encoder visivo che gli permette di leggere le immagini, una modalità di ragionamento attiva per impostazione predefinita, un contesto nativo di 262.144 token e un addestramento specifico per le chiamate agli strumenti. Alibaba indica 201 lingue e dialetti. Su un telefono, le due proprietà che contano di più sono le chiamate agli strumenti e le dimensioni: è più o meno il modello più grande che gira con margine in 8 GB di memoria.

Orvena scarica mlx-community/Qwen3.5-4B-4bit, fissato a un'unica revisione. Il download è di dieci file per un totale di 3,06 GB, di cui 3,03 GB sono i pesi; l'app lo arrotonda a "3,1 GB". Una seconda opzione, "Qwen 3.5 4B Mixed", mantiene a otto bit alcuni dei livelli più sensibili (gli embedding, metà delle proiezioni down degli MLP e alcune proiezioni value dell'attenzione) e il resto a quattro. Pesa 3,57 GB e produce argomenti più precisi nelle chiamate agli strumenti, che è proprio il punto in cui la quantizzazione a quattro bit si fa sentire per prima. Puoi passare dall'una all'altra nella pagina Modelli.

Perché quattro bit

A sedici bit per peso, quattro miliardi di parametri occupano circa 8 GB, cioè l'intera memoria del telefono. A quattro bit i pesi sono circa 3 GB su disco e poco di più in memoria, e resta spazio per iOS, per l'app e per la memoria di lavoro che serve al modello mentre risponde. È questo il motivo del requisito hardware: al primo avvio Orvena controlla la memoria fisica del telefono e non propone il download sotto gli 8 GB circa. I telefoni che li hanno sono iPhone 15 Pro e 15 Pro Max, tutti gli iPhone 16, compreso il 16e, e iPhone 17 e 17e. iPhone Air e i modelli 17 Pro hanno 12 GB. Apple indica anche iPhone 18 Pro, 18 Pro Max e iPhone Duo per Apple Intelligence; su qualsiasi telefono, a decidere è il controllo della memoria durante la configurazione.

Il runtime

L'inferenza passa da MLX, il framework di array di Apple per i suoi chip, tramite i binding Swift. Il modello gira sulla GPU con la memoria unificata del telefono, quindi i pesi non vengono copiati tra un processore e l'altro. Una volta caricati, i pesi restano in memoria tra un turno e l'altro; un avviso di memoria di iOS svuota le cache ma non scarica il modello.

Due cache fanno sembrare il telefono più veloce di quanto suggerirebbe la sua velocità grezza. Quando il modello si carica, Orvena calcola la parte fissa del prompt, cioè il prompt di sistema e le descrizioni degli strumenti, e ne conserva lo stato, così una nuova conversazione non paga di nuovo quei token. All'interno di una conversazione la cache chiave-valore passa da un turno all'altro, quindi ogni risposta deve leggere solo il tuo ultimo messaggio e i risultati degli strumenti, non tutta la cronologia.

Sul telefono la finestra di contesto è limitata a 16.384 token, invece dei 262k completi del modello. Sono circa 12.000 parole di conversazione, e il limite esiste perché su un telefono leggere un prompt lungo è la parte lenta, e la cache di un contesto lungo è ciò che esaurisce la memoria. Quando una conversazione supera la finestra, Orvena tiene i turni completi più recenti e lascia fuori i più vecchi invece di riassumerli. Se un singolo risultato di uno strumento è troppo grande per starci, mostra "The latest tool result is too large for this model's context window. Try a narrower request." (l'ultimo risultato dello strumento è troppo grande per la finestra di contesto del modello: prova con una richiesta più mirata).

Il campionamento usa temperatura 1,0 con top-p 0,95 per tutta la risposta quando il ragionamento è attivo, e temperatura 0,7 con top-p 0,8 quando è disattivato.

Modalità di ragionamento

Qwen 3.5 ragiona prima di rispondere, a meno che non gli si dica di non farlo. Orvena assegna a questo ragionamento un budget di token: 288 token su un telefono da 8 GB e 576 su uno da 12 GB, la metà in modalità Risparmio energetico. Quando il budget finisce, l'app costringe il modello a chiudere il ragionamento e a iniziare la risposta, così una domanda difficile non può bloccarsi all'infinito. La pagina Modelli ha due impostazioni, Automatico e Disattivato, e in Impostazioni, Avanzate si aggiunge un budget personalizzato tra 128 e 2.048 token. Il ragionamento aiuta soprattutto nelle attività con più passaggi e più strumenti, per esempio una sveglia che dipende dal tempo di percorrenza, e costa qualche secondo; per una semplice domanda fattuale, Disattivato è molto più veloce.

Chiamate agli strumenti

Gli strumenti vengono descritti al modello come schemi di funzione JSON e inseriti nel prompt dal chat template del modello stesso, così il modello emette le chiamate nel formato su cui è stato addestrato. Orvena mantiene il prompt piccolo rivelando gli strumenti in modo progressivo: il modello parte con pochi strumenti di base e brevi riepiloghi, poi carica la skill che gli serve (calendario, promemoria, mappe, salute e così via) e solo allora vede gli schemi completi. Una richiesta può richiedere fino a 32 passaggi del modello. Ogni chiamata viene verificata rispetto allo schema dichiarato; una chiamata a un nome non dichiarato o con argomenti malformati torna al modello come un errore che può leggere e correggere, invece di essere scartata in silenzio.

I calcoli che contano li fanno gli strumenti, non il modello. Quando chiedi una sveglia che ti faccia arrivare in orario da qualche parte, lo strumento dei tempi di percorrenza calcola l'ora in cui partire e il modello si limita a riferirla.

Velocità

Non esiste ancora un benchmark pubblicato per Orvena. Il testo compare mentre viene scritto, e le prime parole di una risposta breve arrivano entro un secondo o due. Quello che noterai è che in una conversazione lunga passa più tempo prima che la risposta inizi, perché su un telefono leggere il prompt è la parte costosa, e che il ragionamento aggiunge una pausa visibile.

Lingue e immagini

Il modello risponde in qualunque lingua tu scriva. Per renderlo affidabile anche con i messaggi brevi, Orvena rileva la lingua di ogni messaggio con il riconoscimento della lingua di Apple sul dispositivo e aggiunge una nota di runtime che la indica; la nota viene rimossa da tutto ciò che il modello scrive in risposta, quindi non la vedi mai. Le foto allegate passano dall'encoder visivo sul telefono.

Rispetto a Qwen su un Mac

Su un Mac puoi scegliere le taglie più grandi di Qwen 3.5, che sono modelli più forti. Su un telefono, oggi il limite pratico è 4B. Quello che il telefono aggiunge è tutto ciò che sta intorno al modello: calendario, promemoria, sveglie, foto, riepiloghi della salute, mappe, e un registro di ogni azione del modello che puoi leggere e annullare. Se dal telefono vuoi un modello più grande, Premium aggiunge Private Cloud Compute di Apple su iOS 27, senza chiavi da configurare, oppure qualsiasi modello OpenRouter con la tua chiave, e Orvena chiede il consenso prima che una conversazione lasci il dispositivo.

Domande frequenti

Quale variante di Qwen scarica Orvena?

Per impostazione predefinita mlx-community/Qwen3.5-4B-4bit a una revisione fissata, 3,06 GB in dieci file. Nella pagina Modelli c'è anche una variante mista a quattro e otto bit, da 3,57 GB, per chiamate agli strumenti più precise.

Posso caricare un mio modello GGUF o MLX?

No. Il catalogo dei download ha due voci, e ognuna viene provata con test del ciclo degli strumenti su dispositivi fisici prima di essere inserita. Su iOS 27 la pagina Modelli offre anche Apple Intelligence, che è integrata in iOS. Orvena è un assistente, non un esecutore di modelli generico.

Da dove arrivano i pesi, e sono verificati?

Dal mirror di Orvena, con Hugging Face come alternativa di riserva. Ogni file viene confrontato con la dimensione e l'hash SHA-256 fissati prima che il modello venga attivato. Il download avviene in background, riprende se viene interrotto ed è escluso dal backup di iCloud.

I miei dati vengono usati per addestrare Qwen?

No. Il modello funziona sul tuo telefono. Niente di ciò che scrivi o dici viene inviato ad Alibaba o a Orvena. Uno strumento invia al proprio servizio ciò che gli serve, per esempio una ricerca web a DuckDuckGo, e la tua conversazione esce dal telefono solo se scegli Private Cloud Compute o se colleghi tu stesso un modello cloud.

Qwen 3.5 4B, sul telefono, con il tuo calendario.

Orvena è gratuita sull'App Store per iPhone 15 Pro e modelli successivi. Il download da 3,1 GB si fa una volta sola e il modello gira sul telefono.

Scarica dall'App Store