Sur l'appareil

Faire tourner Qwen 3.5 4B sur un iPhone avec MLX

MIS À JOUR LE 29 SEPTEMBRE 2026 · 6 MIN DE LECTURE · ORVENA LABS

Si vous faites tourner Qwen sur un ordinateur portable, vous connaissez déjà la famille. Voici la configuration concrète qui permet de faire tourner Qwen sur un iPhone : quelle variante, comment elle est quantifiée, combien de mémoire et de stockage il lui faut, ce que fait le runtime entre deux tours, et ce qu'un modèle de quatre milliards de paramètres peut ou ne peut pas faire une fois connecté à votre calendrier.

Orvena est gratuit sur iPhone 15 Pro ou plus récent. Le modèle tourne sur le téléphone lui-même. Télécharger

Le modèle

Qwen 3.5 4B fait partie des petits modèles Qwen 3.5 de l'équipe Qwen d'Alibaba (la famille existe aussi en 0.8B, 2B et 9B), publiés début 2026 sous licence Apache 2.0. Il compte environ quatre milliards de paramètres, un encodeur visuel qui lui permet de lire des images, un mode réflexion activé par défaut, un contexte natif de 262 144 tokens, et il a été entraîné aux appels d'outils. Alibaba annonce 201 langues et dialectes. Sur un téléphone, les deux propriétés qui comptent le plus sont les appels d'outils et la taille : c'est à peu près le plus grand modèle qui tourne avec de la marge dans 8 Go de mémoire.

Orvena télécharge mlx-community/Qwen3.5-4B-4bit, figé sur une révision unique. Le téléchargement compte dix fichiers pour un total de 3,06 Go, dont 3,03 Go de poids ; l'app arrondit à "3.1 GB". Une seconde option, "Qwen 3.5 4B Mixed" (mixte), garde en huit bits certaines des couches les plus sensibles (les embeddings, la moitié des projections descendantes des MLP et une partie des projections de valeurs de l'attention) et le reste en quatre bits. Elle pèse 3,57 Go et produit des arguments d'appels d'outils plus précis, là où la quantification en quatre bits se fait sentir en premier. Vous pouvez passer de l'une à l'autre sur la page Modèles.

Pourquoi quatre bits

À seize bits par poids, quatre milliards de paramètres occupent environ 8 Go, soit toute la mémoire du téléphone. En quatre bits, les poids font environ 3 Go sur le disque et un peu plus en mémoire, ce qui laisse de la place pour iOS, l'app et la mémoire de travail dont le modèle a besoin pendant qu'il répond. C'est la raison de l'exigence matérielle : au premier lancement, Orvena vérifie la mémoire physique du téléphone et ne propose pas le téléchargement en dessous d'environ 8 Go. Les téléphones qui en disposent sont l'iPhone 15 Pro et le 15 Pro Max, tous les iPhone 16, y compris le 16e, ainsi que l'iPhone 17 et le 17e. L'iPhone Air et les modèles 17 Pro ont 12 Go. Apple mentionne aussi l'iPhone 18 Pro, le 18 Pro Max et l'iPhone Duo pour Apple Intelligence ; quel que soit le téléphone, c'est la vérification de la mémoire pendant la configuration qui tranche.

Le runtime

L'inférence passe par MLX, le framework de calcul sur tableaux qu'Apple a conçu pour ses propres puces, via ses bindings Swift. Le modèle tourne sur le GPU avec la mémoire unifiée du téléphone : les poids ne sont donc jamais copiés d'un processeur à l'autre. Une fois chargés, ils restent en mémoire d'un tour à l'autre ; un avertissement mémoire d'iOS vide les caches, mais pas le modèle.

Deux caches rendent le téléphone plus réactif que son débit brut ne le laisserait penser. Au chargement du modèle, Orvena calcule la partie fixe du prompt, c'est-à-dire le prompt système et les descriptions des outils, et conserve cet état : une nouvelle conversation ne repaie donc pas ces tokens. Au sein d'une conversation, le cache clé-valeur est reporté d'un tour à l'autre, si bien que chaque réponse n'a besoin de lire que votre dernier message et les résultats d'outils, pas tout l'historique.

La fenêtre de contexte est plafonnée à 16 384 tokens sur le téléphone, au lieu des 262k du modèle complet. Cela représente environ 12 000 mots de conversation, et ce plafond existe parce que la lecture d'un long prompt est l'étape lente sur un téléphone et que le cache d'un long contexte est ce qui épuise la mémoire. Quand une conversation dépasse la fenêtre, Orvena garde les tours complets les plus récents et laisse de côté les plus anciens plutôt que de les résumer. Si un seul résultat d'outil est trop volumineux pour tenir, il affiche "The latest tool result is too large for this model's context window. Try a narrower request." (le dernier résultat d'outil est trop volumineux pour la fenêtre de contexte de ce modèle ; essayez une demande plus ciblée).

L'échantillonnage utilise une température de 1,0 avec un top-p de 0,95 pour toute la réponse quand la réflexion est activée, et une température de 0,7 avec un top-p de 0,8 quand elle est désactivée.

Le mode réflexion

Qwen 3.5 raisonne avant de répondre, sauf si on lui demande de ne pas le faire. Orvena attribue à ce raisonnement un budget de tokens : 288 tokens sur un téléphone de 8 Go et 576 sur un téléphone de 12 Go, deux fois moins en mode Économie d'énergie. Quand le budget est épuisé, l'app force le modèle à clore sa réflexion et à commencer la réponse, pour qu'une question difficile ne puisse pas bloquer indéfiniment. La page Modèles propose deux réglages, Automatique et Désactivé, et Réglages, Avancé, ajoute un budget personnalisé entre 128 et 2 048 tokens. La réflexion aide surtout pour les tâches à plusieurs étapes avec des outils (par exemple une alarme qui dépend du temps de trajet) et coûte quelques secondes ; pour une question factuelle rapide, Désactivé est nettement plus rapide.

Les appels d'outils

Les outils sont décrits au modèle sous forme de schémas de fonctions JSON et insérés dans le prompt par le gabarit de conversation propre au modèle, si bien que le modèle émet ses appels dans le format sur lequel il a été entraîné. Orvena garde le prompt compact en dévoilant les outils progressivement : le modèle commence avec quelques outils de base et de courts résumés, puis charge la compétence dont il a besoin (calendrier, rappels, plans, santé, etc.), et ce n'est qu'alors qu'il voit les schémas complets. Une demande peut nécessiter jusqu'à 32 tours du modèle. Chaque appel est vérifié par rapport au schéma déclaré ; un appel à un nom non déclaré ou avec des arguments mal formés est renvoyé au modèle sous forme d'erreur qu'il peut lire et corriger, au lieu d'être ignoré en silence.

Les calculs qui comptent sont faits par des outils plutôt que par le modèle. Quand vous demandez une alarme pour arriver quelque part à l'heure, l'outil de trajet calcule l'heure de départ et le modèle se contente de la communiquer.

La vitesse

Il n'existe pas encore de benchmark publié pour Orvena. Le texte s'affiche au fur et à mesure de sa rédaction, et les premiers mots d'une réponse courte apparaissent en une seconde ou deux. Ce que vous remarquerez, c'est qu'une longue conversation met plus de temps avant que la réponse ne commence, parce que la lecture du prompt est l'étape coûteuse sur un téléphone, et que la réflexion ajoute une pause visible.

Langues et images

Le modèle répond dans la langue dans laquelle vous écrivez. Pour que ce soit fiable avec des messages courts, Orvena détecte la langue de chaque message avec l'outil de reconnaissance de langue d'Apple, sur l'appareil, et ajoute une note d'exécution qui l'indique ; cette note est retirée de tout ce que le modèle renvoie, si bien que vous ne la voyez jamais. Les photos jointes passent par l'encodeur visuel, sur le téléphone.

Par rapport à Qwen sur un Mac

Sur un Mac, vous pouvez choisir les plus grandes tailles de Qwen 3.5, qui sont des modèles plus performants. Sur un téléphone, 4B est aujourd'hui le plafond réaliste. Ce que le téléphone apporte, c'est tout ce qui entoure le modèle : votre calendrier, vos rappels, vos alarmes, vos photos, vos résumés de santé, les plans, et un registre de chaque action du modèle, que vous pouvez lire et annuler. Si vous voulez un modèle plus grand depuis votre téléphone, Premium ajoute Private Cloud Compute d'Apple sous iOS 27, sans clé à configurer, ou n'importe quel modèle OpenRouter avec votre propre clé, et Orvena demande votre consentement avant qu'une conversation ne quitte l'appareil.

Questions fréquentes

Quelle variante de Qwen Orvena télécharge-t-il ?

Par défaut, mlx-community/Qwen3.5-4B-4bit à une révision figée, soit 3,06 Go répartis en dix fichiers. Une variante mixte quatre et huit bits, de 3,57 Go, est disponible sur la page Modèles pour des appels d'outils plus précis.

Puis-je charger mon propre modèle GGUF ou MLX ?

Non. Le catalogue de téléchargement compte deux entrées, et chacune passe des tests de boucle d'outils sur des appareils physiques avant d'y figurer. Sous iOS 27, la page Modèles propose aussi Apple Intelligence, intégré à iOS. Orvena est un assistant, pas un lanceur de modèles généraliste.

D'où viennent les poids, et sont-ils vérifiés ?

Du miroir d'Orvena, avec Hugging Face en solution de repli. Chaque fichier est comparé à la taille et au hachage SHA-256 figés avant l'activation du modèle. Le téléchargement s'effectue en arrière-plan, reprend s'il est interrompu et est exclu de la sauvegarde iCloud.

Mes données servent-elles à entraîner Qwen ?

Non. Le modèle tourne sur votre téléphone. Rien de ce que vous tapez ou dites n'est envoyé à Alibaba ni à Orvena. Un outil envoie ce dont il a besoin à son propre service, par exemple une requête de recherche web à DuckDuckGo, et votre conversation ne quitte le téléphone que si vous choisissez Private Cloud Compute ou connectez vous-même un modèle cloud.

Qwen 3.5 4B, sur le téléphone, avec votre calendrier.

Orvena est gratuit sur l'App Store pour iPhone 15 Pro ou plus récent. Le téléchargement de 3,1 Go se fait une seule fois, et le modèle tourne sur le téléphone.

Télécharger dans l'App Store