Op het toestel

Qwen 3.5 4B op een iPhone draaien met MLX

BIJGEWERKT 29 SEPTEMBER 2026 · 6 MIN. LEESTIJD · ORVENA LABS

Draai je Qwen op een laptop, dan ken je de familie al. Dit is de concrete opzet om Qwen op een iPhone te draaien: welke variant, hoe die gekwantiseerd is, hoeveel geheugen en opslag nodig zijn, wat de runtime tussen beurten doet, en wat een model met vier miljard parameters wel en niet kan zodra het aan je agenda is gekoppeld.

Orvena is gratis voor iPhone 15 Pro en nieuwer. Het model draait op de telefoon zelf. Download

Het model

Qwen 3.5 4B is een van de kleine Qwen 3.5-modellen van het Qwen-team van Alibaba (de familie heeft ook de formaten 0,8B, 2B en 9B), begin 2026 gepubliceerd onder de Apache 2.0-licentie. Het heeft ongeveer vier miljard parameters, een vision-encoder waarmee het afbeeldingen kan lezen, een denkmodus die standaard aanstaat, een native context van 262.144 tokens en training voor toolaanroepen. Alibaba noemt 201 talen en dialecten. Op een telefoon tellen vooral twee eigenschappen: de toolaanroepen en het formaat. Dit is ongeveer het grootste model dat met ruimte over draait in 8 GB geheugen.

Orvena downloadt mlx-community/Qwen3.5-4B-4bit, vastgezet op één revisie. De download bestaat uit tien bestanden van samen 3,06 GB, waarvan 3,03 GB gewichten; de app rondt dat af op "3,1 GB". Een tweede optie, "Qwen 3.5 4B Mixed", houdt een deel van de gevoeligste lagen (de embeddings, de helft van de MLP-down-projecties en een deel van de attention-value-projecties) op acht bits en de rest op vier. Die variant is 3,57 GB en geeft nauwkeurigere argumenten bij toolaanroepen, precies waar kwantisatie op vier bits het eerst zichtbaar wordt. Op de pagina Modellen wissel je tussen de twee.

Waarom vier bits

Op zestien bits per gewicht zijn vier miljard parameters ongeveer 8 GB, en dat is het volledige geheugen van de telefoon. Op vier bits zijn de gewichten ongeveer 3 GB op schijf en iets meer in het geheugen, zodat er ruimte overblijft voor iOS, de app en het werkgeheugen dat het model nodig heeft terwijl het antwoordt. Daarom is er een hardware-eis: Orvena controleert bij de eerste start het fysieke geheugen van de telefoon en biedt de download onder ongeveer 8 GB niet aan. De telefoons die dat hebben, zijn de iPhone 15 Pro en 15 Pro Max, elke iPhone 16 inclusief de 16e, en de iPhone 17 en 17e. De iPhone Air en de 17 Pro-modellen hebben 12 GB. Apple noemt ook de iPhone 18 Pro, 18 Pro Max en iPhone Duo voor Apple Intelligence; op elke telefoon beslist de geheugencontrole tijdens het instellen.

De runtime

Inferentie loopt via MLX, het array-framework van Apple voor zijn eigen chips, met de Swift-bindings. Het model draait op de GPU met het gedeelde geheugen (unified memory) van de telefoon, dus gewichten hoeven niet tussen processors te worden gekopieerd. Eenmaal geladen blijven de gewichten tussen beurten in het geheugen; een geheugenwaarschuwing van iOS leegt de caches, maar niet het model.

Twee caches laten de telefoon sneller aanvoelen dan de ruwe doorvoer doet vermoeden. Bij het laden van het model berekent Orvena het vaste deel van de prompt, de systeemprompt en de toolbeschrijvingen, en bewaart die toestand, zodat een nieuw gesprek niet opnieuw voor die tokens betaalt. Binnen een gesprek gaat de key-value-cache mee van beurt naar beurt, zodat elk antwoord alleen je laatste bericht en de toolresultaten hoeft te lezen, niet de hele geschiedenis.

Het contextvenster is op de telefoon begrensd op 16.384 tokens, in plaats van de volledige 262k van het model. Dat is ongeveer 12.000 woorden gesprek. De grens bestaat omdat het lezen van een lange prompt op een telefoon het trage deel is, en omdat de cache voor een lange context het geheugen opmaakt. Groeit een gesprek voorbij het venster, dan houdt Orvena de recentste volledige beurten en laat hij de oudste weg, in plaats van ze samen te vatten. Is een enkel toolresultaat te groot, dan meldt hij "The latest tool result is too large for this model's context window. Try a narrower request." (het laatste toolresultaat past niet in het contextvenster van dit model; probeer een specifiekere vraag).

Bij het samplen is de temperatuur 1,0 met top-p 0,95 voor het hele antwoord als denken aanstaat, en 0,7 met top-p 0,8 als denken uitstaat.

Denkmodus

Qwen 3.5 redeneert voordat het antwoordt, tenzij het de opdracht krijgt dat niet te doen. Orvena geeft dat redeneren een tokenbudget: 288 tokens op een telefoon met 8 GB en 576 op een met 12 GB, de helft daarvan in de energiebesparingsmodus. Is het budget op, dan dwingt de app het model om het denken af te sluiten en aan het antwoord te beginnen, zodat een moeilijke vraag niet eindeloos kan blijven hangen. De pagina Modellen heeft twee instellingen, Automatisch en Uit, en onder Instellingen, Geavanceerd, stel je een eigen budget in tussen 128 en 2.048 tokens. Denken helpt het meest bij toolopdrachten met meerdere stappen, bijvoorbeeld een wekker die van de reistijd afhangt, en kost een paar seconden; bij een snelle feitenvraag is Uit merkbaar sneller.

Toolaanroepen

Tools worden aan het model beschreven als JSON-functieschema's en door het eigen chattemplate van het model in de prompt gezet, zodat het model aanroepen doet in het formaat waarop het is getraind. Orvena houdt de prompt klein door tools stap voor stap te onthullen: het model begint met een paar kerntools en korte samenvattingen, laadt dan de skill die het nodig heeft (agenda, herinneringen, kaarten, gezondheid enzovoort) en ziet pas daarna de volledige schema's. Een verzoek mag tot 32 modelrondes duren. Elke aanroep wordt gecontroleerd tegen het gedeclareerde schema; een aanroep naar een niet-gedeclareerde naam of met onjuiste argumenten gaat als foutmelding terug naar het model, dat die kan lezen en corrigeren, in plaats van stilletjes te worden weggegooid.

Rekenwerk dat ertoe doet, doen tools en niet het model. Vraag je om een wekker waarmee je ergens op tijd bent, dan berekent de reistool hoe laat je moet vertrekken en meldt het model alleen de uitkomst.

Snelheid

Er is nog geen gepubliceerde benchmark voor Orvena. Tekst verschijnt terwijl hij wordt geschreven, en de eerste woorden van een kort antwoord staan er binnen een à twee seconden. Wat je wel merkt: in een lang gesprek duurt het langer voordat het antwoord begint, omdat het lezen van de prompt op een telefoon het dure deel is, en denken voegt een zichtbare pauze toe.

Talen en afbeeldingen

Het model antwoordt in de taal waarin je schrijft. Om dat bij korte berichten betrouwbaar te maken, herkent Orvena de taal van elk bericht met de taalherkenning van Apple op het toestel en voegt hij een runtime-notitie toe die de taal noemt; die notitie wordt verwijderd uit alles wat het model terugschrijft, dus je ziet hem nooit. Bijgevoegde foto's gaan op de telefoon door de vision-encoder.

Vergeleken met Qwen op een Mac

Op een Mac kun je de grotere Qwen 3.5-formaten kiezen, en dat zijn sterkere modellen. Op een telefoon is 4B vandaag het praktische plafond. Wat de telefoon toevoegt, is alles rond het model: je agenda, herinneringen, wekkers, foto's, gezondheidsoverzichten, kaarten, en een overzicht van elke actie die het model uitvoert, dat je kunt nalezen en waarin je acties ongedaan kunt maken. Wil je vanaf je telefoon een groter model, dan voegt Premium Private Cloud Compute van Apple toe op iOS 27, zonder sleutel om in te stellen, of elk OpenRouter-model met je eigen sleutel, en Orvena vraagt om toestemming voordat een gesprek het toestel verlaat.

Veelgestelde vragen

Welke Qwen-variant downloadt Orvena?

Standaard mlx-community/Qwen3.5-4B-4bit op een vastgezette revisie, 3,06 GB in tien bestanden. Op de pagina Modellen staat ook een gemengde variant met vier en acht bits, 3,57 GB, voor nauwkeurigere toolaanroepen.

Kan ik mijn eigen GGUF- of MLX-model laden?

Nee. De downloadcatalogus heeft twee items, en elk item wordt met tool-loop-tests op echte toestellen getest voordat het in de lijst komt. Op iOS 27 biedt de pagina Modellen ook Apple Intelligence, dat in iOS is ingebouwd. Orvena is een assistent, geen algemene model-runner.

Waar komen de gewichten vandaan, en worden ze gecontroleerd?

Van de mirror van Orvena, met Hugging Face als terugval. Elk bestand wordt gecontroleerd op de vastgelegde grootte en SHA-256-hash voordat het model wordt geactiveerd. De download loopt op de achtergrond, gaat verder na een onderbreking en valt buiten de iCloud-reservekopie.

Wordt mijn data gebruikt om Qwen te trainen?

Nee. Het model draait op je telefoon. Niets wat je typt of zegt, wordt naar Alibaba of naar Orvena gestuurd. Een tool stuurt wat hij nodig heeft naar zijn eigen dienst, bijvoorbeeld een zoekopdracht naar DuckDuckGo, en je gesprek verlaat de telefoon alleen als je zelf kiest voor Private Cloud Compute of een cloudmodel koppelt.

Qwen 3.5 4B, op de telefoon, met je agenda.

Orvena is gratis in de App Store voor iPhone 15 Pro en nieuwer. De download van 3,1 GB gebeurt één keer, en het model draait op de telefoon.

Download in de App Store