Sådan kører du Qwen 3.5 4B på en iPhone med MLX
Hvis du kører Qwen på en bærbar, kender du allerede modelfamilien. Her er den konkrete opsætning, der kører Qwen på en iPhone: hvilken variant, hvordan den er kvantiseret, hvor meget hukommelse og lagerplads den kræver, hvad runtimen gør mellem to svar, og hvad en model med fire milliarder parametre kan og ikke kan, når den er koblet til din kalender.
Modellen
Qwen 3.5 4B er en af de små Qwen 3.5-modeller fra Alibabas Qwen-team (familien findes også i størrelserne 0,8B, 2B og 9B), udgivet i starten af 2026 under Apache 2.0-licensen. Den har omkring fire milliarder parametre, en vision-encoder, så den kan læse billeder, en tænketilstand, der er slået til som standard, en indbygget kontekst på 262.144 tokens og træning i værktøjskald. Alibaba angiver 201 sprog og dialekter. På en telefon er de to vigtigste egenskaber værktøjskaldene og størrelsen: det er omtrent den største model, der kører med god margin i 8 GB hukommelse.
Orvena henter mlx-community/Qwen3.5-4B-4bit, låst til én bestemt revision. Overførslen består af ti filer på i alt 3,06 GB, hvoraf vægtene udgør 3,03 GB; appen runder det til "3,1 GB". En anden mulighed, "Qwen 3.5 4B Mixed", holder nogle af de mest følsomme lag (embeddings, halvdelen af MLP-lagenes down-projektioner og nogle af attention-lagenes value-projektioner) i otte bit og resten i fire. Den fylder 3,57 GB og giver mere præcise argumenter i værktøjskald, og det er dér, kvantisering til fire bit først kan mærkes. Du kan skifte mellem de to på siden Modeller.
Hvorfor fire bit
Med seksten bit pr. vægt fylder fire milliarder parametre omkring 8 GB, hvilket er hele telefonens hukommelse. Med fire bit fylder vægtene omkring 3 GB på disken og lidt mere i hukommelsen, så der er plads til iOS, appen og den arbejdshukommelse, modellen har brug for, mens den svarer. Det er grunden til hardwarekravet: Orvena tjekker telefonens fysiske hukommelse ved første opstart og tilbyder ikke overførslen under cirka 8 GB. De telefoner, der har det, er iPhone 15 Pro og 15 Pro Max, alle iPhone 16-modeller inklusive 16e samt iPhone 17 og 17e. iPhone Air og 17 Pro-modellerne har 12 GB. Apple angiver også iPhone 18 Pro, 18 Pro Max og iPhone Duo til Apple Intelligence; på enhver telefon er det hukommelsestjekket under opsætningen, der afgør det.
Runtimen
Inferensen kører gennem MLX, Apples array-framework til virksomhedens egne chips, via Swift-bindingerne. Modellen kører på GPU'en med telefonens fælles hukommelse (unified memory), så vægtene skal ikke kopieres mellem processorer. Når vægtene først er indlæst, bliver de i hukommelsen mellem svarene; en hukommelsesadvarsel fra iOS tømmer cachen, men ikke modellen.
To caches får telefonen til at føles hurtigere, end den rå ydelse skulle tilsige. Når modellen indlæses, beregner Orvena den faste del af prompten, systemprompten og værktøjsbeskrivelserne, og gemmer den tilstand, så en ny samtale ikke skal betale for de tokens igen. Inden for en samtale føres key-value-cachen videre fra svar til svar, så hvert svar kun skal læse din seneste besked og værktøjsresultaterne, ikke hele historikken.
Kontekstvinduet er begrænset til 16.384 tokens på telefonen i stedet for modellens fulde 262k. Det svarer til omkring 12.000 ords samtale, og grænsen findes, fordi det er langsomt at læse en lang prompt på en telefon, og fordi det er cachen til en lang kontekst, der får hukommelsen til at slippe op. Når en samtale vokser ud over vinduet, beholder Orvena de seneste hele udvekslinger og udelader de ældste i stedet for at opsummere dem. Hvis et enkelt værktøjsresultat er for stort til at passe, viser den "The latest tool result is too large for this model's context window. Try a narrower request." (det seneste værktøjsresultat er for stort til modellens kontekstvindue; prøv en mere afgrænset anmodning).
Sampling sker med temperatur 1,0 og top-p 0,95 for hele svaret, når tænkning er slået til, og med temperatur 0,7 og top-p 0,8, når tænkning er slået fra.
Tænketilstand
Qwen 3.5 ræsonnerer, før den svarer, medmindre den får besked på andet. Orvena giver ræsonneringen et tokenbudget: 288 tokens på en telefon med 8 GB og 576 på en med 12 GB, halvdelen i Strømsparetilstand. Når budgettet er brugt, tvinger appen modellen til at afslutte sin tænkning og begynde på svaret, så et svært spørgsmål ikke kan gå i stå i det uendelige. Siden Modeller har to indstillinger, Automatisk og Fra, og Indstillinger, Avanceret, tilføjer et tilpasset budget mellem 128 og 2.048 tokens. Tænkning hjælper mest på værktøjsopgaver i flere trin, f.eks. en alarm, der afhænger af rejsetiden, og koster et par sekunder; til et hurtigt faktaspørgsmål er Fra mærkbart hurtigere.
Værktøjskald
Værktøjerne beskrives for modellen som JSON-funktionsskemaer og sættes ind i prompten via modellens egen chatskabelon, så modellen udsender kald i det format, den er trænet på. Orvena holder prompten lille ved at vise værktøjerne gradvist: modellen starter med nogle få kerneværktøjer og korte resuméer, indlæser så den færdighed (skill), den har brug for (kalender, påmindelser, kort, sundhed og så videre), og ser først derefter de fulde skemaer. En anmodning kan bruge op til 32 modelrunder. Hvert kald kontrolleres mod det erklærede skema; et kald til et navn, der ikke er erklæret, eller med fejlformede argumenter sendes tilbage til modellen som en fejl, den kan læse og rette, i stedet for at blive droppet i stilhed.
Regnestykker, der betyder noget, klares af værktøjer og ikke af modellen. Når du beder om en alarm, der får dig frem til tiden, beregner rejseværktøjet, hvornår du skal af sted, og modellen gengiver det bare.
Hastighed
Der er endnu ikke offentliggjort nogen benchmark for Orvena. Teksten streames, mens den skrives, og de første ord i et kort svar dukker op inden for et sekund eller to. Det, du vil lægge mærke til, er, at der går længere tid, før svaret begynder i en lang samtale, fordi det er læsningen af prompten, der er den dyre del på en telefon, og at tænkning giver en synlig pause.
Sprog og billeder
Modellen svarer på det sprog, du skriver på. For at gøre det pålideligt ved korte beskeder registrerer Orvena sproget i hver besked med Apples sproggenkendelse på enheden og tilføjer en note under kørslen, der angiver det; noten fjernes fra alt, hvad modellen skriver tilbage, så du aldrig ser den. Vedhæftede fotos går gennem vision-encoderen på telefonen.
Sammenlignet med at køre Qwen på en Mac
På en Mac kan du vælge de større Qwen 3.5-størrelser, og de er stærkere modeller. På en telefon er 4B det praktiske loft i dag. Det, telefonen tilføjer, er alt omkring modellen: din kalender, påmindelser, alarmer, fotos, sundhedsoversigter, kort og en oversigt over hver handling, modellen udfører, som du kan læse og fortryde. Vil du bruge en større model fra telefonen, tilføjer Premium Apples Private Cloud Compute på iOS 27, uden nogen nøgle at sætte op, eller en hvilken som helst OpenRouter-model med din egen nøgle, og Orvena beder om samtykke, før en samtale forlader enheden.
Ofte stillede spørgsmål
Hvilken Qwen-variant henter Orvena?
Som standard mlx-community/Qwen3.5-4B-4bit i en fastlåst revision, 3,06 GB fordelt på ti filer. En blandet variant med fire og otte bit på 3,57 GB findes på siden Modeller og giver mere præcise værktøjskald.
Kan jeg indlæse min egen GGUF- eller MLX-model?
Nej. Kataloget over modeller, der kan hentes, har to punkter, og hver model testes med test af værktøjsløkken på fysiske enheder, før den kommer på listen. På iOS 27 tilbyder siden Modeller også Apple Intelligence, som er indbygget i iOS. Orvena er en assistent, ikke et generelt program til at køre modeller.
Hvor kommer vægtene fra, og bliver de verificeret?
Fra Orvenas spejlserver, med Hugging Face som reserve. Hver fil kontrolleres mod den fastlåste størrelse og SHA-256-hash, før modellen aktiveres. Overførslen kører i baggrunden, fortsætter, hvis den bliver afbrudt, og er udeladt af iCloud-sikkerhedskopien.
Bruges mine data til at træne Qwen?
Nej. Modellen kører på din telefon. Intet af det, du skriver eller siger, sendes til Alibaba eller til Orvena. Et værktøj sender det, det har brug for, til sin egen tjeneste, f.eks. en søgning til DuckDuckGo, og din samtale forlader kun telefonen, hvis du vælger Private Cloud Compute eller selv forbinder en cloudmodel.
Orvena er gratis i App Store til iPhone 15 Pro og nyere. Overførslen på 3,1 GB sker én gang, og modellen kører på telefonen.
Hent i App Store