Så körs Qwen 3.5 4B på en iPhone med MLX
Kör du Qwen på en bärbar dator känner du redan till modellfamiljen. Det här är den konkreta uppsättningen för att köra Qwen på en iPhone: vilken variant, hur den är kvantiserad, hur mycket minne och lagring den behöver, vad körmiljön gör mellan turerna och vad en modell med fyra miljarder parametrar kan och inte kan göra när den är kopplad till din kalender.
Modellen
Qwen 3.5 4B är en av de små Qwen 3.5-modellerna från Alibabas Qwen-team (familjen har också storlekarna 0.8B, 2B och 9B), publicerad i början av 2026 under licensen Apache 2.0. Den har cirka fyra miljarder parametrar, en bildkodare så att den kan läsa bilder, ett tänkandeläge som är på som standard, en inbyggd kontext på 262 144 token och träning för verktygsanrop. Alibaba anger 201 språk och dialekter. På en telefon är det två egenskaper som betyder mest: verktygsanropen och storleken. Det här är ungefär den största modell som får plats med marginal i 8 GB minne.
Orvena hämtar mlx-community/Qwen3.5-4B-4bit, låst till en enda revision. Hämtningen består av tio filer på totalt 3,06 GB, varav vikterna är 3,03 GB; appen avrundar det till "3,1 GB". Ett andra alternativ, "Qwen 3.5 4B Mixed", behåller några av de känsligaste lagren (inbäddningarna, hälften av nedprojektionerna i MLP-lagren och en del av värdeprojektionerna i attention-lagren) i åtta bitar och resten i fyra. Den är 3,57 GB och ger mer exakta argument i verktygsanrop, vilket är där kvantisering till fyra bitar märks först. Du kan växla mellan de två på sidan Modeller.
Varför fyra bitar
Med sexton bitar per vikt blir fyra miljarder parametrar cirka 8 GB, vilket är hela telefonens minne. Med fyra bitar tar vikterna cirka 3 GB på disken och lite mer i minnet, vilket lämnar plats för iOS, appen och det arbetsminne modellen behöver medan den svarar. Det är skälet till hårdvarukravet: Orvena kontrollerar telefonens fysiska minne vid första starten och erbjuder inte hämtningen under ungefär 8 GB. De telefoner som har det är iPhone 15 Pro och 15 Pro Max, alla iPhone 16 inklusive 16e, samt iPhone 17 och 17e. iPhone Air och 17 Pro-modellerna har 12 GB. Apple listar också iPhone 18 Pro, 18 Pro Max och iPhone Duo för Apple Intelligence; på vilken telefon det än gäller är det minneskontrollen under konfigurationen som avgör.
Körmiljön
Inferensen körs via MLX, Apples ramverk för arrayberäkningar på företagets egna chip, med Swift-bindningarna. Modellen körs på grafikprocessorn med telefonens enhetliga minne, så vikterna behöver inte kopieras mellan processorer. När vikterna väl är inlästa ligger de kvar i minnet mellan turerna; en minnesvarning från iOS tömmer cacharna men inte modellen.
Två cachar gör att telefonen känns snabbare än den råa genomströmningen skulle ge sken av. När modellen läses in beräknar Orvena den fasta delen av prompten, systemprompten och verktygsbeskrivningarna, och sparar det tillståndet, så att en ny konversation inte behöver bearbeta de token på nytt. Inom en konversation förs key-value-cachen vidare från tur till tur, så varje svar behöver bara läsa ditt senaste meddelande och verktygsresultaten, inte hela historiken.
Kontextfönstret är begränsat till 16 384 token på telefonen, i stället för modellens fulla 262k. Det motsvarar cirka 12 000 ord konversation, och gränsen finns eftersom det är läsningen av en lång prompt som går långsamt på en telefon, och cachen för en lång kontext är det som får minnet att ta slut. När en konversation växer förbi fönstret behåller Orvena de senaste turerna i sin helhet och utelämnar de äldsta i stället för att sammanfatta dem. Om ett enskilt verktygsresultat är för stort för att få plats visar appen "The latest tool result is too large for this model's context window. Try a narrower request." (det senaste verktygsresultatet är för stort för modellens kontextfönster; prova en snävare förfrågan).
Samplingen använder temperatur 1,0 med top-p 0,95 för hela svaret när tänkandet är på, och temperatur 0,7 med top-p 0,8 när det är av.
Tänkandeläge
Qwen 3.5 resonerar innan den svarar, om den inte uppmanas att låta bli. Orvena ger det resonemanget en budget i token: 288 token på en telefon med 8 GB och 576 på en med 12 GB, hälften så mycket i strömsparläge. När budgeten tar slut tvingar appen modellen att avsluta sitt tänkande och börja på svaret, så att en svår fråga inte kan fastna på obestämd tid. Sidan Modeller har två inställningar, Automatisk och Av, och under Inställningar, Avancerat, finns dessutom en anpassad budget mellan 128 och 2 048 token. Tänkandet hjälper mest vid verktygsuppgifter i flera steg, till exempel ett alarm som beror på restiden, och kostar några sekunder; för en snabb faktafråga är Av märkbart snabbare.
Verktygsanrop
Verktygen beskrivs för modellen som JSON-funktionsscheman och återges i prompten av modellens egen chattmall, så att modellen skriver anrop i det format den tränats på. Orvena håller prompten liten genom att visa verktygen stegvis: modellen börjar med några kärnverktyg och korta sammanfattningar, läser sedan in den färdighet den behöver (kalender, påminnelser, kartor, hälsa och så vidare) och ser först då de fullständiga schemana. En förfrågan kan ta upp till 32 modellrundor. Varje anrop kontrolleras mot det deklarerade schemat; ett anrop till ett odeklarerat namn eller med felaktiga argument skickas tillbaka till modellen som ett fel den kan läsa och rätta, i stället för att tyst kastas bort.
Beräkningar som spelar roll görs av verktyg i stället för av modellen. När du ber om ett alarm som ska få dig någonstans i tid räknar resverktyget ut när du måste ge dig av, och modellen rapporterar bara tiden.
Hastighet
Det finns ännu inget publicerat prestandatest för Orvena. Texten strömmas medan den skrivs, och de första orden i ett kort svar dyker upp inom en sekund eller två. Det du märker är att en lång konversation tar längre tid innan svaret börjar, eftersom läsningen av prompten är den dyra delen på en telefon, och att tänkandet ger en synlig paus.
Språk och bilder
Modellen svarar på det språk du skriver på. För att det ska fungera pålitligt även för korta meddelanden avgör Orvena språket i varje meddelande med Apples språkigenkänning på enheten och lägger vid körning till en anteckning som anger språket; anteckningen tas bort ur allt modellen skriver tillbaka, så du ser den aldrig. Bifogade bilder går genom bildkodaren på telefonen.
Jämfört med att köra Qwen på en Mac
På en Mac kan du välja de större Qwen 3.5-storlekarna, och de är starkare modeller. På en telefon är 4B det praktiska taket i dag. Det telefonen tillför är allt runt modellen: din kalender, påminnelser, alarm, bilder, hälsosammanfattningar, kartor och en logg över varje åtgärd modellen utför, som du kan läsa och ångra. Vill du ha en större modell från telefonen lägger Premium till Apples Private Cloud Compute i iOS 27, utan nyckel att ställa in, eller valfri OpenRouter-modell med din egen nyckel, och Orvena ber om samtycke innan någon konversation lämnar enheten.
Vanliga frågor
Vilken Qwen-variant hämtar Orvena?
Som standard mlx-community/Qwen3.5-4B-4bit i en låst revision, 3,06 GB fördelat på tio filer. En blandad variant med fyra och åtta bitar, 3,57 GB, finns på sidan Modeller för mer exakta verktygsanrop.
Kan jag läsa in en egen GGUF- eller MLX-modell?
Nej. Hämtningskatalogen har två poster, och var och en testas med tester av verktygsloopen på fysiska enheter innan den listas. I iOS 27 erbjuder sidan Modeller också Apple Intelligence, som är inbyggt i iOS. Orvena är en assistent, inte ett allmänt verktyg för att köra modeller.
Var kommer vikterna ifrån, och kontrolleras de?
Från Orvenas spegelserver, med Hugging Face som reserv. Varje fil kontrolleras mot den låsta storleken och SHA-256-hashen innan modellen aktiveras. Hämtningen sker i bakgrunden, återupptas om den avbryts och undantas från säkerhetskopiering till iCloud.
Används mina data för att träna Qwen?
Nej. Modellen körs på din telefon. Inget du skriver eller säger skickas till Alibaba eller till Orvena. Ett verktyg skickar det som behövs till sin egen tjänst, till exempel en sökfråga till DuckDuckGo, och din konversation lämnar telefonen bara om du väljer Private Cloud Compute eller själv ansluter en molnmodell.
Orvena är gratis i App Store för iPhone 15 Pro och senare. Hämtningen på 3,1 GB görs en gång, och modellen körs på telefonen.
Hämta i App Store