Qwen 3.5 4B mit MLX auf dem iPhone ausführen
Wenn du Qwen auf einem Laptop nutzt, kennst du die Modellfamilie schon. Hier steht das konkrete Setup, mit dem Qwen auf dem iPhone läuft: welche Variante, wie sie quantisiert ist, wie viel Arbeitsspeicher und Speicherplatz sie braucht, was die Laufzeitumgebung zwischen den Runden macht und was ein Modell mit vier Milliarden Parametern kann und was nicht, sobald es mit deinem Kalender verbunden ist.
Das Modell
Qwen 3.5 4B ist eines der kleinen Qwen-3.5-Modelle des Qwen-Teams von Alibaba (die Familie umfasst außerdem die Größen 0,8B, 2B und 9B), veröffentlicht Anfang 2026 unter der Lizenz Apache 2.0. Es hat rund vier Milliarden Parameter, einen Vision-Encoder, mit dem es Bilder lesen kann, einen standardmäßig aktiven Denkmodus, einen nativen Kontext von 262.144 Tokens und ein Training für Werkzeugaufrufe. Alibaba nennt 201 Sprachen und Dialekte. Auf einem Telefon zählen vor allem zwei Eigenschaften, die Werkzeugaufrufe und die Größe: Es ist ungefähr das größte Modell, das mit etwas Luft in 8 GB Arbeitsspeicher läuft.
Orvena lädt mlx-community/Qwen3.5-4B-4bit herunter, festgelegt auf eine einzige Revision. Der Download besteht aus zehn Dateien mit zusammen 3,06 GB, davon 3,03 GB Gewichte; die App rundet das auf "3,1 GB". Eine zweite Option, "Qwen 3.5 4B Mixed", hält einige der empfindlichsten Schichten (die Embeddings, die Hälfte der MLP-Down-Projektionen und einige Value-Projektionen der Attention) bei acht Bit und den Rest bei vier. Sie ist 3,57 GB groß und liefert genauere Argumente bei Werkzeugaufrufen, denn dort zeigt sich die Vier-Bit-Quantisierung zuerst. Auf der Seite "Modelle" kannst du zwischen beiden wechseln.
Warum vier Bit
Bei sechzehn Bit pro Gewicht sind vier Milliarden Parameter etwa 8 GB groß, also der gesamte Arbeitsspeicher des Telefons. Bei vier Bit belegen die Gewichte etwa 3 GB Speicherplatz und etwas mehr im Arbeitsspeicher, sodass Platz für iOS, die App und den Arbeitsspeicher bleibt, den das Modell beim Antworten braucht. Daher kommt die Hardware-Anforderung: Orvena prüft beim ersten Start den physischen Arbeitsspeicher des Telefons und bietet den Download unter etwa 8 GB nicht an. So viel haben das iPhone 15 Pro und 15 Pro Max, jedes iPhone 16 einschließlich des 16e sowie das iPhone 17 und 17e. Das iPhone Air und die 17-Pro-Modelle haben 12 GB. Apple nennt außerdem das iPhone 18 Pro, 18 Pro Max und das iPhone Duo für Apple Intelligence; auf jedem Telefon entscheidet die Speicherprüfung während der Einrichtung.
Die Laufzeitumgebung
Die Inferenz läuft über MLX, Apples Array-Framework für die eigenen Chips, mit den Swift-Bindings. Das Modell läuft auf der GPU mit dem gemeinsamen Arbeitsspeicher (Unified Memory) des Telefons, sodass keine Gewichte zwischen Prozessoren kopiert werden müssen. Einmal geladen, bleiben die Gewichte zwischen den Runden im Arbeitsspeicher; eine Speicherwarnung von iOS leert die Caches, aber nicht das Modell.
Zwei Caches lassen das Telefon schneller wirken, als sein reiner Durchsatz vermuten ließe. Beim Laden des Modells berechnet Orvena den festen Teil des Prompts, also System-Prompt und Werkzeugbeschreibungen, und behält diesen Zustand, sodass eine neue Unterhaltung diese Tokens nicht noch einmal verarbeiten muss. Innerhalb einer Unterhaltung wird der Key-Value-Cache von Runde zu Runde mitgenommen, sodass jede Antwort nur deine letzte Nachricht und die Werkzeugergebnisse lesen muss, nicht den ganzen Verlauf.
Das Kontextfenster ist auf dem Telefon auf 16.384 Tokens begrenzt statt auf die vollen 262k des Modells. Das sind etwa 12.000 Wörter Unterhaltung, und die Grenze gibt es, weil das Lesen eines langen Prompts auf einem Telefon der langsame Teil ist und der Cache für einen langen Kontext den Arbeitsspeicher aufbraucht. Wächst eine Unterhaltung über das Fenster hinaus, behält Orvena die jüngsten vollständigen Runden und lässt die ältesten weg, statt sie zusammenzufassen. Passt ein einzelnes Werkzeugergebnis nicht hinein, erscheint "The latest tool result is too large for this model's context window. Try a narrower request." (das letzte Werkzeugergebnis ist zu groß für das Kontextfenster dieses Modells; versuche es mit einer enger gefassten Anfrage).
Beim Sampling gilt mit eingeschaltetem Denken für die ganze Antwort Temperatur 1,0 mit Top-p 0,95, mit ausgeschaltetem Denken Temperatur 0,7 mit Top-p 0,8.
Denkmodus
Qwen 3.5 überlegt, bevor es antwortet, sofern man es nicht anders anweist. Orvena gibt diesem Nachdenken ein Token-Budget: 288 Tokens auf einem Telefon mit 8 GB und 576 auf einem mit 12 GB, im Stromsparmodus jeweils die Hälfte. Ist das Budget aufgebraucht, zwingt die App das Modell, das Nachdenken abzuschließen und mit der Antwort zu beginnen, sodass eine schwere Frage nicht endlos hängen bleiben kann. Die Seite "Modelle" hat zwei Einstellungen, "Automatisch" und "Aus", und unter Einstellungen, "Erweitert", kommt ein eigenes Budget zwischen 128 und 2.048 Tokens hinzu. Denken hilft am meisten bei mehrstufigen Aufgaben mit Werkzeugen, etwa bei einem Wecker, der von der Fahrzeit abhängt, und kostet ein paar Sekunden; bei einer schnellen Faktenfrage ist "Aus" spürbar schneller.
Werkzeugaufrufe (Tool Calling)
Werkzeuge werden dem Modell als JSON-Funktionsschemata beschrieben und vom Chat-Template des Modells selbst in den Prompt eingefügt, sodass das Modell Aufrufe genau in dem Format ausgibt, mit dem es trainiert wurde. Orvena hält den Prompt klein, indem es die Werkzeuge schrittweise offenlegt: Das Modell startet mit einigen Kernwerkzeugen und kurzen Zusammenfassungen, lädt dann den Skill, den es braucht, etwa Kalender, Erinnerungen, Karten oder Health, und sieht erst dann die vollständigen Schemata. Eine Anfrage darf bis zu 32 Modellrunden dauern. Jeder Aufruf wird gegen das deklarierte Schema geprüft; ein Aufruf mit einem nicht deklarierten Namen oder fehlerhaften Argumenten geht als Fehler an das Modell zurück, den es lesen und korrigieren kann, statt stillschweigend verworfen zu werden.
Rechnungen, auf die es ankommt, übernehmen Werkzeuge und nicht das Modell. Wenn du nach einem Wecker fragst, mit dem du rechtzeitig irgendwo bist, berechnet das Fahrzeit-Werkzeug, wann du losmusst, und das Modell meldet es nur.
Geschwindigkeit
Für Orvena gibt es noch keinen veröffentlichten Benchmark. Der Text erscheint, während er geschrieben wird, und die ersten Wörter einer kurzen Antwort sind nach ein, zwei Sekunden da. Auffallen wird dir, dass eine lange Unterhaltung länger braucht, bis die Antwort beginnt, weil das Lesen des Prompts auf einem Telefon der teure Teil ist, und dass Denken eine sichtbare Pause hinzufügt.
Sprachen und Bilder
Das Modell antwortet in der Sprache, in der du schreibst. Damit das auch bei kurzen Nachrichten zuverlässig klappt, erkennt Orvena die Sprache jeder Nachricht mit Apples Spracherkennung für Text auf dem Gerät und hängt einen Laufzeithinweis an, der sie nennt; dieser Hinweis wird aus allem entfernt, was das Modell zurückschreibt, sodass du ihn nie siehst. Angehängte Fotos laufen auf dem Telefon durch den Vision-Encoder.
Im Vergleich zu Qwen auf einem Mac
Auf einem Mac kannst du die größeren Qwen-3.5-Modelle wählen, und das sind stärkere Modelle. Auf einem Telefon ist 4B heute die praktische Obergrenze. Was das Telefon hinzufügt, ist alles rund um das Modell: dein Kalender, Erinnerungen, Wecker, Fotos, Health-Zusammenfassungen, Karten und ein Protokoll jeder Aktion des Modells, das du lesen und rückgängig machen kannst. Wenn du vom Telefon aus ein größeres Modell willst, ergänzt Premium Apples Private Cloud Compute unter iOS 27, ohne einen Schlüssel einrichten zu müssen, oder jedes OpenRouter-Modell mit deinem eigenen Schlüssel, und Orvena fragt nach deiner Zustimmung, bevor eine Unterhaltung das Gerät verlässt.
Häufige Fragen
Welche Qwen-Variante lädt Orvena herunter?
Standardmäßig mlx-community/Qwen3.5-4B-4bit in einer festgelegten Revision, 3,06 GB in zehn Dateien. Eine gemischte Variante mit vier und acht Bit, 3,57 GB, gibt es auf der Seite "Modelle" für genauere Werkzeugaufrufe.
Kann ich mein eigenes GGUF- oder MLX-Modell laden?
Nein. Der Download-Katalog hat zwei Einträge, und jeder wird mit Tool-Loop-Tests auf echten Geräten geprüft, bevor er aufgenommen wird. Unter iOS 27 bietet die Seite "Modelle" außerdem Apple Intelligence an, das in iOS integriert ist. Orvena ist ein Assistent, keine allgemeine Laufzeitumgebung für beliebige Modelle.
Woher kommen die Gewichte, und werden sie geprüft?
Von Orvenas eigenem Mirror, mit Hugging Face als Ausweichquelle. Jede Datei wird gegen die festgelegte Größe und den SHA-256-Hash geprüft, bevor das Modell aktiviert wird. Der Download läuft im Hintergrund, wird nach einer Unterbrechung fortgesetzt und ist vom iCloud-Backup ausgeschlossen.
Werden meine Daten zum Training von Qwen verwendet?
Nein. Das Modell läuft auf deinem Telefon. Nichts, was du tippst oder sagst, wird an Alibaba oder an Orvena gesendet. Ein Werkzeug sendet an seinen eigenen Dienst, was es braucht, zum Beispiel eine Suchanfrage an DuckDuckGo, und deine Unterhaltung verlässt das Telefon nur, wenn du Private Cloud Compute wählst oder selbst ein Cloud-Modell verbindest.
Orvena ist kostenlos im App Store für iPhone 15 Pro und neuer. Der Download von 3,1 GB passiert einmal, danach läuft alles auf dem Telefon.
Im App Store laden