Στη συσκευή

Εκτέλεση του Qwen 3.5 4B σε iPhone με MLX

ΕΝΗΜΕΡΏΘΗΚΕ ΣΤΙΣ 29 ΣΕΠΤΕΜΒΡΊΟΥ 2026 · 6 ΛΕΠΤΆ ΑΝΆΓΝΩΣΗΣ · ORVENA LABS

Αν τρέχετε το Qwen σε laptop, ξέρετε ήδη την οικογένεια. Αυτή είναι η συγκεκριμένη ρύθμιση που τρέχει το Qwen σε iPhone: ποια παραλλαγή, πώς είναι κβαντισμένη, πόση μνήμη και πόσο χώρο αποθήκευσης χρειάζεται, τι κάνει το runtime ανάμεσα στους γύρους της συνομιλίας, και τι μπορεί και τι δεν μπορεί να κάνει ένα μοντέλο τεσσάρων δισεκατομμυρίων παραμέτρων όταν συνδεθεί με το ημερολόγιό σας.

Το Orvena είναι δωρεάν για iPhone 15 Pro και νεότερα. Το μοντέλο εκτελείται στο ίδιο το τηλέφωνο. Λήψη

Το μοντέλο

Το Qwen 3.5 4B είναι ένα από τα μικρά μοντέλα Qwen 3.5 της ομάδας Qwen της Alibaba (η οικογένεια έχει επίσης μεγέθη 0.8B, 2B και 9B) και δημοσιεύτηκε στις αρχές του 2026 με άδεια Apache 2.0. Έχει περίπου τέσσερα δισεκατομμύρια παραμέτρους, κωδικοποιητή όρασης ώστε να διαβάζει εικόνες, λειτουργία σκέψης ενεργή από προεπιλογή, εγγενές παράθυρο συμφραζομένων 262.144 tokens και εκπαίδευση για κλήση εργαλείων. Η Alibaba αναφέρει 201 γλώσσες και διαλέκτους. Σε ένα τηλέφωνο, οι δύο ιδιότητες που μετράνε περισσότερο είναι η κλήση εργαλείων και το μέγεθος: πρόκειται περίπου για το μεγαλύτερο μοντέλο που τρέχει με άνεση σε 8 GB μνήμης.

Το Orvena κατεβάζει το mlx-community/Qwen3.5-4B-4bit, κλειδωμένο σε μία συγκεκριμένη αναθεώρηση. Η λήψη είναι δέκα αρχεία, συνολικά 3,06 GB, από τα οποία τα βάρη είναι 3,03 GB· η εφαρμογή το στρογγυλοποιεί σε "3,1 GB". Μια δεύτερη επιλογή, το "Qwen 3.5 4B Mixed", κρατά μερικά από τα πιο ευαίσθητα επίπεδα (τα embeddings, τις μισές προβολές down του MLP και ορισμένες προβολές value της προσοχής) στα οκτώ bit και τα υπόλοιπα στα τέσσερα. Είναι 3,57 GB και δίνει πιο ακριβή ορίσματα στις κλήσεις εργαλείων, εκεί δηλαδή όπου φαίνεται πρώτα η κβάντιση στα τέσσερα bit. Μπορείτε να αλλάζετε μεταξύ των δύο στη σελίδα Μοντέλα.

Γιατί τέσσερα bit

Στα δεκαέξι bit ανά βάρος, τέσσερα δισεκατομμύρια παράμετροι είναι περίπου 8 GB, δηλαδή ολόκληρη η μνήμη του τηλεφώνου. Στα τέσσερα bit τα βάρη είναι περίπου 3 GB στον δίσκο και λίγο περισσότερα στη μνήμη, αφήνοντας χώρο για το iOS, την εφαρμογή και τη μνήμη εργασίας που χρειάζεται το μοντέλο όσο απαντά. Αυτός είναι ο λόγος της απαίτησης υλικού: το Orvena ελέγχει τη φυσική μνήμη του τηλεφώνου στην πρώτη εκκίνηση και δεν προσφέρει τη λήψη κάτω από περίπου 8 GB. Τα τηλέφωνα που τα διαθέτουν είναι τα iPhone 15 Pro και 15 Pro Max, όλα τα iPhone 16, μαζί με το 16e, και τα iPhone 17 και 17e. Το iPhone Air και τα μοντέλα 17 Pro έχουν 12 GB. Η Apple αναφέρει επίσης τα iPhone 18 Pro, 18 Pro Max και iPhone Duo για το Apple Intelligence· σε κάθε τηλέφωνο, αποφασίζει ο έλεγχος μνήμης κατά την αρχική ρύθμιση.

Το runtime

Η εκτέλεση γίνεται μέσω του MLX, του framework πινάκων της Apple για το δικό της silicon, με τα bindings για Swift. Το μοντέλο τρέχει στη GPU με την ενοποιημένη μνήμη του τηλεφώνου, οπότε δεν γίνεται αντιγραφή βαρών μεταξύ επεξεργαστών. Μόλις φορτωθούν, τα βάρη μένουν στη μνήμη ανάμεσα στους γύρους· μια προειδοποίηση μνήμης από το iOS αδειάζει τις cache αλλά όχι το μοντέλο.

Δύο cache κάνουν το τηλέφωνο να φαίνεται πιο γρήγορο απ' ό,τι θα έδειχνε η καθαρή του απόδοση. Όταν φορτώνεται το μοντέλο, το Orvena υπολογίζει το σταθερό μέρος του prompt, δηλαδή το system prompt και τις περιγραφές των εργαλείων, και κρατά αυτή την κατάσταση, ώστε μια νέα συνομιλία να μην πληρώνει ξανά αυτά τα tokens. Μέσα σε μια συνομιλία, η cache κλειδιών-τιμών (key-value cache) μεταφέρεται από γύρο σε γύρο, ώστε κάθε απάντηση να χρειάζεται να διαβάσει μόνο το τελευταίο σας μήνυμα και τα αποτελέσματα των εργαλείων, όχι ολόκληρο το ιστορικό.

Το παράθυρο συμφραζομένων περιορίζεται στο τηλέφωνο στα 16.384 tokens, αντί για τα πλήρη 262k του μοντέλου. Αυτό αντιστοιχεί σε περίπου 12.000 λέξεις συνομιλίας, και το όριο υπάρχει επειδή η ανάγνωση ενός μεγάλου prompt είναι το αργό κομμάτι σε ένα τηλέφωνο και η cache για μεγάλα συμφραζόμενα είναι αυτή που εξαντλεί τη μνήμη. Όταν μια συνομιλία ξεπεράσει το παράθυρο, το Orvena κρατά τους πιο πρόσφατους ολόκληρους γύρους και αφήνει έξω τους παλαιότερους αντί να τους συνοψίσει. Αν ένα μεμονωμένο αποτέλεσμα εργαλείου είναι πολύ μεγάλο για να χωρέσει, εμφανίζει "The latest tool result is too large for this model's context window. Try a narrower request." (το τελευταίο αποτέλεσμα εργαλείου δεν χωρά στο παράθυρο συμφραζομένων του μοντέλου, δοκιμάστε ένα πιο περιορισμένο αίτημα).

Η δειγματοληψία γίνεται με θερμοκρασία 1,0 και top-p 0,95 για όλη την απάντηση όταν η σκέψη είναι ενεργή, και με θερμοκρασία 0,7 και top-p 0,8 όταν είναι ανενεργή.

Λειτουργία σκέψης

Το Qwen 3.5 συλλογίζεται πριν απαντήσει, εκτός αν του ζητηθεί να μην το κάνει. Το Orvena δίνει σε αυτόν τον συλλογισμό ένα όριο tokens: 288 tokens σε τηλέφωνο με 8 GB και 576 σε τηλέφωνο με 12 GB, και το μισό στη Λειτουργία χαμηλής ισχύος. Όταν εξαντληθεί το όριο, η εφαρμογή αναγκάζει το μοντέλο να κλείσει τη σκέψη του και να ξεκινήσει την απάντηση, ώστε μια δύσκολη ερώτηση να μην μπορεί να κολλήσει επ' αόριστον. Η σελίδα Μοντέλα έχει δύο ρυθμίσεις, "Αυτόματο" και "Ανενεργό", και οι Ρυθμίσεις, στα Προηγμένα, προσθέτουν ένα προσαρμοσμένο όριο από 128 έως 2.048 tokens. Η σκέψη βοηθά περισσότερο σε εργασίες πολλών βημάτων με εργαλεία, για παράδειγμα σε ένα ξυπνητήρι που εξαρτάται από τον χρόνο διαδρομής, και κοστίζει λίγα δευτερόλεπτα· για μια γρήγορη ερώτηση γνώσεων, το "Ανενεργό" είναι αισθητά ταχύτερο.

Κλήση εργαλείων

Τα εργαλεία περιγράφονται στο μοντέλο ως σχήματα συναρτήσεων JSON και μπαίνουν στο prompt μέσω του ίδιου του προτύπου συνομιλίας του μοντέλου, ώστε το μοντέλο να παράγει κλήσεις στη μορφή με την οποία εκπαιδεύτηκε. Το Orvena κρατά το prompt μικρό αποκαλύπτοντας τα εργαλεία σταδιακά: το μοντέλο ξεκινά με λίγα βασικά εργαλεία και σύντομες περιλήψεις, μετά φορτώνει τη δεξιότητα που χρειάζεται, ημερολόγιο, υπομνήσεις, χάρτες, υγεία και ούτω καθεξής, και μόνο τότε βλέπει τα πλήρη σχήματα. Ένα αίτημα μπορεί να πάρει έως 32 γύρους του μοντέλου. Κάθε κλήση ελέγχεται με βάση το δηλωμένο σχήμα· μια κλήση σε όνομα που δεν έχει δηλωθεί ή με λανθασμένα ορίσματα επιστρέφεται στο μοντέλο ως σφάλμα που μπορεί να διαβάσει και να διορθώσει, αντί να απορρίπτεται σιωπηλά.

Οι υπολογισμοί που έχουν σημασία γίνονται από εργαλεία και όχι από το μοντέλο. Όταν ζητάτε ένα ξυπνητήρι ώστε να φτάσετε κάπου στην ώρα σας, το εργαλείο διαδρομής υπολογίζει την ώρα αναχώρησης και το μοντέλο απλώς την αναφέρει.

Ταχύτητα

Δεν υπάρχει ακόμη δημοσιευμένο benchmark για το Orvena. Το κείμενο εμφανίζεται καθώς γράφεται, και οι πρώτες λέξεις μιας σύντομης απάντησης εμφανίζονται μέσα σε ένα ή δύο δευτερόλεπτα. Αυτό που θα προσέξετε είναι ότι σε μια μεγάλη συνομιλία περνά περισσότερος χρόνος πριν ξεκινήσει η απάντηση, επειδή η ανάγνωση του prompt είναι το ακριβό κομμάτι σε ένα τηλέφωνο, και ότι η σκέψη προσθέτει μια ορατή παύση.

Γλώσσες και εικόνες

Το μοντέλο απαντά σε όποια γλώσσα γράφετε. Για να είναι αυτό αξιόπιστο και στα σύντομα μηνύματα, το Orvena εντοπίζει τη γλώσσα κάθε μηνύματος με τον αναγνωριστή γλώσσας της Apple στη συσκευή και προσθέτει μια σημείωση εκτέλεσης που τη δηλώνει· η σημείωση αφαιρείται από οτιδήποτε γράφει το μοντέλο στην απάντησή του, οπότε δεν τη βλέπετε ποτέ. Οι φωτογραφίες που επισυνάπτετε περνούν από τον κωδικοποιητή όρασης στο τηλέφωνο.

Σε σύγκριση με το Qwen σε Mac

Σε Mac μπορείτε να επιλέξετε τα μεγαλύτερα μεγέθη του Qwen 3.5, και είναι ισχυρότερα μοντέλα. Σε τηλέφωνο, το 4B είναι σήμερα το πρακτικό ανώτατο όριο. Αυτό που προσθέτει το τηλέφωνο είναι όλα όσα βρίσκονται γύρω από το μοντέλο: το ημερολόγιό σας, οι υπομνήσεις, τα ξυπνητήρια, οι φωτογραφίες, οι περιλήψεις υγείας, οι χάρτες, και ένα αρχείο κάθε ενέργειας του μοντέλου που μπορείτε να διαβάσετε και να αναιρέσετε. Αν θέλετε μεγαλύτερο μοντέλο από το τηλέφωνό σας, το Premium προσθέτει το Private Cloud Compute της Apple στο iOS 27, χωρίς κλειδί για ρύθμιση, ή οποιοδήποτε μοντέλο του OpenRouter με το δικό σας κλειδί, και το Orvena ζητά συγκατάθεση πριν οποιαδήποτε συνομιλία φύγει από τη συσκευή.

Συχνές ερωτήσεις

Ποια παραλλαγή του Qwen κατεβάζει το Orvena;

Από προεπιλογή το mlx-community/Qwen3.5-4B-4bit σε κλειδωμένη αναθεώρηση, 3,06 GB σε δέκα αρχεία. Μια μικτή παραλλαγή τεσσάρων και οκτώ bit, 3,57 GB, είναι διαθέσιμη στη σελίδα Μοντέλα για πιο ακριβείς κλήσεις εργαλείων.

Μπορώ να φορτώσω δικό μου μοντέλο GGUF ή MLX;

Όχι. Ο κατάλογος λήψεων έχει δύο καταχωρίσεις, και καθεμία περνά από δοκιμές βρόχου εργαλείων σε πραγματικές συσκευές πριν μπει στη λίστα. Στο iOS 27 η σελίδα Μοντέλα προσφέρει επίσης το Apple Intelligence, που είναι ενσωματωμένο στο iOS. Το Orvena είναι βοηθός, όχι γενικό πρόγραμμα εκτέλεσης μοντέλων.

Από πού προέρχονται τα βάρη και επαληθεύονται;

Από τον διακομιστή-καθρέφτη (mirror) του Orvena, με το Hugging Face ως εναλλακτική. Κάθε αρχείο ελέγχεται με βάση το κλειδωμένο μέγεθος και το hash SHA-256 πριν ενεργοποιηθεί το μοντέλο. Η λήψη γίνεται στο παρασκήνιο, συνεχίζεται αν διακοπεί και εξαιρείται από το αντίγραφο ασφαλείας iCloud.

Χρησιμοποιούνται τα δεδομένα μου για την εκπαίδευση του Qwen;

Όχι. Το μοντέλο εκτελείται στο τηλέφωνό σας. Τίποτα από όσα πληκτρολογείτε ή λέτε δεν αποστέλλεται στην Alibaba ή στο Orvena. Ένα εργαλείο στέλνει ό,τι χρειάζεται στη δική του υπηρεσία, για παράδειγμα ένα ερώτημα αναζήτησης στο DuckDuckGo, και η συνομιλία σας φεύγει από το τηλέφωνο μόνο αν επιλέξετε το Private Cloud Compute ή αν συνδέσετε εσείς ένα μοντέλο cloud.

Qwen 3.5 4B, στο τηλέφωνο, με το ημερολόγιό σας.

Το Orvena είναι δωρεάν στο App Store για iPhone 15 Pro και νεότερα. Η λήψη των 3,1 GB γίνεται μία φορά και το μοντέλο εκτελείται στο τηλέφωνο.

Λήψη από το App Store