Na urządzeniu

Jak uruchomić Qwen 3.5 4B na telefonie iPhone z MLX

ZAKTUALIZOWANO 29 WRZEŚNIA 2026 · 6 MIN CZYTANIA · ORVENA LABS

Jeśli uruchamiasz Qwen na laptopie, tę rodzinę modeli już znasz. Oto konkretna konfiguracja, w której Qwen działa na telefonie iPhone: który wariant, jak jest skwantyzowany, ile pamięci i miejsca potrzebuje, co robi środowisko uruchomieniowe między turami i co model z czterema miliardami parametrów potrafi, a czego nie, gdy podłączysz go do swojego kalendarza.

Orvena jest darmowa na iPhone'a 15 Pro i nowsze modele. Model działa na samym telefonie. Pobierz

Model

Qwen 3.5 4B to jeden z małych modeli Qwen 3.5 od zespołu Qwen z Alibaby (rodzina ma też rozmiary 0.8B, 2B i 9B), opublikowany na początku 2026 roku na licencji Apache 2.0. Ma około czterech miliardów parametrów, enkoder obrazu, dzięki któremu czyta obrazy, domyślnie włączony tryb myślenia, natywny kontekst 262 144 tokenów i jest trenowany do wywoływania narzędzi. Alibaba podaje 201 języków i dialektów. Na telefonie najbardziej liczą się dwie cechy: wywoływanie narzędzi i rozmiar. To mniej więcej największy model, który mieści się z zapasem w 8 GB pamięci.

Orvena pobiera mlx-community/Qwen3.5-4B-4bit, przypięty do jednej rewizji. Pobieranie to dziesięć plików o łącznym rozmiarze 3,06 GB, z czego wagi zajmują 3,03 GB; aplikacja zaokrągla to do "3,1 GB". Druga opcja, "Qwen 3.5 4B Mixed", trzyma część najbardziej wrażliwych warstw (osadzenia, połowę projekcji MLP down i część projekcji value w warstwach uwagi) w ośmiu bitach, a resztę w czterech. Zajmuje 3,57 GB i daje dokładniejsze argumenty wywołań narzędzi, a to właśnie w nich skutki kwantyzacji do czterech bitów widać najwcześniej. Między tymi dwoma wariantami możesz się przełączać na stronie Modele.

Dlaczego cztery bity

Przy szesnastu bitach na wagę cztery miliardy parametrów zajmują około 8 GB, czyli całą pamięć telefonu. Przy czterech bitach wagi mają około 3 GB na dysku i trochę więcej w pamięci, co zostawia miejsce dla iOS, aplikacji i pamięci roboczej, której model potrzebuje podczas odpowiadania. Stąd wymagania sprzętowe: przy pierwszym uruchomieniu Orvena sprawdza fizyczną pamięć telefonu i nie proponuje pobrania, jeśli jest jej mniej niż około 8 GB. Tyle pamięci mają iPhone 15 Pro i 15 Pro Max, każdy iPhone 16, łącznie z 16e, oraz iPhone 17 i 17e. iPhone Air i modele 17 Pro mają 12 GB. Apple wymienia też iPhone'a 18 Pro, 18 Pro Max i iPhone Duo jako zgodne z Apple Intelligence; na każdym telefonie decyduje sprawdzenie pamięci podczas konfiguracji.

Środowisko uruchomieniowe

Wnioskowanie działa przez MLX, framework Apple do obliczeń na tablicach, stworzony dla układów Apple silicon, z użyciem bindingów dla Swifta. Model działa na GPU i korzysta z pamięci zunifikowanej telefonu, więc wagi nie są kopiowane między procesorami. Po załadowaniu wagi zostają w pamięci między turami; ostrzeżenie iOS o małej ilości pamięci czyści pamięci podręczne, ale nie model.

Dwie pamięci podręczne sprawiają, że telefon wydaje się szybszy, niż sugerowałaby jego surowa przepustowość. Gdy model się ładuje, Orvena oblicza stałą część promptu, czyli prompt systemowy i opisy narzędzi, i zachowuje ten stan, więc nowa rozmowa nie musi ponownie przetwarzać tych tokenów. W trakcie rozmowy pamięć podręczna klucz-wartość przechodzi z tury na turę, więc przy każdej odpowiedzi model musi przeczytać tylko Twoją najnowszą wiadomość i wyniki narzędzi, a nie całą historię.

Okno kontekstu na telefonie jest ograniczone do 16 384 tokenów zamiast pełnych 262k modelu. To około 12 000 słów rozmowy, a limit istnieje, bo czytanie długiego promptu jest na telefonie najwolniejszą częścią, a pamięć podręczna długiego kontekstu to właśnie to, co wyczerpuje pamięć. Gdy rozmowa przekroczy okno, Orvena zachowuje najnowsze całe tury i pomija najstarsze, zamiast je streszczać. Jeśli pojedynczy wynik narzędzia jest za duży, żeby się zmieścić, aplikacja pokazuje po angielsku "The latest tool result is too large for this model's context window. Try a narrower request." (wynik narzędzia nie mieści się w oknie kontekstu, spróbuj węższego zapytania).

Próbkowanie odbywa się z temperaturą 1,0 i top-p 0,95 dla całej odpowiedzi, gdy myślenie jest włączone, oraz z temperaturą 0,7 i top-p 0,8, gdy jest wyłączone.

Tryb myślenia

Qwen 3.5 rozumuje przed odpowiedzią, chyba że dostanie polecenie, by tego nie robić. Orvena daje temu rozumowaniu budżet tokenów: 288 tokenów na telefonie z 8 GB i 576 na telefonie z 12 GB, a w trybie niskiego zużycia energii o połowę mniej. Gdy budżet się wyczerpie, aplikacja zmusza model do zakończenia myślenia i rozpoczęcia odpowiedzi, więc trudne pytanie nie może utknąć w nieskończoność. Strona Modele ma dwa ustawienia, Automatycznie i Wyłączone, a w Ustawieniach, w sekcji Zaawansowane, można dodatkowo ustawić własny budżet od 128 do 2 048 tokenów. Myślenie najbardziej pomaga w wieloetapowych zadaniach z narzędziami, na przykład przy alarmie zależnym od czasu dojazdu, i kosztuje kilka sekund; przy krótkim pytaniu o fakty ustawienie Wyłączone jest wyraźnie szybsze.

Wywoływanie narzędzi

Narzędzia są opisywane modelowi jako schematy funkcji w JSON i wstawiane do promptu przez własny szablon czatu modelu, więc model generuje wywołania w formacie, na którym był trenowany. Orvena utrzymuje mały prompt, odsłaniając narzędzia stopniowo: model zaczyna od kilku podstawowych narzędzi i krótkich podsumowań, potem ładuje potrzebną umiejętność, kalendarz, przypomnienia, mapy, zdrowie i tak dalej, i dopiero wtedy widzi pełne schematy. Jedno zapytanie może zająć do 32 rund modelu. Każde wywołanie jest sprawdzane z zadeklarowanym schematem; wywołanie niezadeklarowanej nazwy albo z błędnymi argumentami wraca do modelu jako błąd, który model może przeczytać i poprawić, zamiast zostać po cichu odrzucone.

Obliczenia, od których coś zależy, wykonują narzędzia, a nie model. Gdy prosisz o alarm, dzięki któremu dotrzesz gdzieś na czas, narzędzie do czasu dojazdu wylicza godzinę wyjścia, a model tylko ją podaje.

Szybkość

Nie ma jeszcze opublikowanego benchmarku Orveny. Tekst pojawia się na bieżąco, w miarę generowania, a pierwsze słowa krótkiej odpowiedzi widać w ciągu sekundy lub dwóch. Zauważysz za to, że w długiej rozmowie odpowiedź zaczyna się później, bo czytanie promptu to na telefonie najdroższa część, a myślenie dodaje widoczną pauzę.

Języki i obrazy

Model odpowiada w tym języku, w którym piszesz. Aby działało to niezawodnie także przy krótkich wiadomościach, Orvena rozpoznaje język każdej wiadomości za pomocą działającego na urządzeniu mechanizmu rozpoznawania języka od Apple i dołącza notatkę, która go podaje; notatka jest usuwana ze wszystkiego, co model odpisze, więc nigdy jej nie widzisz. Załączone zdjęcia przechodzą przez enkoder obrazu na telefonie.

W porównaniu z uruchamianiem Qwen na Macu

Na Macu możesz wybrać większe rozmiary Qwen 3.5, a to mocniejsze modele. Na telefonie praktycznym sufitem jest dziś 4B. Telefon dodaje za to wszystko, co wokół modelu: Twój kalendarz, przypomnienia, alarmy, zdjęcia, podsumowania zdrowia, mapy i zapis każdego działania modelu, który możesz przeczytać i cofnąć. Jeśli chcesz korzystać z większego modelu z poziomu telefonu, Premium dodaje Private Cloud Compute firmy Apple w iOS 27, bez konfigurowania klucza, albo dowolny model z OpenRouter z Twoim własnym kluczem, a Orvena prosi o zgodę, zanim jakakolwiek rozmowa opuści urządzenie.

Częste pytania

Który wariant Qwen pobiera Orvena?

Domyślnie mlx-community/Qwen3.5-4B-4bit w przypiętej rewizji, 3,06 GB w dziesięciu plikach. Mieszany wariant cztero- i ośmiobitowy, 3,57 GB, jest dostępny na stronie Modele i daje dokładniejsze wywołania narzędzi.

Czy mogę wczytać własny model GGUF lub MLX?

Nie. Katalog pobierania ma dwie pozycje, a każda przed dodaniem do listy przechodzi testy pętli narzędzi na fizycznych urządzeniach. W iOS 27 strona Modele oferuje też Apple Intelligence, wbudowaną w iOS. Orvena to asystent, a nie uniwersalne narzędzie do uruchamiania modeli.

Skąd pochodzą wagi i czy są weryfikowane?

Z serwera lustrzanego, który utrzymuje Orvena, a zapasowo z Hugging Face. Przed aktywacją modelu każdy plik jest sprawdzany pod kątem przypiętego rozmiaru i sumy kontrolnej SHA-256. Pobieranie działa w tle, wznawia się po przerwaniu i jest wyłączone z kopii zapasowej iCloud.

Czy moje dane są używane do trenowania Qwen?

Nie. Model działa na Twoim telefonie. Nic, co wpisujesz lub mówisz, nie jest wysyłane do Alibaby ani do Orvena Labs. Narzędzie wysyła to, czego potrzebuje, do własnej usługi, na przykład zapytanie wyszukiwania do DuckDuckGo, a Twoja rozmowa opuszcza telefon tylko wtedy, gdy wybierzesz Private Cloud Compute albo sam podłączysz model w chmurze.

Qwen 3.5 4B na telefonie, z Twoim kalendarzem.

Orvena jest darmowa w App Store na iPhone'a 15 Pro i nowsze modele. Pobieranie 3,1 GB odbywa się raz, a model działa na telefonie.

Pobierz w App Store