Menjalankan Qwen 3.5 4B di iPhone dengan MLX
Jika Anda sudah menjalankan Qwen di laptop, Anda tentu mengenal keluarga model ini. Inilah pengaturan konkret untuk menjalankan Qwen di iPhone: varian yang dipakai, cara kuantisasinya, berapa memori dan penyimpanan yang dibutuhkan, apa yang dilakukan runtime di antara giliran, serta apa yang bisa dan tidak bisa dilakukan model empat miliar parameter setelah terhubung ke kalender Anda.
Modelnya
Qwen 3.5 4B adalah salah satu model Qwen 3.5 berukuran kecil dari tim Qwen milik Alibaba (keluarga ini juga punya ukuran 0,8B, 2B, dan 9B), yang dirilis pada awal 2026 dengan lisensi Apache 2.0. Model ini memiliki sekitar empat miliar parameter, encoder visi sehingga bisa membaca gambar, mode berpikir yang aktif secara default, konteks bawaan 262.144 token, serta pelatihan untuk pemanggilan alat. Alibaba mencantumkan 201 bahasa dan dialek. Di ponsel, dua sifat yang paling penting adalah pemanggilan alat dan ukurannya: ini kira-kira model terbesar yang masih bisa berjalan dengan leluasa di memori 8 GB.
Orvena mengunduh mlx-community/Qwen3.5-4B-4bit, yang dikunci pada satu revisi. Unduhannya terdiri dari sepuluh file dengan total 3,06 GB, dan bobotnya sendiri 3,03 GB; aplikasi membulatkannya menjadi "3,1 GB". Opsi kedua, "Qwen 3.5 4B Mixed", menyimpan sebagian lapisan yang paling sensitif (embedding, separuh proyeksi down MLP, dan sebagian proyeksi value attention) dalam delapan bit dan sisanya dalam empat bit. Ukurannya 3,57 GB dan menghasilkan argumen pemanggilan alat yang lebih akurat, yaitu bagian yang paling dulu terdampak kuantisasi empat bit. Anda bisa beralih di antara keduanya di layar Model.
Mengapa empat bit
Dengan enam belas bit per bobot, empat miliar parameter berukuran sekitar 8 GB, alias seluruh memori ponsel. Dengan empat bit, bobotnya sekitar 3 GB di penyimpanan dan sedikit lebih besar di memori, sehingga masih ada ruang untuk iOS, aplikasi, dan memori kerja yang dibutuhkan model saat menjawab. Itulah alasan persyaratan perangkat kerasnya: Orvena memeriksa memori fisik ponsel saat pertama kali dibuka dan tidak menawarkan unduhan jika memorinya di bawah sekitar 8 GB. Ponsel yang memenuhinya adalah iPhone 15 Pro dan 15 Pro Max, semua iPhone 16 termasuk 16e, serta iPhone 17 dan 17e. iPhone Air dan model 17 Pro memiliki 12 GB. Apple juga mencantumkan iPhone 18 Pro, 18 Pro Max, dan iPhone Duo untuk Apple Intelligence; di ponsel mana pun, pemeriksaan memori saat penyiapan yang menentukan.
Runtime
Inferensi berjalan melalui MLX, framework array milik Apple untuk silikonnya sendiri, dengan binding Swift. Model berjalan di GPU dengan memori terpadu ponsel, sehingga tidak ada penyalinan bobot antarprosesor. Setelah dimuat, bobot tetap berada di memori di antara giliran; peringatan memori dari iOS mengosongkan cache, tetapi tidak membongkar model.
Dua cache membuat ponsel terasa lebih cepat daripada yang ditunjukkan oleh throughput mentahnya. Saat model dimuat, Orvena menghitung bagian tetap dari prompt, yaitu prompt sistem dan deskripsi alat, lalu menyimpan state tersebut, sehingga percakapan baru tidak perlu membayar token-token itu lagi. Di dalam satu percakapan, cache key-value dibawa dari giliran ke giliran, sehingga setiap balasan hanya perlu membaca pesan terakhir Anda dan hasil alat, bukan seluruh riwayat.
Jendela konteks dibatasi 16.384 token di ponsel, bukan 262k penuh milik model. Itu setara sekitar 12.000 kata percakapan, dan batas ini ada karena membaca prompt yang panjang adalah bagian yang lambat di ponsel, dan cache untuk konteks panjang itulah yang menghabiskan memori. Saat percakapan melampaui jendela, Orvena mempertahankan giliran-giliran terbaru secara utuh dan meninggalkan yang paling lama alih-alih meringkasnya. Jika satu hasil alat terlalu besar untuk dimuat, Orvena menampilkan "The latest tool result is too large for this model's context window. Try a narrower request." (hasil alat terakhir terlalu besar untuk jendela konteks model ini; coba permintaan yang lebih spesifik).
Sampling memakai temperature 1,0 dengan top-p 0,95 untuk seluruh balasan saat mode berpikir aktif, dan temperature 0,7 dengan top-p 0,8 saat mode berpikir nonaktif.
Mode berpikir
Qwen 3.5 bernalar sebelum menjawab, kecuali diminta untuk tidak melakukannya. Orvena memberi penalaran itu anggaran token: 288 token di ponsel 8 GB dan 576 di ponsel 12 GB, dan separuhnya dalam Mode Daya Rendah. Saat anggaran habis, aplikasi memaksa model menutup proses berpikirnya dan mulai menjawab, sehingga pertanyaan yang sulit tidak bisa macet tanpa batas. Layar Model punya dua pengaturan, Otomatis dan Nonaktif, dan Pengaturan, Lanjutan, menambahkan anggaran kustom antara 128 dan 2.048 token. Mode berpikir paling membantu untuk tugas alat yang bertahap, misalnya alarm yang bergantung pada waktu perjalanan, dan memakan waktu beberapa detik; untuk pertanyaan faktual yang singkat, Nonaktif terasa lebih cepat.
Pemanggilan alat
Alat dideskripsikan kepada model sebagai skema fungsi JSON dan dimasukkan ke prompt oleh templat obrolan milik model itu sendiri, sehingga model mengeluarkan panggilan dalam format yang dipelajarinya saat pelatihan. Orvena menjaga prompt tetap kecil dengan membuka alat secara bertahap: model memulai dengan beberapa alat inti dan ringkasan singkat, lalu memuat skill yang dibutuhkannya, seperti kalender, pengingat, peta, kesehatan, dan seterusnya, dan baru setelah itu melihat skema lengkapnya. Satu permintaan bisa memakan hingga 32 putaran model. Setiap panggilan diperiksa terhadap skema yang dideklarasikan; panggilan ke nama yang tidak dideklarasikan atau dengan argumen yang salah format dikembalikan ke model sebagai error yang bisa dibaca dan diperbaikinya, bukan dibuang diam-diam.
Perhitungan yang penting dikerjakan oleh alat, bukan oleh model. Saat Anda meminta alarm agar tiba di suatu tempat tepat waktu, alat perjalanan menghitung kapan Anda harus berangkat, dan model hanya melaporkannya.
Kecepatan
Belum ada benchmark Orvena yang dipublikasikan. Teks mengalir saat ditulis, dan kata-kata pertama dari jawaban singkat muncul dalam satu atau dua detik. Yang akan Anda rasakan adalah percakapan yang panjang butuh waktu lebih lama sebelum jawabannya mulai, karena membaca prompt adalah bagian yang mahal di ponsel, dan mode berpikir menambah jeda yang terlihat.
Bahasa dan gambar
Model menjawab dalam bahasa apa pun yang Anda pakai untuk menulis. Agar hal itu andal untuk pesan singkat, Orvena mendeteksi bahasa setiap pesan dengan pengenal bahasa milik Apple di perangkat dan menambahkan catatan runtime yang menyebutkannya; catatan itu dihapus dari apa pun yang ditulis balik oleh model, jadi Anda tidak pernah melihatnya. Foto yang dilampirkan diproses oleh encoder visi di ponsel.
Dibandingkan menjalankan Qwen di Mac
Di Mac, Anda bisa memilih ukuran Qwen 3.5 yang lebih besar, dan model-model itu lebih kuat. Di ponsel, 4B adalah batas praktis saat ini. Yang ditambahkan ponsel adalah segala sesuatu di sekitar model: kalender, pengingat, alarm, foto, ringkasan kesehatan, peta, dan catatan setiap tindakan model yang bisa Anda baca dan urungkan. Jika Anda ingin model yang lebih besar dari ponsel, Premium menambahkan Private Cloud Compute dari Apple di iOS 27, tanpa kunci yang perlu diatur, atau model OpenRouter apa pun dengan kunci Anda sendiri, dan Orvena meminta persetujuan sebelum percakapan apa pun keluar dari perangkat.
Pertanyaan umum
Varian Qwen mana yang diunduh Orvena?
Secara default mlx-community/Qwen3.5-4B-4bit pada revisi yang dikunci, 3,06 GB dalam sepuluh file. Varian campuran empat dan delapan bit, 3,57 GB, tersedia di layar Model untuk pemanggilan alat yang lebih akurat.
Bisakah saya memuat model GGUF atau MLX saya sendiri?
Tidak. Katalog unduhan berisi dua entri, dan masing-masing diuji dengan tes loop alat di perangkat fisik sebelum dicantumkan. Di iOS 27, layar Model juga menawarkan Apple Intelligence, yang sudah terpasang di iOS. Orvena adalah asisten, bukan aplikasi serbaguna untuk menjalankan model.
Dari mana bobot model berasal, dan apakah diverifikasi?
Dari mirror milik Orvena, dengan Hugging Face sebagai cadangan. Setiap file diperiksa terhadap ukuran dan hash SHA-256 yang dikunci sebelum model diaktifkan. Unduhan berjalan di latar belakang, dilanjutkan jika terputus, dan dikecualikan dari cadangan iCloud.
Apakah data saya dipakai untuk melatih Qwen?
Tidak. Model berjalan di ponsel Anda. Tidak ada yang Anda ketik atau ucapkan yang dikirim ke Alibaba atau ke Orvena. Sebuah alat mengirim apa yang dibutuhkannya ke layanannya sendiri, misalnya kueri pencarian web ke DuckDuckGo, dan percakapan Anda hanya keluar dari ponsel jika Anda memilih Private Cloud Compute atau menghubungkan model cloud sendiri.
Orvena gratis di App Store untuk iPhone 15 Pro dan yang lebih baru. Unduhan 3,1 GB cukup dilakukan sekali, lalu modelnya berjalan di ponsel.
Unduh di App Store