Qwen 3.5 4B'yi iPhone'da MLX ile çalıştırmak
Qwen'i bir dizüstü bilgisayarda çalıştırıyorsanız bu model ailesini zaten tanıyorsunuz. Bu yazı, Qwen'i iPhone'da çalıştıran somut kurulumu anlatıyor: hangi varyant, nasıl kuantize edildiği, ne kadar bellek ve depolama gerektirdiği, çalışma ortamının turlar arasında ne yaptığı ve dört milyar parametreli bir modelin takviminize bağlandığında neleri yapıp neleri yapamadığı.
Model
Qwen 3.5 4B, Alibaba'nın Qwen ekibinin küçük Qwen 3.5 modellerinden biri (ailede 0.8B, 2B ve 9B boyutları da var) ve 2026'nın başında Apache 2.0 lisansıyla yayımlandı. Yaklaşık dört milyar parametresi, görüntüleri okuyabilmesini sağlayan bir görüntü kodlayıcısı, varsayılan olarak açık bir düşünme modu, 262.144 token'lık yerel bir bağlam uzunluğu ve araç çağırmaya yönelik eğitimi var. Alibaba 201 dil ve lehçe listeliyor. Telefonda en çok önem taşıyan iki özellik araç çağırma ve boyut: bu, 8 GB bellekte rahat bir payla çalışabilen kabaca en büyük model.
Orvena, tek bir revizyona sabitlenmiş mlx-community/Qwen3.5-4B-4bit modelini indirir. İndirme toplam 3,06 GB tutan on dosyadan oluşur ve bunun 3,03 GB'ı ağırlıklardır; uygulama bu değeri "3,1 GB" olarak yuvarlar. İkinci seçenek olan "Qwen 3.5 4B Mixed", en hassas katmanların bir kısmını (gömmeleri, MLP aşağı projeksiyonlarının yarısını ve bazı dikkat değer projeksiyonlarını) sekiz bitte, geri kalanını dört bitte tutar. 3,57 GB boyutundadır ve araç çağrılarında daha doğru argümanlar üretir; dört bit kuantizasyonun etkisi de ilk olarak burada kendini gösterir. Modeller sayfasında ikisi arasında geçiş yapabilirsiniz.
Neden dört bit
Ağırlık başına on altı bitte dört milyar parametre yaklaşık 8 GB eder; bu da telefonun belleğinin tamamı demektir. Dört bitte ağırlıklar diskte yaklaşık 3 GB, bellekte biraz daha fazla yer kaplar ve geriye iOS, uygulama ve modelin yanıt verirken ihtiyaç duyduğu çalışma belleği için yer kalır. Donanım gereksiniminin nedeni de bu: Orvena ilk açılışta telefonun fiziksel belleğini kontrol eder ve yaklaşık 8 GB'ın altında indirmeyi önermez. Bu belleğe sahip telefonlar iPhone 15 Pro ve 15 Pro Max, 16e dahil tüm iPhone 16 modelleri ve iPhone 17 ile 17e. iPhone Air ve 17 Pro modellerinde 12 GB var. Apple, Apple Intelligence için iPhone 18 Pro, 18 Pro Max ve iPhone Duo'yu da listeliyor; hangi telefon olursa olsun, kararı kurulum sırasındaki bellek kontrolü verir.
Çalışma ortamı
Çıkarım, Apple'ın kendi çipleri için geliştirdiği dizi çerçevesi MLX üzerinden, Swift bağlamalarıyla çalışır. Model telefonun birleşik belleğini kullanarak GPU'da çalıştığı için ağırlıklar işlemciler arasında kopyalanmaz. Yüklendikten sonra ağırlıklar turlar arasında bellekte kalır; iOS'ten gelen bir bellek uyarısı önbellekleri temizler ama modeli boşaltmaz.
İki önbellek, telefonun ham işlem hızının düşündürdüğünden daha hızlı hissettirmesini sağlar. Model yüklendiğinde Orvena istemin sabit kısmını, yani sistem istemini ve araç açıklamalarını bir kez hesaplar ve bu durumu saklar; böylece yeni bir sohbet bu token'ların bedelini yeniden ödemez. Bir sohbetin içinde anahtar-değer önbelleği turdan tura taşınır; bu sayede her yanıtta tüm geçmişin değil, yalnızca son mesajınızın ve araç sonuçlarının okunması gerekir.
Bağlam penceresi telefonda, modelin tam 262k değeri yerine 16.384 token'la sınırlıdır. Bu, yaklaşık 12.000 kelimelik bir sohbet demek. Sınırın nedeni, telefonda yavaş olan kısmın uzun bir istemi okumak olması ve belleği tüketenin uzun bir bağlamın önbelleği olması. Bir sohbet bağlam penceresini aştığında Orvena en son turları bütün hâlinde tutar ve en eskilerini özetlemek yerine dışarıda bırakır. Tek bir araç sonucu sığmayacak kadar büyükse şu mesajı gösterir: "The latest tool result is too large for this model's context window. Try a narrower request." (Son araç sonucu bu modelin bağlam penceresi için çok büyük. Daha dar kapsamlı bir istek deneyin.)
Örnekleme, düşünme açıkken yanıtın tamamı için sıcaklık 1,0 ve top-p 0,95; düşünme kapalıyken sıcaklık 0,7 ve top-p 0,8 değerleriyle yapılır.
Düşünme modu
Qwen 3.5, aksi söylenmedikçe yanıtlamadan önce akıl yürütür. Orvena bu akıl yürütmeye bir token bütçesi verir: 8 GB'lık bir telefonda 288, 12 GB'lık bir telefonda 576 token; Düşük Güç Modu'nda bunun yarısı. Bütçe dolduğunda uygulama, modeli düşünmesini kapatıp yanıta başlamaya zorlar; böylece zor bir soru modeli süresiz olarak takılı bırakamaz. Modeller sayfasında Otomatik ve Kapalı olmak üzere iki ayar vardır; Ayarlar, Gelişmiş bölümü ise 128 ile 2.048 token arasında özel bir bütçe ekler. Düşünme en çok, örneğin yol süresine bağlı bir alarm gibi çok adımlı araç görevlerinde işe yarar ve birkaç saniyeye mal olur; kısa bir bilgi sorusunda Kapalı belirgin biçimde daha hızlıdır.
Araç çağırma
Araçlar modele JSON fonksiyon şemaları olarak tanıtılır ve modelin kendi sohbet şablonuyla isteme yerleştirilir; böylece model çağrıları, eğitildiği biçimde üretir. Orvena araçları kademeli olarak açarak istemi küçük tutar: model birkaç temel araç ve kısa özetlerle başlar, ardından ihtiyaç duyduğu beceriyi (takvim, anımsatıcılar, haritalar, sağlık vb.) yükler ve ancak o zaman tam şemaları görür. Bir istek en fazla 32 model turu sürebilir. Her çağrı bildirilen şemaya göre denetlenir; tanımlanmamış bir ada yapılan ya da hatalı argümanlar içeren bir çağrı sessizce atılmaz, modelin okuyup düzeltebileceği bir hata olarak modele geri döndürülür.
Önem taşıyan hesaplamaları model değil araçlar yapar. Sizi bir yere zamanında ulaştıracak bir alarm istediğinizde çıkış saatini yol süresi aracı hesaplar, model yalnızca sonucu bildirir.
Hız
Orvena için henüz yayımlanmış bir kıyaslama yok. Metin yazıldıkça akar ve kısa bir yanıtın ilk kelimeleri bir iki saniye içinde belirir. Fark edeceğiniz iki şey var: uzun bir sohbette yanıtın başlaması daha uzun sürer, çünkü telefonda pahalı olan kısım istemi okumaktır; düşünme de gözle görülür bir duraklama ekler.
Diller ve görseller
Model, hangi dilde yazarsanız o dilde yanıt verir. Kısa mesajlarda bunu güvenilir kılmak için Orvena her mesajın dilini Apple'ın cihaz üzerindeki dil tanıyıcısıyla algılar ve bunu belirten bir çalışma zamanı notu ekler. Bu not, modelin geri yazdığı her şeyden ayıklanır, dolayısıyla onu hiç görmezsiniz. Eklediğiniz fotoğraflar telefondaki görüntü kodlayıcısından geçer.
Qwen'i bir Mac'te çalıştırmakla karşılaştırma
Mac'te daha büyük Qwen 3.5 boyutlarını seçebilirsiniz ve bunlar daha güçlü modellerdir. Telefonda ise bugün pratik üst sınır 4B. Telefonun kattığı şey modelin etrafındaki her şey: takviminiz, anımsatıcılarınız, alarmlarınız, fotoğraflarınız, sağlık özetleriniz, haritalar ve modelin yaptığı her eylemin okuyup geri alabileceğiniz bir kaydı. Telefonunuzdan daha büyük bir model kullanmak isterseniz Premium, iOS 27'de anahtar kurulumu gerektirmeyen Apple Private Cloud Compute hizmetini ya da kendi anahtarınızla herhangi bir OpenRouter modelini ekler; Orvena da herhangi bir sohbet cihazdan çıkmadan önce onayınızı ister.
Sık sorulan sorular
Orvena hangi Qwen varyantını indiriyor?
Varsayılan olarak, sabitlenmiş bir revizyonda mlx-community/Qwen3.5-4B-4bit: on dosyada 3,06 GB. Daha doğru araç çağrıları için Modeller sayfasında dört ve sekiz biti karıştıran, 3,57 GB'lık bir varyant da var.
Kendi GGUF veya MLX modelimi yükleyebilir miyim?
Hayır. İndirme kataloğunda iki seçenek var ve her biri listelenmeden önce fiziksel cihazlarda araç döngüsü testlerinden geçiriliyor. iOS 27'de Modeller sayfası, iOS'e yerleşik olarak gelen Apple Intelligence seçeneğini de sunar. Orvena genel amaçlı bir model çalıştırıcısı değil, bir asistandır.
Ağırlıklar nereden geliyor ve doğrulanıyor mu?
Orvena'nın yansı sunucusundan, yedek olarak da Hugging Face'ten. Model etkinleştirilmeden önce her dosya, sabitlenmiş boyut ve SHA-256 sağlama toplamıyla karşılaştırılır. İndirme arka planda çalışır, kesilirse kaldığı yerden devam eder ve iCloud yedeklemesinin dışında tutulur.
Verilerim Qwen'i eğitmek için kullanılıyor mu?
Hayır. Model telefonunuzda çalışır. Yazdığınız veya söylediğiniz hiçbir şey Alibaba'ya ya da Orvena'ya gönderilmez. Bir araç, ihtiyaç duyduğu bilgiyi kendi servisine gönderir, örneğin bir web araması sorgusunu DuckDuckGo'ya; sohbetiniz ise yalnızca Private Cloud Compute'u seçerseniz ya da bir bulut modelini kendiniz bağlarsanız telefondan çıkar.
Orvena, iPhone 15 Pro ve sonrası için App Store'da ücretsiz. 3,1 GB'lık indirme bir kez yapılır ve model telefonda çalışır.
App Store'dan indirin