Chạy Qwen 3.5 4B trên iPhone với MLX
Nếu bạn từng chạy Qwen trên laptop, bạn đã quen với dòng mô hình này. Đây là cấu hình cụ thể để chạy Qwen trên iPhone: biến thể nào, được lượng tử hóa ra sao, cần bao nhiêu bộ nhớ và dung lượng lưu trữ, runtime làm gì giữa các lượt, và một mô hình bốn tỷ tham số làm được và không làm được gì khi đã được kết nối với lịch của bạn.
Mô hình
Qwen 3.5 4B là một trong các mô hình Qwen 3.5 cỡ nhỏ của nhóm Qwen thuộc Alibaba (dòng này còn có các cỡ 0.8B, 2B và 9B), được phát hành đầu năm 2026 theo giấy phép Apache 2.0. Mô hình có khoảng bốn tỷ tham số, một bộ mã hóa thị giác để đọc được hình ảnh, chế độ suy nghĩ được bật theo mặc định, ngữ cảnh gốc 262.144 token, và được huấn luyện để gọi công cụ. Alibaba liệt kê 201 ngôn ngữ và phương ngữ. Trên điện thoại, hai đặc điểm quan trọng nhất là khả năng gọi công cụ và kích thước: đây gần như là mô hình lớn nhất chạy được mà vẫn còn dư chỗ trong 8 GB bộ nhớ.
Orvena tải về mlx-community/Qwen3.5-4B-4bit, được ghim vào một bản sửa đổi (revision) duy nhất. Bản tải về gồm mười tệp, tổng cộng 3,06 GB, trong đó trọng số chiếm 3,03 GB; ứng dụng làm tròn thành "3,1 GB". Tùy chọn thứ hai, "Qwen 3.5 4B Mixed", giữ một số lớp nhạy cảm nhất (lớp embedding, một nửa phép chiếu down của MLP và một số phép chiếu value của attention) ở tám bit và phần còn lại ở bốn bit. Biến thể này nặng 3,57 GB và cho ra đối số gọi công cụ chính xác hơn, vốn là chỗ lượng tử hóa bốn bit bộc lộ hạn chế đầu tiên. Bạn có thể chuyển đổi giữa hai biến thể trên trang Mô hình.
Vì sao là bốn bit
Ở mười sáu bit mỗi trọng số, bốn tỷ tham số chiếm khoảng 8 GB, tức toàn bộ bộ nhớ của điện thoại. Ở bốn bit, trọng số chiếm khoảng 3 GB trên ổ lưu trữ và nhỉnh hơn một chút trong bộ nhớ, chừa chỗ cho iOS, ứng dụng và bộ nhớ làm việc mà mô hình cần khi trả lời. Đó là lý do cho yêu cầu phần cứng: Orvena kiểm tra bộ nhớ vật lý của điện thoại ở lần khởi chạy đầu tiên và không đề xuất tải về nếu dưới khoảng 8 GB. Các điện thoại đáp ứng được là iPhone 15 Pro và 15 Pro Max, mọi mẫu iPhone 16 kể cả 16e, cùng iPhone 17 và 17e. iPhone Air và các mẫu 17 Pro có 12 GB. Apple cũng liệt kê iPhone 18 Pro, 18 Pro Max và iPhone Duo cho Apple Intelligence; trên bất kỳ điện thoại nào, bước kiểm tra bộ nhớ trong quá trình thiết lập sẽ quyết định.
Runtime
Suy luận chạy qua MLX, framework xử lý mảng của Apple dành cho chip do chính hãng thiết kế, thông qua các binding Swift. Mô hình chạy trên GPU với bộ nhớ hợp nhất của điện thoại, nên không phải sao chép trọng số giữa các bộ xử lý. Sau khi được nạp, trọng số nằm lại trong bộ nhớ giữa các lượt; cảnh báo bộ nhớ từ iOS sẽ xóa các bộ nhớ đệm chứ không xóa mô hình.
Hai bộ nhớ đệm giúp điện thoại có cảm giác nhanh hơn so với tốc độ xử lý thô của nó. Khi mô hình được nạp, Orvena tính trước phần cố định của prompt, gồm system prompt và phần mô tả công cụ, rồi giữ lại trạng thái đó, nên một cuộc trò chuyện mới không phải xử lý lại các token này. Trong một cuộc trò chuyện, bộ nhớ đệm key-value được chuyển từ lượt này sang lượt khác, nên mỗi câu trả lời chỉ cần đọc tin nhắn mới nhất của bạn và các kết quả công cụ, chứ không phải toàn bộ lịch sử.
Cửa sổ ngữ cảnh trên điện thoại được giới hạn ở 16.384 token, thay vì toàn bộ 262k của mô hình. Con số đó tương đương khoảng 12.000 từ hội thoại, và giới hạn này tồn tại vì đọc một prompt dài là phần chậm trên điện thoại, còn bộ nhớ đệm cho một ngữ cảnh dài là thứ làm cạn bộ nhớ. Khi cuộc trò chuyện vượt quá cửa sổ, Orvena giữ lại các lượt trọn vẹn gần nhất và bỏ các lượt cũ nhất thay vì tóm tắt chúng. Nếu một kết quả công cụ đơn lẻ quá lớn, ứng dụng báo "The latest tool result is too large for this model's context window. Try a narrower request." (kết quả công cụ mới nhất quá lớn so với cửa sổ ngữ cảnh của mô hình, hãy thử yêu cầu hẹp hơn).
Khi bật suy nghĩ, việc lấy mẫu dùng temperature 1,0 với top-p 0,95 cho toàn bộ câu trả lời; khi tắt suy nghĩ là temperature 0,7 với top-p 0,8.
Chế độ suy nghĩ
Qwen 3.5 suy luận trước khi trả lời, trừ khi được yêu cầu không làm vậy. Orvena đặt cho phần suy luận đó một ngân sách token: 288 token trên điện thoại 8 GB và 576 token trên điện thoại 12 GB, giảm một nửa ở Chế độ nguồn điện thấp. Khi hết ngân sách, ứng dụng buộc mô hình kết thúc phần suy nghĩ và bắt đầu trả lời, nên một câu hỏi khó không thể treo mãi. Trang Mô hình có hai thiết lập, Tự động và Tắt, và mục Cài đặt, Nâng cao có thêm ngân sách tùy chỉnh từ 128 đến 2.048 token. Suy nghĩ giúp ích nhiều nhất với các tác vụ công cụ nhiều bước, chẳng hạn một báo thức phụ thuộc vào thời gian di chuyển, và tốn thêm vài giây; với một câu hỏi thực tế nhanh, chọn Tắt sẽ nhanh hơn thấy rõ.
Gọi công cụ
Công cụ được mô tả cho mô hình dưới dạng JSON function schema và được đưa vào prompt bằng chính chat template của mô hình, nên mô hình phát ra lời gọi đúng định dạng mà nó đã được huấn luyện. Orvena giữ prompt gọn bằng cách mở dần các công cụ: mô hình bắt đầu với vài công cụ cốt lõi và các bản tóm tắt ngắn, sau đó nạp kỹ năng cần thiết (lịch, lời nhắc, bản đồ, sức khỏe, v.v.), và chỉ khi đó mới thấy đầy đủ các schema. Một yêu cầu có thể mất tới 32 vòng mô hình. Mọi lời gọi đều được kiểm tra với schema đã khai báo; lời gọi đến một tên chưa khai báo hoặc có đối số sai định dạng sẽ được trả lại cho mô hình dưới dạng lỗi mà nó có thể đọc và sửa, thay vì bị bỏ qua âm thầm.
Những phép tính quan trọng được thực hiện bằng công cụ chứ không phải bằng mô hình. Khi bạn đặt một báo thức để đến nơi đúng giờ, công cụ di chuyển tính giờ phải xuất phát và mô hình chỉ báo lại kết quả.
Tốc độ
Hiện chưa có benchmark nào được công bố cho Orvena. Văn bản hiện ra ngay trong lúc được viết, và những từ đầu tiên của một câu trả lời ngắn xuất hiện trong vòng một hai giây. Điều bạn sẽ nhận thấy là một cuộc trò chuyện dài mất nhiều thời gian hơn trước khi câu trả lời bắt đầu, vì đọc prompt là phần tốn kém trên điện thoại, và chế độ suy nghĩ thêm một khoảng dừng thấy rõ.
Ngôn ngữ và hình ảnh
Mô hình trả lời bằng bất kỳ ngôn ngữ nào bạn viết. Để việc này ổn định với các tin nhắn ngắn, Orvena nhận diện ngôn ngữ của từng tin nhắn bằng bộ nhận diện ngôn ngữ trên thiết bị của Apple và thêm một ghi chú lúc chạy nêu rõ ngôn ngữ đó; ghi chú này được loại khỏi mọi thứ mô hình viết ra, nên bạn không bao giờ thấy nó. Ảnh đính kèm đi qua bộ mã hóa thị giác ngay trên điện thoại.
So với chạy Qwen trên Mac
Trên Mac, bạn có thể chọn các cỡ Qwen 3.5 lớn hơn, và đó là những mô hình mạnh hơn. Trên điện thoại, 4B là mức trần thực tế hiện nay. Điều điện thoại mang lại là mọi thứ xung quanh mô hình: lịch, lời nhắc, báo thức, ảnh, tóm tắt sức khỏe, bản đồ của bạn, và bản ghi mọi hành động mô hình thực hiện mà bạn có thể đọc và hoàn tác. Nếu muốn dùng mô hình lớn hơn từ điện thoại, Premium bổ sung Private Cloud Compute của Apple trên iOS 27, không cần thiết lập khóa, hoặc bất kỳ mô hình OpenRouter nào với khóa của riêng bạn, và Orvena xin sự đồng ý của bạn trước khi bất kỳ cuộc trò chuyện nào rời khỏi thiết bị.
Câu hỏi thường gặp
Orvena tải về biến thể Qwen nào?
Mặc định là mlx-community/Qwen3.5-4B-4bit ở một bản sửa đổi được ghim, 3,06 GB trong mười tệp. Một biến thể hỗn hợp bốn bit và tám bit, 3,57 GB, có trên trang Mô hình để gọi công cụ chính xác hơn.
Tôi có thể nạp mô hình GGUF hoặc MLX của riêng mình không?
Không. Danh mục tải về có hai mục, và mỗi mục đều được kiểm thử bằng các bài test vòng lặp công cụ trên thiết bị thật trước khi được đưa vào danh sách. Trên iOS 27, trang Mô hình còn có Apple Intelligence, vốn được tích hợp sẵn trong iOS. Orvena là một trợ lý, không phải công cụ chạy mô hình đa năng.
Trọng số lấy từ đâu, và có được xác minh không?
Từ bản mirror của Orvena, với Hugging Face làm nguồn dự phòng. Mọi tệp đều được đối chiếu với kích thước và mã băm SHA-256 đã ghim trước khi mô hình được kích hoạt. Việc tải về chạy nền, tự tiếp tục nếu bị gián đoạn, và được loại khỏi bản sao lưu iCloud.
Dữ liệu của tôi có được dùng để huấn luyện Qwen không?
Không. Mô hình chạy trên điện thoại của bạn. Không có gì bạn gõ hay nói được gửi đến Alibaba hay Orvena. Một công cụ gửi những gì nó cần đến dịch vụ riêng của nó, ví dụ truy vấn tìm kiếm web đến DuckDuckGo, và cuộc trò chuyện của bạn chỉ rời khỏi điện thoại nếu bạn chọn Private Cloud Compute hoặc tự kết nối một mô hình đám mây.
Orvena miễn phí trên App Store cho iPhone 15 Pro trở lên. Bản tải về 3,1 GB chỉ diễn ra một lần và chạy ngay trên điện thoại.
Tải về trên App Store