iPhoneでQwen 3.5 4BをMLXで動かす
ノートパソコンでQwenを動かしているなら、このモデルファミリーはすでにご存じでしょう。ここでは、iPhoneでQwenを動かす具体的な構成を紹介します。どのバリアントを使い、どう量子化されているのか。必要なメモリとストレージはどれくらいか。ターンの合間にランタイムが何をしているのか。そして40億パラメータのモデルがカレンダーにつながったとき、何ができて何ができないのか。
モデル
Qwen 3.5 4Bは、AlibabaのQwenチームによる小型のQwen 3.5モデルのひとつで(このファミリーには0.8B、2B、9Bのサイズもあります)、2026年初めにApache 2.0ライセンスで公開されました。パラメータは約40億で、画像を読み取れるビジョンエンコーダー、デフォルトでオンになっている思考モード、262,144トークンのネイティブコンテキストを備え、ツール呼び出しの訓練も受けています。Alibabaは201の言語と方言を挙げています。スマートフォンで最も重要な特性は、ツール呼び出しとサイズの2つです。8 GBのメモリで余裕を持って動くモデルとしては、おおよそこれが最大です。
Orvenaはmlx-community/Qwen3.5-4B-4bitを、単一のリビジョンに固定してダウンロードします。ダウンロードは合計3.06 GBの10個のファイルで、そのうち重みが3.03 GBです。アプリではこれを「3.1 GB」と丸めて表示します。2つ目の選択肢である「Qwen 3.5 4B Mixed」は、特に影響を受けやすい層の一部(埋め込み、MLPのダウンプロジェクションの半分、アテンションのバリュープロジェクションの一部)を8ビットに、残りを4ビットにしています。サイズは3.57 GBで、ツール呼び出しの引数がより正確になります。4ビット量子化の影響が最初に表れるのが、まさにこの部分です。2つのモデルは「モデル」ページで切り替えられます。
なぜ4ビットなのか
重み1つあたり16ビットだと、40億パラメータは約8 GBになり、スマートフォンのメモリ全体に相当します。4ビットなら、重みはディスク上で約3 GB、メモリ上ではそれより少し多くなり、iOS、アプリ、そして回答中にモデルが必要とする作業用メモリのための余裕が残ります。これがハードウェア要件の理由です。Orvenaは初回起動時にスマートフォンの物理メモリを確認し、おおよそ8 GBに満たない場合はダウンロードを提示しません。該当するのは、iPhone 15 Proと15 Pro Max、16eを含むすべてのiPhone 16、そしてiPhone 17と17eです。iPhone Airと17 Proモデルは12 GBを搭載しています。AppleはApple Intelligenceの対応機種としてiPhone 18 Pro、18 Pro Max、iPhone Duoも挙げていますが、どの機種でも、判断するのはセットアップ中のメモリチェックです。
ランタイム
推論は、Apple独自のシリコン向けの配列フレームワークであるMLXで、Swiftバインディングを使って実行します。モデルはスマートフォンのユニファイドメモリを使ってGPU上で動くので、プロセッサ間で重みをコピーすることはありません。一度読み込んだ重みは、ターンの合間もメモリに残ります。iOSからメモリ警告が来るとキャッシュは消去されますが、モデルは消えません。
2つのキャッシュのおかげで、スマートフォンは素の処理速度から想像するよりも速く感じられます。モデルを読み込むとき、Orvenaはプロンプトの固定部分、つまりシステムプロンプトとツールの説明を計算して、その状態を保持します。そのため、新しい会話でそれらのトークンをもう一度処理する必要がありません。会話の中ではキー・バリューキャッシュがターンからターンへ引き継がれるので、各返答で読む必要があるのは最新のメッセージとツールの結果だけで、履歴全体ではありません。
スマートフォンでは、コンテキストウィンドウをモデル本来の262kではなく16,384トークンに制限しています。英語でおよそ12,000語分の会話です。上限を設けているのは、スマートフォンでは長いプロンプトの読み込みが遅い部分であり、長いコンテキストのキャッシュがメモリを使い果たす原因になるからです。会話がウィンドウを超えると、Orvenaは最も古いターンを要約するのではなく外し、直近のターンを丸ごと残します。1つのツール結果が大きすぎて収まらない場合は、「The latest tool result is too large for this model's context window. Try a narrower request.」(最新のツール結果が、このモデルのコンテキストウィンドウには大きすぎます。範囲を絞って頼んでください)と表示されます。
サンプリングは、思考がオンのときは返答全体でtemperature 1.0、top-p 0.95、思考がオフのときはtemperature 0.7、top-p 0.8です。
思考モード
Qwen 3.5は、そうしないよう指示されない限り、答える前に推論します。Orvenaはその推論にトークンのバジェットを設けています。8 GBのスマートフォンでは288トークン、12 GBでは576トークンで、低電力モードではその半分です。バジェットを使い切ると、アプリはモデルに思考を締めくくらせて答えを始めさせるので、難しい質問でいつまでも止まってしまうことはありません。「モデル」ページには「自動」と「オフ」の2つの設定があり、「設定」の「詳細」では128から2,048トークンの間でカスタムのバジェットを設定できます。思考が最も役立つのは、移動時間に左右されるアラームのように複数のステップからなるツールのタスクで、その分数秒かかります。ちょっとした事実を尋ねる質問なら、「オフ」のほうがはっきりと速くなります。
ツール呼び出し
ツールはJSONの関数スキーマとしてモデルに説明され、モデル自身のチャットテンプレートでプロンプトに組み込まれます。そのため、モデルは訓練されたとおりの形式で呼び出しを出力します。Orvenaは、ツールを段階的に開示することでプロンプトを小さく保っています。モデルは最初にいくつかの中核ツールと短い要約だけを受け取り、カレンダー、リマインダー、マップ、ヘルスケアなど必要なスキルを読み込んでから、初めて完全なスキーマを目にします。1つのリクエストで、モデルは最大32ラウンドまで実行できます。すべての呼び出しは宣言されたスキーマと照合され、宣言されていない名前への呼び出しや不正な引数を持つ呼び出しは、黙って捨てられるのではなく、モデルが読んで修正できるエラーとして返されます。
正確さが重要な計算は、モデルではなくツールが行います。どこかに間に合うようにアラームを頼むと、出発すべき時刻は移動のツールが計算し、モデルはそれを伝えるだけです。
速度
Orvenaのベンチマークはまだ公開していません。テキストは書かれるそばからストリーミングされ、短い答えなら最初の言葉が1、2秒以内に表示されます。気づくのは、長い会話では答えが始まるまでに時間がかかること(スマートフォンではプロンプトの読み込みが高くつく部分だからです)と、思考によって目に見える間が空くことです。
言語と画像
モデルは、あなたが書いた言語で答えます。短いメッセージでもそれを確実にするために、OrvenaはAppleのオンデバイスの言語認識機能で各メッセージの言語を検出し、その言語を示す実行時のメモを付け加えます。このメモはモデルが書き返す内容から取り除かれるので、目にすることはありません。添付した写真は、スマートフォン上のビジョンエンコーダーで処理されます。
MacでQwenを動かす場合との比較
Macなら、より大きなQwen 3.5のサイズを選べ、そちらのほうが強力なモデルです。スマートフォンでは、今のところ4Bが実用上の上限です。スマートフォンが加えるのは、モデルを取り巻くすべてです。カレンダー、リマインダー、アラーム、写真、ヘルスケアの要約、マップ、そしてモデルが行うすべての操作の記録で、それを読むことも取り消すこともできます。スマートフォンからより大きなモデルを使いたいなら、PremiumでiOS 27のAppleのPrivate Cloud Compute(キーの設定は不要)か、自分のキーでOpenRouterのあらゆるモデルを使えるようになります。会話がデバイスを離れる前には、Orvenaが必ず同意を求めます。
よくある質問
Orvenaは、どのQwenのバリアントをダウンロードしますか?
デフォルトでは、固定されたリビジョンのmlx-community/Qwen3.5-4B-4bitで、10個のファイルで3.06 GBです。ツール呼び出しをより正確にしたい場合は、4ビットと8ビットを混合したバリアント(3.57 GB)を「モデル」ページで選べます。
自分のGGUFやMLXのモデルを読み込めますか?
いいえ。ダウンロードのカタログには2つの項目があり、どちらも実機でツールループのテストを行ってから掲載しています。iOS 27では、「モデル」ページにiOSに内蔵されたApple Intelligenceも表示されます。Orvenaはアシスタントであり、汎用のモデル実行アプリではありません。
重みはどこから取得され、検証されていますか?
Orvenaのミラーから取得し、Hugging Faceを予備として使います。モデルを有効にする前に、すべてのファイルを固定されたサイズとSHA-256ハッシュと照合します。ダウンロードはバックグラウンドで行われ、中断しても再開でき、iCloudバックアップの対象外です。
自分のデータがQwenの学習に使われますか?
いいえ。モデルはあなたのスマートフォン上で動きます。入力したことも話したことも、AlibabaやOrvenaには送られません。ツールは必要なものをそれぞれのサービスに送り(たとえばウェブ検索のクエリはDuckDuckGoへ)、会話がスマートフォンを離れるのは、Private Cloud Computeを選ぶか、自分でクラウドモデルを接続した場合だけです。
OrvenaはiPhone 15 Pro以降向けに、App Storeで無料で提供されています。3.1 GBのダウンロードは一度だけで、あとはスマートフォン上で動きます。
App Storeでダウンロード