音声

iPhoneのオンデバイス音声アシスタント:仕組みと、知っておきたいこと

2026年9月29日更新 · 4分で読めます · ORVENA LABS

オンデバイス音声アシスタントは、順番に働く3つのプログラムでできています。あなたの声を聞き取るもの、何を話し何をするかを判断するもの、そして話すものです。ほとんどのアシスタントは真ん中のプログラムを、そして多くの場合ほかの2つもサーバー上で動かします。Orvenaはデフォルトで、3つすべてをiPhone上で動かします。この記事では、それが何を意味するのか、どう設定するのか、そしてどこに限界があるのかを説明します。

OrvenaはiPhone 15 Pro以降で無料で使えます。音声は一度きりの購入であるPremium Unlockに含まれます。 ダウンロード

オンデバイス音声アシスタントがスマートフォン上で動かすもの

聞き取り。Orvenaは、iOS 26のSpeechフレームワークにあるAppleのオンデバイス音声認識を使います。ある言語で初めて話すとき、iOSがその言語の認識モデルをダウンロードするので、話し始める前の「準備しています…」という短い待ち時間が、その回だけ長くなります。

判断。入力したときに答えるのと同じモデルです。ダウンロードサイズが3.1 GBでスマートフォンのGPUで動くQwen 3.5 4Bか、iOS 27ならiOSに組み込まれているApple Intelligenceです。話している間もスマートフォンのツールを使えます。会議を動かす、アラームを設定する、天気を確認する、写真を探す、といったことです。

発話。2つのニューラル音声エンジンが、スマートフォン上で声を生成します。1つは英語、スペイン語、フランス語、イタリア語、ポルトガル語に対応し、ダウンロードは約345 MBです。もう1つはさらに26の言語に対応し、400 MBです。どちらも音声機能を解除したあとに取得が始まり、バックグラウンドで完了します。

どちらのオンデバイスモデルでも、この流れの中でネットワークを通るものは何もありません。確かめるには機内モードが確実です。機内モードをオンにして音声セッションを始め、明日のカレンダーの予定を尋ねて、答えを聞いてみてください。

会話を始める

1回のやり取りの流れ

Orvenaは聞き取りながら、話している内容を文字起こしで表示します。1.5秒の無音があると、あるいは認識エンジンがすでに文を確定させている場合は0.6秒で、あなたの番が終わったとみなします。これによって、考えている途中で話を遮ることなく、テンポのよいやり取りになります。そのあと考え、リクエストに必要ならツールを使って結果をカードで表示し、答えを話します。答え終わると再び聞き取りを始めるので、手を使わずに会話を続けられます。セッションは「終了」をタップするか、90秒間何も話さないと終わります。

Orvenaが考えている間と話している間は、マイクはオフです。これは意図的なものです。2つの認識が同時に聞いていると、アシスタントが自分自身の声に答えてしまうからです。そのため、オンデバイスの経路では、答えの途中で話をかぶせることはできません。途中で止めたいときは、「終了」をタップするか、Dynamic Islandの停止ボタンを押してください。

オフラインで動くもの

ここまでのすべてと、スマートフォン上にあるすべてのツールです。カレンダー、リマインダー、アラームとタイマー、写真、ヘルスケアの要約、連絡先、ファイル、ミュージックがそれに当たります。接続が必要なのは、外の世界が必要なものです。ウェブ検索、ウェブページの読み取り、天気、場所の検索と移動時間、NotionやGitHubなどの接続したサービス、Private Cloud Compute、そして自分のキーで追加したクラウドモデルです。それぞれがどんな条件でネットワークに接続するかは、ホームページの台帳に一覧になっています。

制限

Orvena独自のウェイクワードはありません。iOSは常時の聞き取りをSiriのために確保しているので、サードパーティのアシスタントは開くか、何らかの操作で起動する必要があります。アクションボタンで音声セッションが始まり、Siriに「Orvena に聞いて」と話せば質問を1つ渡せます。モデルはクラウドのアシスタントを支えるものより小さく、長い調べ物や専門的な分野では違いがわかります。一方で、予定、天気、リマインダー、写真、移動時間を踏まえたアラームなど、スマートフォンに声で尋ねるような用件にはちょうどいい大きさです。音声には8 GBのメモリを備えたiPhone 15 Pro以降が必要です。言語モデルがそれを必要とするためです。また、Orvenaがどの言語を聞き取れるかはAppleのオンデバイス音声認識によって決まり、言語の選択肢には、話すこともできる言語だけが表示されます。

オプションのクラウド音声

OpenAIのキーがあれば、代わりにOpenAIのリアルタイムモデルでライブ音声セッションを使えます。やり取りのテンポが速く、文の途中で割り込むこともできますが、その代わりに音声はOpenAIにストリーミングされます。Orvenaはセッションを始める前に同意を求め、会話にすでに健康や金融のデータが含まれている場合はもう一度確認します。音声画面には、緑の「この iPhone 上」ではなく琥珀色の「クラウド」というラベルが表示されるので、どちらのモードにいるのかいつでもわかります。

よくある質問

Orvenaの音声にはインターネット接続が必要ですか?

いいえ。音声パックがスマートフォンに入っていて(Apple IntelligenceではなくOrvena独自のモデルを使う場合はそのモデルも)、その言語で初めて話したときにiOSが認識モデルを取得していれば、接続は不要です。Private Cloud Computeやクラウドモデルを選んでいない限り、認識、回答、音声合成はすべてスマートフォン上で動きます。ネットワークを使うのは、ウェブ検索や天気のように外の世界が必要なリクエストだけで、それもあなたが頼んだときだけです。

AirPodsやBluetoothヘッドセットは使えますか?

はい。音声セッションはBluetoothのハンズフリーとステレオのどちらのプロファイルにも対応しており、それ以外の場合は内蔵スピーカーを使います。

音声は無料ですか?

入力による会話は制限なく無料です。音声会話はPremium Unlockに含まれます。Premium Unlockは14.99ドルの一度きりの購入で、サブスクリプションはありません。

なぜウェイクワードがないのですか?

iOSでバックグラウンドの聞き取りが許されているのはSiriだけです。Siriに「Orvena に聞いて」と話せばSiriが何を聞きたいか尋ねてくれますし、アクションボタン、ショートカット、アプリ内の波形ボタンから音声セッションを始めることもできます。

機内モードで試してみてください。

OrvenaはiPhone 15 Pro以降向けにApp Storeで無料で提供されています。音声会話は一度きりの購入であるPremium Unlockに含まれます。

App Storeでダウンロード