SeedRealtime フルデュプレックス スマホAgent:自然な音声会話からAndroid実行へ進む設計
SeedRealtimeとSeeduplexの全二重音声AIがスマホAgentに何を変えるのかを、DeanがFoneClawの実装経験から、会話、権限、承認、復旧、Android実行レイヤーに分けて解説します。
- SeedRealtimeとSeeduplexは、AIが話している間もユーザーの声を聞き、割り込みや沈黙を扱いやすくする全二重音声AIの流れを示しています。
- フルデュプレックスはリアルタイム音声Agentの会話を自然にしますが、Android操作には権限、承認、状態、実行結果、復旧を扱う別のレイヤーが必要です。
- FoneClawは現在、ユーザーが起動した音声入力と現在画面の文脈を、管理されたAndroid操作、見える承認、権限復旧へつなげる実行レイヤーを作っています。
- 実用的なスマホAgent設計では、音声の流暢さだけでなく、誤操作防止、プライバシー、電池、ノイズ、画面文脈、結果検証まで一体で評価します。
SeedRealtimeとSeeduplexがスマホAgentに変えること
SeedRealtime フルデュプレックス スマホAgentというテーマでまず押さえたいのは、SeedRealtimeとSeeduplexが会話の入口を大きく変える技術だという点です。ByteDance Seedは2026年4月9日に、Seed Full-Duplex Speech LLMの発表で、AIが話している最中もユーザーの声を聞くネイティブなlisten-while-speaking構成を説明しました。Seedはこの発表で、干渉音の抑制、発話の区切り検出、割り込み処理が改善されたと述べ、Doubaoへの展開にも触れています。
SeedRealtimeの公式モデルページでは、SeedRealtimeがSeedのモデルファミリーとして示されています。FoneClawを作っている私たちにとって重要なのは、モデル名そのものより、全二重音声AIがユーザー体験に与える影響です。従来の音声アシスタントは、ユーザーが話し終えるのを待ち、AIが返し、またユーザーが話すという半二重のやり取りになりがちでした。フルデュプレックスでは、ユーザーが途中で言い直したり、AIの返答中に割り込んだり、沈黙を挟みながら考えたりしやすくなります。
ただ、自然な会話はスマホ操作の完成ではありません。FoneClawの開発で学んだのは、音声が滑らかになるほど、実行側の境界をさらに明確にする必要があるということです。会話が速くなっても、SMS送信、Do Not Disturb変更、通話、ナビ、設定変更には権限、承認、検証、復旧が必要です。音声ファーストの考え方は、音声ファーストAIスマートフォンとは何か:声、ボタン、画面の優先順位が変わるで詳しく整理しています。
フルデュプレックス音声AIが沈黙、雑音、割り込みを扱う仕組み
半二重の音声AIでは、ユーザーとAIが交互に話します。ユーザーが話し終わったかどうかを検出し、そこでAIが返答を始めます。この方式は実装しやすい一方で、人間同士の会話にある短い相づち、言い直し、途中の割り込み、考えながら話す沈黙を扱いにくくなります。全二重音声AIは、AIが話している間にもユーザーの入力を聞き続け、割り込みや訂正をリアルタイムに受け止める方向です。
この変化で重要になるのが、発話の区切り、割り込み、雑音、横から入る声の扱いです。Seedは発表の中で、Seeduplexが干渉音抑制、発話区切りの判断、割り込み処理を改善したと説明しています。たとえばAIが説明している途中でユーザーが「違う、SMSじゃなくてTelegram」と言った場合、モデルは返答を止め、依頼の対象を更新する必要があります。料理中の換気扇、車内の走行音、隣の人の声も、音声Agentでは現実の入力になります。
研究面では、How Should LLMs Listen While Speaking?が、生成中に入ってくるユーザー音声をどのようにルーティングするかを扱っています。音声を早く反映するほど、現在の会話文脈との整合が難しくなり、文脈を重視するほど、割り込みへの反応が遅れることがあります。このトレードオフはスマホAgentでも大きな意味を持ちます。低遅延モデルの設計を広く見るなら、1000 TPS LLMとスマートフォンAIエージェント:高速推論が変えることが、速度と実行体験の関係を補います。
会話レイヤーとAndroid実行レイヤーを分けて考える
FoneClawを作る中で、私たちは会話レイヤーとAndroid実行レイヤーを分けて設計しています。会話レイヤーは、ユーザーの声、言い直し、割り込み、曖昧さ、意図、会話の流れを扱います。SeedRealtimeやSeeduplexのような全二重音声AIは、このレイヤーを大きく前進させます。ユーザーがAIの返答を待たずに訂正でき、AIが途中で聞き直せるなら、依頼の入口はずっと自然になります。
一方で、Android実行レイヤーは別の責任を持ちます。ここでは、どのアプリや設定に触れるのか、どの権限が必要なのか、どの操作に承認が必要なのか、何が完了したのか、失敗したときにどこへ戻るのかを扱います。流暢に「そのまま送って」と言えたとしても、宛先、本文、送信ボタン、標準SMSアプリ、デュアルSIM選択が確認できていなければ、実行側は慎重に進む必要があります。
会話と実行を一つに潰すと、音声が自然なほど誤操作が起きやすくなります。ユーザーが軽く言った「それでいいよ」が、どの操作への承認なのか曖昧になるからです。FoneClawでは、意図を受け取り、対応するAndroid操作へ計画し、権限と承認を見せ、結果を確認する構造を大切にしています。AndroidスマホAgent設計の全体像は、スマホ AI エージェント制御とは何か:Androidを任せる前に見るべき仕組みと安全性で詳しく説明しています。
音声の意図から確認済みの結果までの七段階
実用的なリアルタイム音声Agentには、会話の流暢さと実行の確実さをつなぐ契約が必要です。私たちはFoneClawの実装で、音声の意図から確認済みの結果までを七段階で考えています。全二重音声AIが強くなるほど、この段階を明確にしておく価値が上がります。なぜなら、ユーザーはAIの返答中に訂正し、別の条件を足し、途中で止めるからです。
| 段階 | スマホAgentで見ること | 実行上の意味 |
|---|---|---|
| 取得 | 声、画面、現在のタスクを受け取る | 音声入力や画面文脈をユーザー操作に結び付ける |
| 確認 | 曖昧な相手、アプリ、条件を聞き直す | 誤った対象への実行を減らす |
| 計画 | 必要なツール、権限、順序を決める | 会話をAndroid上の実行手順へ変換する |
| 承認 | 影響が残る操作を見える形で止める | 送信、共有、設定変更をユーザーの判断に結び付ける |
| 実行 | 対応済みのAndroid操作を進める | 管理されたツールと権限フローで動かす |
| 検証 | 完了、未完了、失敗を確認する | 結果をユーザーに戻す |
| 復旧 | 権限不足、画面変化、割り込みから戻る | 作業を最初からやり直さずに続ける |
この七段階では、タスク状態と承認が会話の途中でも保たれます。AIが話している最中にユーザーが「やっぱり送らないで」と割り込んだ場合、その言葉は単なる会話の訂正ではなく、実行停止として扱う必要があります。承認UIの設計を詳しく知りたい場合は、AIエージェント承認UI設計:提案、信頼度、理由、タスク状態をスマホでどう見せるかが、提案、理由、承認待ち状態の考え方を補います。
FoneClawで現在のAndroid実行レイヤーをどう作っているか
現在のFoneClawは、ユーザーが起動した音声入力と、ユーザーが添付した現在画面の文脈をもとに、管理されたAndroid実行レイヤーへつなげます。SeedRealtimeやSeeduplexは、この記事では全二重音声AIの重要な文脈として扱っています。FoneClawの現在の製品は、任意の設定モデルと管理されたAndroid操作を組み合わせ、権限、承認、結果確認を見える形で進める実行レイヤーです。
現在のFoneClawでは、フローティングアシスタント、同じスマホ内で続くタスク状態、権限復旧、クイックアクションを強化しています。ユーザーは別のアプリを見ている途中でも小さな入口から依頼を始め、必要な画面文脈を自分で添付し、Homeとフローティングアシスタントの間で作業を追えます。現在のFoneClawは常時リスニングやカメラ監視を製品体験の中心に置くのではなく、ユーザーが起動した入力と添付した文脈を作業に結び付けます。現在の機能はFoneClawの機能紹介で確認できます。
具体的には、Do Not Disturbの確認付き変更、見えるメッセージ下書き、通話準備、選択した地図アプリへのナビ引き継ぎ、対応するAndroid設定ワークフローなどを、管理された実行として扱います。フルデュプレックス音声AIが将来の会話入口をさらに自然にしても、FoneClaw側で必要になる仕事は同じです。依頼をタスクへ変換し、権限を確認し、影響のある操作で承認を求め、結果を検証し、失敗から戻ることです。現在画面の扱いを詳しく知るには、Android フローティングAIアシスタント 画面認識:現在画面から安全に操作へ進む方法が役立ちます。
実行ガードが必要なフルデュプレックスAgentの場面
第一の場面は、会議前のDo Not Disturbです。ユーザーが「会議中は通知を抑えて。いや、1時間だけ」と途中で言い直したとします。全二重音声AIなら訂正を自然に受け取れます。実行レイヤーでは、時間、対象設定、変更後の状態を確認し、ユーザーが承認できる形にする必要があります。設定変更は日常的な操作ですが、端末の通知体験に影響します。
第二の場面は、メッセージ作成です。ユーザーが「田中さんに、10分遅れると送って。やっぱり15分にして」とAIの返答中に割り込むと、音声側は本文を更新できます。Android側では、宛先、本文、標準SMSアプリ、送信ボタン、デュアルSIMや添付の有無を確認します。FoneClawでは、見える下書きと確認できる送信条件を重視します。声が自然でも、相手に届く操作は見える承認に結び付けます。
第三の場面は、通話やナビへの引き継ぎです。「この店に電話して。いや、先に地図で開いて」と話の途中で目的が変わることがあります。フルデュプレックスなら会話の修正は速くなります。スマホAgentは、通話先候補、地図アプリ、現在地、ナビ開始、画面上の確認を分けます。第四の場面として、複数手順の途中停止があります。ユーザーが「待って、今はやめて」と言った瞬間に、会話だけでなく実行タスクも止める必要があります。こうした実行ガードは、スマホ AI エージェント制御とは何か:Androidを任せる前に見るべき仕組みと安全性で扱うPhone Agentの中核です。
プライバシー、電池、視覚文脈、次に作るべきもの
全二重音声AIは魅力的ですが、スマホで使うには制約も見ます。マイクをいつ使うか、ユーザーがどう起動するか、周囲の声をどう扱うか、電池と発熱をどう抑えるか、ネットワーク遅延があるときにどう振る舞うか。FoneClawでは、現在の音声入力と現在画面の文脈をユーザー起動に結び付けています。ユーザーが依頼し、必要な文脈を渡し、提案と結果を見る。この形が、プライバシーと実用性のバランスを取りやすいと考えています。
視覚文脈も別の課題です。Seedの発表では、視覚入力やプロアクティブな対話が今後の方向として挙げられています。音声を聞きながら話すことと、画面やカメラの視覚情報をリアルタイムに理解して行動することは別の技術課題です。研究文脈では、VideoFDBの全二重音声視覚ベンチマークが、ストリーミング音声視覚のグラウンディングを独立した評価課題として扱っています。評価されたシステムが明示的な視覚質問以外で視覚ストリームを十分に使えていない傾向も指摘されています。
私たちが次に作るべきものは、会話モデルの速度だけに閉じません。ビルダーのチェックリストは、ユーザー起動の音声入力、明確な割り込み、現在画面の最小添付、権限確認、承認前の理由表示、実行後の検証、権限不足からの復旧、電池と遅延の観測です。SeedRealtimeやSeeduplexのような全二重音声AIは、スマホAgentの入口を自然にします。FoneClawは、その入口をAndroid上の安全な実行へつなげるレイヤーを育てています。