AIスマホ L1-L4知能レベル:GB/Z 177-2026と実機テストの見方
中国のGB/Z 177-2026が示すAIスマホのL1-L4知能レベルを、公式名称、認証との違い、再現可能なスマホ知能テスト、FoneClawのAndroid実行例で整理します。
- GB/Z 177.1、177.2、177.3は2026年4月30日に公開されたAI端末知能レベルの標準化指導技術文書で、Part 3がモバイル端末を扱います。
- 公式のAIスマホ L1-L4 知能レベルは、L1 响应级、L2 工具级、L3 辅助级、L4 协同级の四段階で、段階が上がるほど知能化の範囲が広がると説明されています。
- GB/Z 177-2026は、それだけで個別スマホの認証済みレベルを示すものではありません。実機評価では、完了、確認、状態検証、復旧、再現性を分けて記録します。
- FoneClawは、正式なL1-L4格付けではなく、フローティング入口、ユーザー操作による現在画面の添付、タスク継続、承認、停止、権限回復を備えたAndroid実行テストの一例として使えます。
GB/Z 177-2026の位置づけと対象範囲
AIスマホ L1-L4 知能レベルを読む時は、まず文書の性格を押さえる必要があります。中国の国家標準情報公開サービスでは、GB/Z 177.1-2026の記録がReference framework、GB/Z 177.2-2026の記録がGeneral requirements、GB/Z 177.3-2026の記録がMobile terminalとして公開されています。いずれも2026年4月30日に公開され、現行文書として扱われています。
ここで重要なのは、GB/Zが国家標準化指導技術文書として位置づけられている点です。つまり、読者がスマホを選ぶ時に使える評価の言葉は得られますが、この文書名だけで「この端末は公式にL3」「この機種はL4認証済み」と判断できるわけではありません。AIスマホ評価基準として使うなら、どの文書のどの範囲を参照し、どの端末、どの機能、どのテスト条件で観察したのかを一緒に残します。
MIITのAI端末知能レベル標準シリーズの発表では、このシリーズが「2+N」の構成を取ること、最初の対象が七つの端末カテゴリに及ぶことが説明されています。Part 3がモバイル端末を扱うため、スマホ知能テストを作る時の入口になります。ただし、私たちがこの記事で行うのは、公式文書の代わりに合否を出すことではなく、読者が手元のスマホで再現できる観察方法へ落とすことです。
AIスマホ L1-L4 知能レベルの公式名称
MIITの発表で示された公式レベル名は、L1 响应级、L2 工具级、L3 辅助级、L4 协同级です。日本語で理解するなら、L1は応答レベル、L2はツールレベル、L3は支援レベル、L4は協同レベルと捉えると自然です。発表では、レベルが上がるほど知能化の度合いが高まると説明されています。ここでの読み方は、単にモデルが大きいか、返答が長いかではありません。端末が文脈を扱い、道具を使い、作業を分解し、ユーザーと一緒に進められるかを見ます。
| 公式レベル名 | 日本語での見方 | 実機で観察する行動 | 過大評価しやすい点 |
|---|---|---|---|
| L1 响应级 | 応答レベル | 質問に答える、短い説明を返す、ユーザー入力に反応する | 返答が自然なだけでスマホ操作能力まであると見なすこと |
| L2 工具级 | ツールレベル | 検索、要約、翻訳、設定画面の呼び出しなど、特定の道具や機能につなぐ | 単発ツールが動いたことを複数手順の支援と混同すること |
| L3 辅助级 | 支援レベル | 目的を理解し、手順を分け、権限や確認を挟みながら作業を補助する | 一回の成功デモだけで安定したL3相当と見ること |
| L4 协同级 | 協同レベル | ユーザーとAIが役割を分け、状況変化や中断を扱いながら継続的に作業する | 完全自律や無確認実行と取り違えること |
L1からL4は、マーケティング用の便利な飾りではなく、観察する行動を整理するための階段です。L1は会話の応答が中心です。L2では、端末機能やアプリ機能を道具として呼び出す意味が出ます。L3になると、単発の実行よりも、目的理解、手順化、文脈維持、ユーザー確認、失敗時の戻り方が重要になります。L4では、人とAIが同じ作業空間を共有し、AIが勝手に進むのではなく、ユーザーの判断とAIの支援が組み合わさる方向へ進みます。
この表は、公式文書の細かな試験手順を置き換えるものではありません。読者がAIスマホ評価基準を読む時に、どの行動を見ればよいかを整理するための実用的な翻訳です。エージェント型AIスマホという言葉自体を先に整理したい場合は、エージェント型AIスマホとは何か:2026年の端末AIとFoneClawの見方で、端末AIと電話側実行の違いを別の角度から説明しています。
L3の支援とL4の協同を分けて見る
L3 AIスマホをどうテストするかを考える時、最初に避けたいのは「一つのデモが成功したからL3」と決めることです。L3の支援らしさは、ユーザーの目的を理解し、必要な画面やアプリをまたぎ、途中で確認を挟み、権限やエラーが出た時に説明しながら作業を進めるところに現れます。たとえば、会議に遅れる連絡を準備する場合、遅延理由の文面を作るだけならL1やL2に近い観察です。相手、移動状況、メッセージ下書き、送信前確認、リマインダーまで分けて進めるなら、支援の質を見られます。
L4 AIスマホはさらに慎重に読みます。MIITは、L4について、産業の発展に合わせて今後さらに明確化し、改善していく趣旨を示しています。これは、L4を空想の領域に置くという意味ではありません。むしろ、協同レベルの評価には、ユーザーとの役割分担、長い作業の維持、状況変化への対応、手動への引き取り、権限と承認の扱いなど、実機で検証すべき要素が多いということです。
私たちは、L3とL4の境界を「便利な支援」と「継続的な協同」の違いとして見ます。L3では、AIがユーザーの作業をかなり助けます。L4では、ユーザーとAIが同じ目的に向けて、複数の状態、判断、確認、復旧をまたいで一緒に進む必要があります。ここでは、AIの自律性が高いほど良い、という単純な見方は危険です。スマホには連絡先、決済、位置情報、写真、メール、カレンダー、仕事の資料があり、協同には制御の見え方が不可欠です。
したがって、レベルを語るなら、繰り返し可能なテストと観察記録を持ちます。どの端末、どのアカウント、どの言語、どの地域、どの権限、どのアプリ、どのネットワークで試したか。成功だけでなく、途中停止、権限不足、手動引き取り、再開、結果確認まで記録します。詳細なベンチマーク設計は、Androidスマホエージェント ベンチマーク:2026年の評価指標と再現可能なテスト設計で扱い、このページではL1-L4の読み方に合わせた実用テストに絞ります。
再現できるスマホ知能テストを行う
スマホ知能テストは、公式適合性評価ではなく、購入前、導入前、開発中に同じ条件で比較するためのフィールドテストとして設計します。まず条件を固定します。同じ端末、同じOSビルド、同じアカウント、同じ言語、同じ地域、同じネットワーク、同じ権限状態で行います。次に、結果を一つの点数にまとめすぎず、完了、制御、状態検証、復旧、再現性を別々に記録します。
| テスト | 狙い | 依頼例 | 記録する観察 |
|---|---|---|---|
| 1. 応答 | L1 响应级の入口を見る | 「この予定の要点を短く説明して」 | 回答の正確さ、根拠、不要な操作をしないこと |
| 2. 単発ツール | L2 工具级の道具利用を見る | 「明日8時にアラームを準備して」 | 必要な権限、確認、設定後の状態表示 |
| 3. 画面文脈 | 表示中の内容を扱えるかを見る | 「この画面の意味を説明して、次に確認する項目を出して」 | 共有範囲、読み取り精度、個人情報への配慮 |
| 4. 複数手順支援 | L3 AIスマホに近い支援を見る | 「会議に遅れるので、相手への下書きとリマインダーを準備して」 | 手順分解、下書き、承認、タスク継続 |
| 5. 中断と復旧 | 停止、権限不足、再開を見る | 途中で権限を外す、画面を切り替える、停止を指示する | どこで止まったか、説明、復旧経路、手動引き取り |
| 6. 協同シナリオ | L4 AIスマホの検討材料を見る | 「旅行準備を、調べる、メモする、予定に入れる候補まで一緒に進めて」 | 役割分担、確認のタイミング、長い文脈、再現性 |
この六つのテストを行うと、単なる会話能力と電話側の実行能力を分けて見られます。応答がよくても、権限が必要な操作で説明が弱い場合があります。単発ツールが動いても、画面が変わった瞬間に文脈を失う場合があります。複数手順が一度通っても、同じ条件で二回目に失敗するなら、日常利用の信頼性はまだ弱いと判断します。
観察欄では、成功と失敗を同じ重さで残します。完了したか。ユーザーが承認したか。実行後の状態を確認したか。途中で止められたか。権限不足の時に戻れるか。同じ依頼を別の日に再現できるか。これらを分けることで、AIスマホ評価基準を「賢そうなデモ」から「使える端末体験」へ変換できます。
権限、承認、中断、復旧、追跡性を見る
AIスマホの評価では、タスクが完了したかだけを見ると危険です。スマホ上の操作には、連絡、送信、共有、削除、購入、予定変更、位置情報、写真、メール、通知、設定変更が含まれます。便利なAIほど、操作前の確認、操作後の状態、途中停止、復旧の道筋が重要になります。L3やL4に近い体験を語るなら、成功例だけでなく、制御された失敗も評価に入れます。
権限は第一の証拠です。AIが何を読めるのか、何を変更できるのか、どの権限が必要なのかが見えると、ユーザーは納得して進められます。ただし、権限があるだけで十分ではありません。送信、発信、共有、削除、予定変更のような外部影響のある操作では、承認の画面、対象、内容、結果の表示が必要です。承認UIの詳細を深く見たい場合は、AIエージェント承認UI設計:提案、信頼度、理由、タスク状態をスマホでどう見せるかが役立ちます。
中断と復旧も、実機評価で差が出ます。AIが途中で止まった時、ユーザーが何を承認していないか、どのステップが残っているか、どの画面に戻ればよいかを理解できる必要があります。権限が足りない場合は、ただ失敗するだけではなく、必要な設定へ案内し、戻った後に同じタスクを続けられるかを見ます。状態確認も重要です。音量を変えた、アラームを準備した、メモを作った、という結果は、操作後の状態を確認して初めて評価できます。
追跡性は、購入者にも開発者にも効きます。どの依頼で、どの画面を使い、どの承認を通し、どの結果が残ったのかが分かるほど、失敗時に原因を切り分けられます。高度なAIスマホほど、ユーザーが任せた作業の足取りを見られることが価値になります。
FoneClawをAndroid実行テストの経路として使う
FoneClawでは、私たちはAIスマホの価値を、会話の賢さだけでなく、Android上で見える形で操作へ移せるかで見ています。この記事の更新時点で確認できる最新の製品情報では、FoneClawは動かせるフローティングアシスタント、ユーザーが必要な時に添付する現在画面の文脈、Homeとフローティングアシスタントをまたぐタスク継続を備えています。対応済み操作は、権限、承認、状態確認、停止、権限回復の流れに沿って進みます。
これは正式なL1-L4格付けの主張ではありません。FoneClawを使う価値は、読者が自分のAndroid端末で、同じ依頼を小さく試せることにあります。たとえば、現在画面をユーザー操作で添付し、画面の意味を確認する。音量やDNDの状態を読み、必要なら変更前に承認する。短いメモやリマインダーを準備し、結果を確認する。途中で停止し、権限が足りない場面で復旧できるかを見る。こうした観察は、L3 AIスマホの支援らしさを考える時の実用的な材料になります。
FoneClawの現在の能力は、FoneClawの機能一覧で100+ built-in toolsとして確認できます。導入や最新の配布情報はFoneClawのダウンロードから確認できます。私たちは、ツールの数を競うより、対応済みの操作がどの権限で動き、どこで承認し、どう止まり、どう復旧するかを見える形にすることを重視しています。現在の機能ルーティングも、ユーザーの意図、画面文脈、対応済み能力、必要な承認を整理し、次に進める操作を分かりやすくするために使います。
最初のテストは低リスクにします。現在画面の説明、DNDや音量の確認、短いメモの作成、戻しやすい設定確認から始めます。いきなり送信、削除、購入、発信のような影響の大きい操作を試すより、見える結果、承認、停止、復旧の流れを先に確認するほうが、AIスマホ評価基準を自分の端末体験に落とし込みやすくなります。
購入者と開発者が確認すべき証拠
AIスマホを選ぶ人も、AI端末を作る人も、レベル名をそのまま信じるより、証拠を求める姿勢が大切です。レベル表現を使うなら、どの標準文書のどのPartを参照しているか、どの端末カテゴリを対象にしているか、どのテスト範囲で言っているかを確認します。GB/Z 177-2026の言葉は便利ですが、マーケティング文の短いラベルだけでは、実機の挙動を判断できません。
- 参照している文書がGB/Z 177.1、177.2、177.3のどれかを確認する。
- 評価対象が端末全体なのか、音声アシスタントなのか、特定アプリなのかを分ける。
- L1からL4の公式名称と、実際に観察した行動を対応づける。
- 同じ端末、アカウント、権限、言語、地域、ネットワークで再テストする。
- 完了率だけでなく、承認、状態確認、停止、復旧、再現性を記録する。
- アップデート後は同じスマホ知能テストをもう一度行う。
開発者にとっては、モデル、アプリ連携、信頼の見える面を分けることも重要です。OSエージェントの設計をより広く見る場合は、OSエージェント基盤に必要な3層構造:モデル、アプリ連携、信頼の見える面が隣接する読み物になります。購入者にとっての結論は、単純です。AIスマホ L1-L4 知能レベルは、端末選びの強い手がかりになります。ただし、最後に信じるべきなのは、手元の端末で同じ条件のもと、見える結果と制御を確認できるかどうかです。