Стандарты ИИ-смартфонов
📅 2026-08-11 ⏱️ 12 мин Dean Dean

Уровни ИИ-смартфонов L1-L4: стандарт GB/Z 177-2026 и практический тест

Что означают уровни ИИ-смартфонов L1-L4 в GB/Z 177-2026, почему это руководство, а не сертификация, и как проверить ИИ-смартфон на реальных задачах.

Схема уровней ИИ-смартфона L1-L4 и практического теста мобильного терминала
📋 Ключевые выводы
  • GB/Z 177-2026 — это серия руководящих технических документов национальной стандартизации Китая для AI-терминалов; часть 3 относится к mobile terminals и не превращает рыночные заявления в автоматическую сертификацию.
  • Официальная лестница уровней описывает рост интеллекта от L1 response до L4 collaboration: L1 отвечает, L2 использует инструменты, L3 помогает выполнять задачу, L4 переходит к более совместной работе человека и устройства.
  • L4 остается развивающейся зоной: MIIT прямо указывает, что этот уровень будет уточняться и улучшаться по мере развития отрасли, поэтому одно демо не доказывает полноценный L4.
  • FoneClaw можно использовать как управляемый Android-маршрут для практического теста: floating access, экранный контекст по запросу пользователя, task continuity, approvals, stopping, recovery и 100+ built-in tools помогают оценивать выполнение без самоприсвоения уровня.

Что такое GB/Z 177-2026 и где здесь смартфоны

Уровни ИИ-смартфонов L1-L4 в 2026 году стоит начинать не с рекламных ярлыков, а с источника. В Китае опубликована серия GB/Z 177-2026 для интеллектуальной классификации AI-терминалов. По записям SAMR, GB/Z 177.1-2026 задает reference framework, GB/Z 177.2-2026 описывает general requirements, а GB/Z 177.3-2026 относится к mobile terminal. Все три записи опубликованы 30 апреля 2026 года и имеют текущий статус.

Ключевая деталь в обозначении GB/Z: это руководящий технический документ национальной стандартизации, а не автоматический знак соответствия на коробке телефона. Для покупателя это меняет тон разговора. Если производитель говорит про L3 или L4, полезно спросить: к какой части GB/Z 177 он привязывает заявление, какой сценарий тестировался, какие условия были одинаковыми, кто фиксировал результат и где опубликованы критерии.

MIIT в анонсе серии по AI-терминалам описывает архитектуру 2+N: базовые части плюс расширение по категориям терминалов. Первый набор охватывает семь типов терминалов, а mobile terminal — это именно та часть, которая интересует владельцев смартфонов, разработчиков Android-агентов и производителей устройств.

Практический вывод простой: стандарт ИИ-смартфонов дает общий язык для сравнения, но уровень нужно доказывать наблюдаемым поведением. Телефон должен не только отвечать красиво, но и работать с контекстом, инструментами, приложениями, разрешениями, подтверждениями, остановкой и восстановлением. Именно эту разницу мы используем ниже, чтобы превратить официальную лестницу L1-L4 в воспроизводимый полевой тест.

Официальные уровни L1-L4 простым языком

MIIT приводит четыре официальных названия уровней: L1 响应级, L2 工具级, L3 辅助级, L4 协同级. По смыслу это можно передать так: L1 — уровень ответа, L2 — уровень инструмента, L3 — уровень помощи, L4 — уровень совместной работы. Важно не превращать эти названия в выдуманную шкалу автономности. Документ задает направление роста интеллекта, а практическая оценка требует конкретного набора задач и доказательств.

УровеньЕстественное пониманиеЧто видно пользователюЧто еще не доказывает уровень
L1 responseТелефон отвечает на запрос и объясняет информацию.Пользователь получает текст, голосовой ответ, краткое объяснение или подсказку.Хороший ответ сам по себе не означает выполнение действия.
L2 toolСистема использует конкретный инструмент или функцию.Ассистент вызывает поиск, камеру, перевод, настройку, календарь или другое поддерживаемое действие.Один успешный вызов инструмента не доказывает устойчивую помощь в задаче.
L3 assistanceТелефон помогает довести задачу до результата.Появляется план, контекст, промежуточные шаги, проверка состояния и пользовательское подтверждение.Нужна повторяемость, а не разовая демонстрация.
L4 collaborationУстройство работает с пользователем как партнер в более длинном процессе.Контекст сохраняется, шаги согласуются, система адаптируется, предлагает следующий ход и помогает восстановиться.MIIT указывает, что L4 будет уточняться по мере развития отрасли.

L1 проще всего узнать: вы задаете вопрос и получаете ответ. Это уже может быть полезно для поиска, объяснения текста, перевода, разбора изображения или краткой консультации по экрану. Но телефон остается в основном отвечающим интерфейсом.

L2 начинается там, где ответ соединяется с инструментом. Например, ассистент открывает камеру, создает напоминание, включает поддерживаемую настройку, ищет место на карте или читает системное состояние. Здесь появляется действие, но действие еще не равно зрелому агенту.

L3 интересен покупателям сильнее всего, потому что он ближе к ежедневной пользе. ИИ-смартфон L3 должен помогать с задачей, удерживать контекст, разбивать запрос на шаги, показывать состояние и не терять пользователя при разрешениях или ошибках. L4 еще выше: там телефон и человек работают вместе в более протяженной цепочке, где устройство не просто исполняет команду, а поддерживает совместный процесс.

Если вам нужно базовое определение агентного телефона без погружения в китайскую стандартизацию, рядом полезен наш материал Агентный AI-смартфон в 2026 году: что это значит для телефона и FoneClaw. В этой статье мы держим фокус на GB/Z 177-2026 и проверяемом поведении смартфона.

Граница между полезной помощью и совместной работой

Главная ошибка в разговоре об ИИ-смартфоне L3 или ИИ-смартфоне L4 — делать вывод по одному яркому ролику. Ассистент может один раз открыть приложение, ответить по экрану или подготовить сообщение, но уровень интеллекта проявляется в повторяемости. Нужно смотреть, как телефон ведет себя на разных задачах, с разными разрешениями, в длинной цепочке и после сбоя.

L3 можно представить как полезную поддержку: пользователь формулирует цель, телефон понимает контекст, предлагает план, вызывает нужные возможности, показывает промежуточный результат и просит подтверждение там, где действие меняет данные, сообщения, настройки или внешнюю среду. Для L3 важны не только рассуждение и tool use, но и continuity: система должна помнить, что уже сделано, что осталось, какой экран открыт и какой шаг требует решения пользователя.

L4 — более сильная идея. Здесь телефон не просто помогает выполнить отдельную задачу, а работает вместе с пользователем: уточняет намерение, держит несколько зависимостей, предлагает следующий шаг, адаптируется к новой информации, объясняет свои действия и возвращает задачу в рабочее состояние после прерывания. Такой уровень нельзя надежно подтвердить одной функцией вроде «сделай сводку» или «открой настройку».

MIIT отдельно отмечает, что L4 будет дальше уточняться и улучшаться по мере развития индустрии. Это честный сигнал рынку: термин «collaboration» важен, но границы зрелого L4 еще будут настраиваться. Поэтому покупателю и разработчику лучше говорить не «этот телефон точно L4», а «вот тестовый набор, вот условия, вот результаты по completion, control, verification, recovery и repeatability».

Для архитектурного фона здесь полезна статья Основа OS-агента: три слоя, без которых телефонный AI-агент не станет полезным. Она помогает понять, почему модель, слой ОС и исполнительный слой должны работать вместе, если мы хотим двигаться от L2-инструментов к L3-помощи и будущей L4-совместной работе.

Практический тест интеллекта ИИ-смартфона

Полевой тест не заменяет официальную оценку соответствия. Его задача другая: дать покупателю, журналисту, разработчику или продуктовой команде одинаковый способ проверить, что телефон реально делает. Мы используем этот подход и в собственной работе над FoneClaw: сначала фиксируем задачу и условия, потом отдельно смотрим на результат, контроль, проверку состояния, восстановление и повторяемость.

Настройте тест аккуратно. Используйте один и тот же смартфон, аккаунт, язык, сеть, версию системы, версию приложения, набор разрешений и начальный экран. Перед каждым прогоном записывайте, какие permissions включены, какой ассистент активен, есть ли доступ к экрану, какие приложения участвуют и какая задача считается успешной. Если условия меняются, сравнение теряет смысл.

ТестЧто проситьЧто измерятьКакой уровень проявляется
ОтветОбъясни, что означает уведомление или текст на экране.Точность, понятность, ссылка на видимый контекст.L1 response
ИнструментОткрой карту, камеру, календарь или поддерживаемую настройку.Правильный инструмент, permission flow, видимый результат.L2 tool
Экранный контекстПроанализируй текущий экран и предложи следующий безопасный шаг.Понимание экрана, ограничение домыслов, полезность шага.Переход к L3
Многошаговая помощьПодготовь встречу: проверь календарь, настрой телефон, создай черновик сообщения.План, порядок шагов, подтверждения, состояние после каждого действия.L3 assistance
ПрерываниеОстанови задачу на середине, затем продолжи или восстанови ее.Stop, resume, recovery, ясность того, что уже сделано.L3 зрелость
Совместная работаВеди меня через задачу с изменяющимися условиями и предлагай варианты.Адаптация, объяснение причин, согласование действий, повторяемость.Кандидат на L4

Результаты лучше фиксировать не одним общим баллом, а пятью колонками. Completion показывает, завершилась ли задача. Control показывает, где пользователь видел разрешения, approvals и stop. Verification показывает, проверил ли телефон итоговое состояние. Recovery показывает, что случилось после отказа permission, ошибки приложения или остановки. Repeatability показывает, повторяется ли результат хотя бы в нескольких прогонах.

Такой тест интеллекта смартфона полезен тем, что он убирает магию из слова «AI». Телефон может быть сильным в L1-ответах и слабым в L2-инструментах. Он может хорошо понимать экран, но плохо восстанавливаться после ошибки. Он может выглядеть впечатляюще в демо и проваливаться на повторяемости. Для более подробной методики оценки Android-агентов мы сделали отдельный guide Бенчмарк телефонных агентов Android: как оценивать ИИ-агента в 2026 году.

Разрешения, подтверждения, остановка и восстановление

В реальном телефоне качество интеллекта видно не только в успешном завершении задачи. Оно видно в управляемом отказе. Если ассистент хочет отправить сообщение, изменить настройку, создать событие, открыть маршрут или взаимодействовать с приложением, пользователь должен видеть, что будет сделано, какие данные участвуют и где можно остановиться.

Permission boundary — первый слой доказательств. Телефон должен ясно показать, когда ему нужен доступ к экрану, камере, календарю, уведомлениям, контактам, местоположению или системной настройке. Разрешение само по себе не делает действие безопасным: после него нужен понятный workflow, где ассистент не теряет контекст и не выполняет чувствительный шаг без подтверждения.

Approval — второй слой. Для consequential actions важно видеть цель и результат до внешнего эффекта. Черновик сообщения должен быть видимым до отправки. Изменение настройки должно показывать состояние после действия. Навигация должна открывать маршрут, который пользователь может проверить. Покупка, удаление, отправка и публикация требуют особенно ясной точки подтверждения.

Третий слой — interruption и recovery. Хороший телефонный агент умеет остановиться, объяснить, что уже сделано, и продолжить без хаоса. Если разрешение отсутствует, он должен привести пользователя к нужному экрану или предложить безопасный fallback. Если приложение изменило UI, оценка должна фиксировать не только ошибку, но и то, как система вернулась к задаче.

В FoneClaw мы относим это к основам доверия в phone-agent UX. Подробно интерфейс подтверждений, объяснение уверенности и восстановление после неудачного шага мы разбираем в статье Интерфейс подтверждения действий ИИ-агента на телефоне: уверенность, причины и восстановление. Для L1-L4 это важно потому, что более высокий уровень без контроля не становится полезнее в повседневной жизни.

FoneClaw как управляемый Android-маршрут теста

В FoneClaw мы строим не ярлык уровня, а проверяемый путь Android-действий. По актуальной информации о продукте на момент обновления статьи, FoneClaw поддерживает floating access поверх других приложений, прикрепление текущего экрана по запросу пользователя, task continuity между основным экраном и floating assistant, approvals, stopping, permission recovery и capability routing. Эти возможности удобно использовать как ungraded example: они помогают провести тест, но мы не присваиваем FoneClaw формальный уровень L1-L4.

Практически это выглядит так. Пользователь открывает нужный экран, вызывает movable floating assistant, прикрепляет экранный контекст только когда сам этого хочет, задает задачу и видит, какие шаги поддержаны. Если действие требует разрешения, FoneClaw ведет пользователя через permission flow. Если шаг влияет на сообщения, настройки или данные, workflow сохраняет approval point. Если задачу нужно остановить, остановка остается частью сценария, а recovery возвращает пользователя к понятному состоянию.

Текущие возможности FoneClaw раскрываются именно в тех местах, где полевая оценка часто ломается: между пониманием намерения и выполнением на телефоне. У нас есть 100+ built-in tools для поддерживаемых Android action areas, но важнее не число, а управляемая маршрутизация: какой capability подходит задаче, где нужен доступ, где требуется подтверждение, что считается успешным состоянием и как восстановиться после сбоя. Актуальные возможности мы описываем на странице функций FoneClaw, а текущий путь установки ведем через страницу загрузки FoneClaw.

Для первого теста берите обратимую задачу. Например: открыть календарь, проверить текущий экран, подготовить черновик заметки, включить безопасную поддерживаемую настройку, затем остановить выполнение и продолжить. Такой сценарий не доказывает официальный L3, зато показывает самое важное для пользователя: понимает ли агент контекст, сохраняет ли задачу, показывает ли результат, просит ли approval и восстанавливается ли после missing permission.

Мы движемся к тому, чтобы оценка телефонного AI была менее театральной и более инженерной. Чем больше рынок говорит про уровни ИИ-смартфонов L1-L4, тем важнее смотреть на observable behavior: что телефон сделал, что показал, где пользователь сохранил контроль и как система вернулась к задаче после ошибки.

Чек-лист для покупки и разработки ИИ-смартфона

Если вы выбираете ИИ-смартфон, не начинайте с самого высокого заявленного уровня. Начните с доказательств. Спросите, к какой части GB/Z 177-2026 относится заявление, какая категория терминала тестировалась, какие функции включены, какие языки и регионы поддержаны, какие permissions нужны и какие задачи воспроизводятся на обычном устройстве, а не только на сцене.

  • Проверьте scope: mobile terminal, конкретная версия системы, устройство, аккаунт, язык и регион.
  • Попросите повторяемый набор задач: ответ, инструмент, экранный контекст, многошаговая помощь, прерывание и совместная работа.
  • Разделите результат на completion, control, verification, recovery и repeatability.
  • Смотрите на approval для сообщений, покупок, файлов, настроек и любых внешних эффектов.
  • Перетестируйте после обновлений: поведение AI-функций меняется вместе с системой, приложениями и доступностью.

Если вы строите телефонный AI-агент, чек-лист еще строже. Уровень должен вытекать из поведения продукта, а не из названия модели. Нужны устойчивый контекст, понятные capability boundaries, видимый результат, остановка, recovery и следы того, как задача пришла к итоговому состоянию. Тогда стандарт ИИ-смартфонов становится не лозунгом, а рабочим языком для продукта.

Итог: GB/Z 177-2026 помогает рынку говорить об интеллектах AI-терминалов одним словарем. L1-L4 полезны как лестница, но покупатель и разработчик выигрывают только тогда, когда уровень связан с воспроизводимым тестом. Для нас в FoneClaw это подтверждает направление: телефонный AI должен не только отвечать, но и выполнять поддерживаемые Android-действия с контекстом, контролем и восстановлением.

Частые вопросы

В официальной лестнице L1 — response, L2 — tool, L3 — assistance, L4 — collaboration. По смыслу это рост от ответа на запрос к использованию инструментов, помощи в задаче и более совместной работе пользователя с телефоном.
GB/Z 177-2026 относится к руководящим техническим документам национальной стандартизации Китая. Он задает язык и рамку для оценки AI-терминалов, но сам по себе не означает, что любой названный телефон автоматически сертифицирован как L3 или L4.
Проверьте многошаговую задачу на одном устройстве, аккаунте, языке, сети и наборе разрешений. Отдельно фиксируйте completion, control, verification, recovery и repeatability: телефон должен не только ответить, но и помочь довести задачу до видимого результата.
MIIT указывает, что L4 collaboration будет дальше уточняться и улучшаться по мере развития отрасли. Это значит, что L4 стоит оценивать по воспроизводимым сценариям совместной работы, а не по одному демо или маркетинговой формулировке.
FoneClaw дает управляемый Android-маршрут для практического теста: floating access, экранный контекст по запросу пользователя, task continuity, approvals, stopping, permission recovery, capability routing и 100+ built-in tools. Мы используем это как проверяемый пример выполнения, не присваивая продукту формальный уровень L1-L4.