AI폰 L1-L4 지능 등급 해설: 중국 GB/Z 177-2026과 스마트폰 테스트 기준
중국 GB/Z 177-2026의 AI폰 L1-L4 지능 등급을 공식 명칭, 지침과 인증의 차이, 실제 스마트폰 테스트, FoneClaw의 관리형 Android 실행 예시로 정리합니다.
- GB/Z 177-2026은 2026년 4월 30일 공개된 중국의 AI 단말 지능 등급 지침이며, Part 3은 모바일 단말을 다룹니다. 이 문서만으로 특정 휴대폰이 공식 인증을 받았다고 말할 수는 없습니다.
- 공식 L1-L4 명칭은 L1 응답급, L2 도구급, L3 보조급, L4 협동급입니다. 등급이 올라갈수록 단순 답변에서 도구 사용, 과업 보조, 사용자와의 협동 실행으로 기대 행동이 넓어집니다.
- 스마트폰 지능 테스트는 같은 기기, 계정, 권한, 언어, 네트워크 조건에서 반복해야 합니다. 완료 여부와 함께 승인, 상태 확인, 실패 복구, 반복 가능성을 따로 기록해야 실제 차이가 보입니다.
- FoneClaw는 이 글 업데이트 시점의 최신 제품 정보 기준으로 플로팅 접근, 사용자가 요청하는 화면 맥락, 작업 연속성, 권한과 승인, 중지와 복구를 제공하는 독립 Android 실행 경로입니다. 우리는 이를 공식 등급 주장 대신 관찰 가능한 테스트 예시로 다룹니다.
GB/Z 177-2026의 범위부터 확인하기
AI폰 L1-L4 지능 등급을 볼 때 가장 먼저 정리할 것은 “표준이 나왔다”와 “내가 보는 휴대폰이 인증됐다”를 구분하는 일입니다. 중국 국가표준 공개 시스템의 GB/Z 177.1-2026 기록, GB/Z 177.2-2026 기록, GB/Z 177.3-2026 기록은 세 문서가 2026년 4월 30일 공개됐고 현재 상태임을 보여 줍니다. Part 1은 참조 프레임워크, Part 2는 일반 요구사항, Part 3은 모바일 단말을 다룹니다.
여기서 GB/Z는 중국 국가표준 체계 안의 지도성 기술문서, 즉 표준화 지침 성격으로 읽어야 합니다. 휴대폰 제조사가 “AI폰”을 말할 때 참고할 수 있는 공통 언어를 제공하지만, 그 자체가 모든 제품에 자동 적용되는 의무 법규나 특정 모델의 인증서가 되지는 않습니다. 따라서 어떤 제품 페이지가 L3 AI폰 또는 L4 AI폰 같은 표현을 쓰더라도, 사용자는 표준의 어느 부분을 근거로 하는지, 어떤 테스트 범위를 통과했다는 뜻인지, 누가 어떤 절차로 확인했는지를 따로 봐야 합니다.
중국 공업정보화부의 AI 단말 지능 등급 체계 발표는 이 시리즈가 2+N 구조를 갖는다고 설명합니다. 공통 프레임워크와 일반 요구사항 위에 모바일 단말 같은 구체 단말 범주가 붙는 방식입니다. 이 글에서는 Part 3의 모바일 단말 관점에 맞춰, 표준 명칭을 사용자가 직접 재현할 수 있는 스마트폰 테스트 언어로 바꿔 보겠습니다.
AI폰 L1-L4 공식 명칭과 의미
공식 발표가 제시한 네 단계 명칭은 L1 响应级, L2 工具级, L3 辅助级, L4 协同级입니다. 한국어로는 각각 L1 응답급, L2 도구급, L3 보조급, L4 협동급으로 이해하면 자연스럽습니다. 공업정보화부는 단계가 올라갈수록 지능 수준이 높아진다고 설명하지만, 공개 발표만으로 세부 점수표나 모든 테스트 임계값을 새로 만들어 말해서는 안 됩니다. 우리가 할 수 있는 일은 공식 이름을 유지하면서, 사용자가 관찰할 수 있는 행동 차이로 해석하는 것입니다.
| 등급 | 공식 명칭 | 사용자가 관찰할 행동 | 주의할 점 |
|---|---|---|---|
| L1 | 응답급 | 질문을 이해하고 답변, 요약, 설명을 제공한다 | 답을 잘해도 앱 실행이나 상태 변경까지 보장하지 않는다 |
| L2 | 도구급 | 알람, 설정, 검색, 앱 열기처럼 제한된 도구 또는 기능을 호출한다 | 도구 호출 가능성과 안전한 실행 품질은 따로 봐야 한다 |
| L3 | 보조급 | 사용자 목표를 여러 단계로 나누고 맥락을 유지하며 작업을 돕는다 | 한 번 성공한 데모보다 반복 가능한 과업 보조 증거가 중요하다 |
| L4 | 협동급 | 사용자와 계속 상호작용하며 상황 변화에 맞춰 계획, 실행, 확인을 조정한다 | 공식 발표는 L4가 산업 발전에 따라 계속 명확해지고 보완될 것이라고 설명한다 |
이 표는 공식 등급을 이해하기 위한 실무 해석입니다. L1은 “잘 대답하는가”에 가깝고, L2는 “도구를 쓸 수 있는가”를 봅니다. L3부터는 단순 기능 호출보다 흐름이 중요해집니다. 예를 들어 사용자가 “내일 오전 회의 준비해줘”라고 말했을 때 일정 확인, 관련 메시지 탐색, 메모 작성, 알림 설정 같은 여러 단계를 어느 정도 유지하며 돕는지를 봅니다. L4는 여기에서 더 나아가 사용자의 확인, 변경 요청, 중단, 재개, 상황 변화까지 함께 맞춰 가는 협동성을 요구합니다.
AI폰이라는 말이 넓어질수록 등급 용어는 마케팅 문구로 쉽게 쓰입니다. 그래서 우리는 FoneClaw에서 글을 쓸 때도 “이 기능이 L몇이다”라고 먼저 붙이지 않습니다. 대신 응답, 도구, 보조, 협동이라는 사다리를 놓고 실제 휴대폰에서 보이는 증거를 모읍니다. 에이전틱 AI 폰의 큰 흐름을 먼저 잡고 싶다면 에이전틱 AI 폰이란? 2026년 휴대폰 에이전트 흐름과 실제 기준에서 개념을 더 넓게 확인할 수 있습니다.
L3 보조와 L4 협동의 경계
L3 AI폰과 L4 AI폰의 차이는 “할 수 있는 기능이 몇 개인가”보다 “사용자와 함께 작업을 끝내는 방식”에서 갈립니다. L3 보조급을 현실적으로 보면, 휴대폰이 사용자의 목표를 이해하고 여러 단계로 나누며 필요한 도구나 앱을 연결해 과업을 돕는 수준입니다. 단일 질문 답변이나 버튼 한 번 대신, 일정 확인, 연락처 선택, 메시지 초안 작성, 설정 변경 전 확인처럼 앞뒤 맥락을 붙잡아야 합니다.
L4 협동급은 더 조심스럽게 읽어야 합니다. 공업정보화부 발표는 L4가 산업 발전에 따라 앞으로 더 명확해지고 보완될 것이라고 설명합니다. 이는 현재 공개된 L4라는 이름이 방향성을 제공하지만, 모든 제품에 적용할 수 있는 완성된 최종 체크리스트로 굳었다는 뜻은 아닙니다. 사용자가 “이 휴대폰은 L4인가?”라고 물을 때는 제품의 주장보다 반복 가능한 협동 증거를 봐야 합니다.
협동은 한 번의 자동화 성공으로 증명되지 않습니다. 사용자가 도중에 수신자를 바꾸거나, 권한을 거부하거나, 화면이 예상과 다르게 뜨거나, 네트워크가 느려지거나, 같은 요청을 다른 앱에서 다시 시작해도 흐름이 무너지지 않아야 합니다. 또한 사용자가 멈추라고 했을 때 멈추고, 실패했을 때 어디까지 진행됐는지 설명하고, 안전한 복구 경로를 제시해야 합니다. 이런 부분이 L3와 L4 논의에서 자주 빠지는 실제 품질입니다.
FoneClaw를 만들며 우리가 배운 것도 비슷합니다. 모델이 좋은 계획을 만들면 첫 단계는 좋아집니다. 그러나 폰 에이전트의 체감 품질은 현재 화면, 권한 상태, 앱 전환, 사용자 승인, 실패 후 복구가 맞물릴 때 생깁니다. 그래서 L3나 L4 같은 용어를 쓸 때는 “무슨 모델을 썼는가”보다 “어떤 조건에서 어떤 작업을 반복했는가”를 함께 적어야 합니다.
실제로 해보는 스마트폰 지능 테스트
스마트폰 지능 테스트는 공식 적합성 평가가 아닙니다. 다만 구매자, 제품팀, 개발자가 같은 휴대폰을 같은 조건에서 비교하는 데는 매우 유용합니다. 먼저 조건을 고정합니다. 같은 기기, 같은 OS 빌드, 같은 계정, 같은 언어, 같은 지역 설정, 같은 네트워크, 같은 앱 버전, 같은 권한 상태에서 시작합니다. 배터리 절약 모드, 접근성 권한, 알림 권한, 기본 어시스턴트 설정처럼 결과에 영향을 주는 항목도 기록합니다.
그다음 여섯 가지 작업을 순서대로 실행합니다. 각 작업은 완료 여부만 적지 말고, 확인 단계가 있었는지, 실행 후 상태를 검증했는지, 실패했을 때 복구했는지, 같은 조건에서 다시 성공했는지를 따로 기록합니다.
| 테스트 | 관찰하려는 등급 성격 | 예시 요청 | 기록할 증거 |
|---|---|---|---|
| 1. 응답 테스트 | L1 응답급 | 긴 알림이나 문서를 요약하고 다음 행동을 제안해 달라고 요청한다 | 답변 정확도, 누락, 환각, 사용자 언어 유지 |
| 2. 단일 도구 테스트 | L2 도구급 | 알람 설정, 볼륨 상태 확인, 특정 앱 열기처럼 낮은 위험 작업을 실행한다 | 권한 요청, 실행 결과, 후속 상태 확인 |
| 3. 현재 화면 테스트 | L2에서 L3로 넘어가는 입력 | 현재 화면을 바탕으로 무엇을 눌러야 하는지 묻는다 | 화면 맥락 이해, 민감 정보 처리, 잘못된 버튼 회피 |
| 4. 다단계 보조 테스트 | L3 보조급 | 회의 준비를 위해 일정 확인, 메모 작성, 알림 설정을 이어 달라고 요청한다 | 계획 분해, 단계 유지, 중간 확인, 결과 표시 |
| 5. 변경 요청 테스트 | L3에서 L4로 가는 협동성 | 작업 중간에 시간, 대상 앱, 메시지 문구를 바꾼다 | 재계획, 이전 상태 보존, 충돌 설명 |
| 6. 실패와 복구 테스트 | 안전성과 반복 가능성 | 필요 권한을 일부러 꺼 둔 상태에서 같은 작업을 요청한다 | 실패 위치, 복구 안내, 재시도 가능성, 사용자 통제 |
점수는 하나로 합치지 않는 편이 좋습니다. 응답 품질이 뛰어난 휴대폰이 도구 실행에는 약할 수 있고, 도구 호출은 빠르지만 실패 복구가 약할 수도 있습니다. 특히 L3 AI폰을 시험하려면 “여러 단계를 끝냈는가”와 “사용자가 이해 가능한 방식으로 끝냈는가”를 나눠 봐야 합니다. L4 AI폰 논의에서는 반복 테스트가 더 중요합니다. 같은 요청을 아침과 저녁, Wi-Fi와 모바일 네트워크, 권한 허용과 거부, 다른 앱 화면에서 다시 해 보면 협동성이 실제로 유지되는지 드러납니다.
더 깊은 벤치마크 설계가 필요하다면 안드로이드 폰 에이전트 벤치마크 가이드: 성공률보다 신뢰성을 평가하는 법에서 성공률, 회복률, 중단 처리, 상태 검증을 별도로 설계하는 방법을 이어서 볼 수 있습니다.
권한, 승인, 중지, 복구, 추적성 평가하기
AI폰 등급 표준을 제품 선택에 쓰려면 완료율만 보면 부족합니다. 휴대폰은 개인 메시지, 위치, 사진, 연락처, 결제, 업무 계정이 함께 있는 기기입니다. 그래서 지능이 높아질수록 더 많은 일을 자동으로 하는지가 아니라, 더 많은 일을 통제 가능한 방식으로 처리하는지가 핵심입니다.
첫 번째 증거는 권한 경계입니다. assistant나 에이전트가 어떤 데이터에 접근하는지, 어떤 기능은 읽기만 하는지, 어떤 기능은 실제 상태를 바꾸는지 구분해야 합니다. 두 번째 증거는 승인입니다. 메시지 전송, 이메일 발송, 일정 삭제, Wi-Fi 변경, 위치 공유, 앱 설치처럼 외부 효과가 생기는 작업은 실행 전 사용자가 대상과 결과를 확인할 수 있어야 합니다.
세 번째 증거는 중지와 재개입니다. 사용자가 작업 도중 “그만”이라고 말했을 때 다음 도구 호출이 멈추는지, 이미 진행된 단계와 남은 단계를 설명하는지 봅니다. 네 번째 증거는 복구입니다. 권한이 없거나 앱 화면이 예상과 다르거나 네트워크가 실패했을 때, 단순 오류 메시지로 끝내지 않고 사용자가 해결할 수 있는 설정 경로와 다음 단계를 보여 줘야 합니다. 마지막 증거는 추적성입니다. 사용자는 어떤 입력으로 어떤 행동이 제안됐고, 어떤 단계가 승인됐으며, 최종 상태가 무엇인지 확인할 수 있어야 합니다.
이런 기준은 L3와 L4 논의에서 특히 중요합니다. 보조와 협동은 더 많은 맥락을 다루고 더 긴 과업을 이어 가기 때문에 실패 가능성도 넓어집니다. 좋은 AI폰은 실패가 없는 척하지 않습니다. 실패를 좁게 만들고, 멈출 수 있게 하고, 사용자가 다시 통제권을 잡을 수 있게 만듭니다. 승인 화면과 복구 흐름을 제품 수준에서 설계하는 방법은 AI 에이전트 승인 UX: 신뢰도, 작업 이유, 확인과 복구를 설계하는 법에서 더 자세히 다룹니다.
FoneClaw로 보는 관리형 Android 실행 테스트
FoneClaw에서 우리는 이 표준을 제품에 붙일 마케팅 등급표로 보지 않습니다. 우리가 얻은 교훈은 더 실용적입니다. 사용자가 AI폰을 평가할 때 모델 답변과 Android 실행을 분리해 봐야 합니다. 모델은 의도와 계획을 만들고, 실행 런타임은 실제 휴대폰 위에서 권한, 승인, 현재 화면, 앱 상태, 중지, 복구를 다룹니다.
이 글 업데이트 시점의 최신 제품 정보 기준으로 FoneClaw는 다른 앱 위에서도 접근할 수 있는 이동식 플로팅 어시스턴트와, 사용자가 요청할 때 붙이는 현재 화면 맥락을 제공합니다. 사용자는 홈 화면에서 시작한 작업을 다른 앱 위의 플로팅 패널로 이어 갈 수 있고, 현재 화면을 맥락으로 붙여 “이 설정 화면에서 무엇을 확인해야 해?”처럼 물을 수 있습니다. 현재 앱은 FoneClaw 다운로드 페이지에서 확인할 수 있습니다.
실행 쪽에서는 작업 연속성, 권한과 승인, 중지, 권한 복구를 중요하게 다룹니다. 현재 제품은 요청의 성격에 따라 화면과 앱, 기기 상태와 시스템 제어, 위치와 길 안내, 통신, 캘린더, 메모, 작업·워크플로, 플러그인 같은 기능 경로를 구분해 처리합니다. 공개 기능 범위는 FoneClaw 기능 페이지에서 확인할 수 있으며, 지원되는 작업은 100+ built-in tools를 바탕으로 구성됩니다. 이 숫자보다 중요한 것은 사용자가 어떤 작업이 실행되는지 보고 승인하거나 멈출 수 있다는 점입니다.
FoneClaw를 스마트폰 지능 테스트에 넣는다면 공식 L1-L4 등급을 스스로 붙이지 않고, 관찰 가능한 Android 실행 경로로 사용합니다. 첫 테스트는 되돌리기 쉬운 작업이 좋습니다. 예를 들어 현재 설정 화면을 붙여 설명을 요청하고, 볼륨 상태를 확인하거나 DND 상태를 읽고, 필요한 경우 사용자가 승인한 범위에서 변경한 뒤 결과를 확인합니다. 이 흐름은 완료, 승인, 상태 검증, 중지 가능성, 권한 복구를 한 번에 볼 수 있습니다. OS 에이전트 구조 자체가 궁금하다면 OS 에이전트 기반: 2026년 휴대폰 AI 에이전트에 필요한 세 가지 층에서 모델, OS, 실행 런타임의 관계를 더 깊게 볼 수 있습니다.
구매자와 빌더를 위한 증거 체크리스트
AI폰을 고르거나 만들 때는 L1-L4 용어를 그대로 믿기보다 증거를 요구해야 합니다. 첫째, 어떤 표준의 어느 Part를 말하는지 확인합니다. 모바일 단말을 말한다면 GB/Z 177.3-2026의 범위와 연결돼야 합니다. 둘째, 지침인지 인증인지 구분합니다. GB/Z 177-2026은 공통 언어를 제공하지만, 특정 제품의 공식 등급 통과를 자동으로 증명하지 않습니다.
셋째, 작업 증거를 봅니다. 응답, 도구 호출, 현재 화면 이해, 다단계 보조, 변경 요청, 실패 복구를 같은 조건에서 반복했는지 확인합니다. 넷째, 제어 증거를 봅니다. 권한이 무엇을 여는지, 어떤 단계에서 승인이 필요한지, 중지와 재개가 가능한지, 실패 후 복구 경로가 보이는지 확인합니다. 다섯째, 업데이트 후 다시 시험합니다. AI폰의 행동은 기기, 계정, 권한, 언어, 지역, 소프트웨어 버전에 따라 달라질 수 있습니다.
빌더 입장에서는 이 체크리스트가 제품 요구사항이 됩니다. L1은 답변 품질, L2는 도구 계약, L3는 과업 흐름, L4는 사용자와의 협동 제어를 요구합니다. 구매자 입장에서는 같은 기준이 과장된 문구를 걸러 줍니다. 좋은 AI폰은 등급 이름을 크게 붙이는 제품이 아니라, 사용자가 같은 작업을 다시 해도 결과와 통제 흐름을 확인할 수 있는 제품입니다.