Tiêu chuẩn điện thoại AI
📅 2026-08-11 ⏱️ 12 phút Dean Dean

Cấp độ thông minh điện thoại AI L1-L4: cách đọc GB/Z 177-2026

Giải thích khung L1-L4 cho điện thoại AI trong GB/Z 177-2026, cách phân biệt hướng dẫn với chứng nhận và cách tự kiểm tra smartphone AI bằng bằng chứng thực tế.

Khung đánh giá điện thoại AI L1 đến L4 với các bước kiểm tra tác vụ, quyền, xác nhận và phục hồi trên smartphone
📋 Điểm chính
  • GB/Z 177-2026 là bộ tài liệu hướng dẫn tiêu chuẩn hóa về cấp độ thông minh của AI terminal, trong đó phần 3 áp dụng cho mobile terminal và không tự động là chứng nhận sản phẩm.
  • Bốn cấp chính thức là L1 phản hồi, L2 công cụ, L3 hỗ trợ và L4 phối hợp; mức thông minh tăng dần nhưng không nên biến tên cấp thành lời quảng cáo thiếu bằng chứng.
  • Một bài kiểm tra điện thoại AI cần tách riêng hoàn thành tác vụ, kiểm soát, xác minh trạng thái, phục hồi lỗi và độ lặp lại thay vì chỉ chấm một điểm tổng.
  • FoneClaw là ví dụ chưa tự xếp hạng về lối thực thi Android có quản trị: truy cập nổi, ngữ cảnh màn hình do người dùng kích hoạt, mạch tác vụ, phê duyệt, dừng, phục hồi và định tuyến năng lực.

GB/Z 177-2026 là gì và áp dụng tới đâu

Cấp độ thông minh điện thoại AI L1-L4 bắt đầu từ một điểm cần nói rõ: GB/Z 177-2026 là tài liệu hướng dẫn tiêu chuẩn hóa quốc gia của Trung Quốc cho AI terminal, không phải một nhãn chứng nhận tự động cho mọi điện thoại được quảng cáo là AI phone. Theo các bản ghi chính thức của SAMR và SAC, GB/Z 177.1-2026, GB/Z 177.2-2026 và GB/Z 177.3-2026 được công bố ngày 30 tháng 4 năm 2026; phần 1 là khung tham chiếu, phần 2 là yêu cầu chung, còn phần 3 áp dụng cho mobile terminal.

Cụ thể, bản ghi GB/Z 177.1-2026 của SAMR đặt phần 1 ở vai trò reference framework. bản ghi GB/Z 177.2-2026 của SAMR cho thấy phần 2 là general requirements. Với điện thoại, tài liệu cần đọc đúng là bản ghi GB/Z 177.3-2026 cho mobile terminal.

Điểm chữ GB/Z rất quan trọng. Đây là tài liệu hướng dẫn kỹ thuật tiêu chuẩn hóa, nên cách dùng cẩn trọng là nói về khung tham chiếu, phạm vi đánh giá và ngôn ngữ cấp độ. Khi một hãng nói điện thoại có năng lực L3 hoặc L4, người mua nên hỏi: theo phần nào của GB/Z 177-2026, thử trong phạm vi tác vụ nào, bằng phương pháp nào, kết quả có lặp lại không, và có tổ chức đánh giá nào đứng sau không? Không có các thông tin đó, tên cấp chỉ là tín hiệu để tìm hiểu tiếp.

Bốn cấp L1-L4 nghĩa là gì

Thông báo của MIIT về chuỗi phân cấp AI terminal mô tả kiến trúc 2+N và nêu bốn cấp chính thức: L1 响应级, L2 工具级, L3 辅助级, L4 协同级. Có thể diễn giải tự nhiên sang tiếng Việt là L1 phản hồi, L2 công cụ, L3 hỗ trợ và L4 phối hợp. MIIT cũng nói mức độ thông minh tăng dần theo cấp, nhưng không đưa cho người đọc phổ thông một bảng điểm đơn giản để tự dán nhãn cho mọi sản phẩm.

CấpTên chính thứcCách hiểu thực tếBằng chứng nên tìm
L1Phản hồiThiết bị hiểu yêu cầu đơn giản và trả lời hoặc phản ứng ở mức cơ bản.Câu trả lời đúng, có liên quan, ổn định với cùng một yêu cầu.
L2Công cụThiết bị dùng được công cụ hoặc chức năng cụ thể để hoàn thành bước rõ ràng.Mở app, gọi chức năng, đổi một cài đặt hoặc tạo một mục với trạng thái sau hành động.
L3Hỗ trợThiết bị hỗ trợ tác vụ có ngữ cảnh, chia nhỏ bước và duy trì mạch công việc.Hiểu màn hình, giữ bối cảnh, xin xác nhận, xử lý thiếu quyền và tiếp tục sau gián đoạn.
L4Phối hợpThiết bị tiến gần hơn tới cộng tác người-máy trong các workflow phức tạp.Nhiều tác vụ liên quan, phối hợp app và dữ liệu, kiểm soát rủi ro, kết quả có thể kiểm chứng.

Cách đọc này là diễn giải thực dụng, không phải ngưỡng chứng nhận. L1 không có nghĩa là vô dụng, vì phản hồi ổn định vẫn là nền móng. L2 không chỉ là gọi một API; nó phải gắn với công cụ thật và kết quả nhìn thấy. L3 bắt đầu đáng chú ý với điện thoại AI vì thiết bị phải hỗ trợ người dùng qua nhiều bước, chứ không chỉ trả lời một câu. L4 là tham vọng cao hơn: AI và người dùng phối hợp trong bối cảnh rộng, với kiểm soát và trách nhiệm rõ hơn.

Nếu bạn cần nền tảng thuật ngữ rộng hơn về điện thoại AI agentic, bài Điện thoại AI agentic là gì? Cách nhận biết phone agent thật trong năm 2026 giải thích vì sao khả năng lập kế hoạch, dùng công cụ và thao tác thiết bị phải được tách khỏi chatbot thông thường.

Phân biệt hỗ trợ hữu ích và phối hợp thật

Ranh giới giữa điện thoại AI L3điện thoại AI L4 là nơi dễ bị thổi phồng nhất. Một demo thành công không đủ để kết luận sản phẩm đạt L3, càng không đủ để gọi là L4. Với chúng tôi, tín hiệu L3 bắt đầu xuất hiện khi điện thoại không chỉ hiểu câu lệnh mà còn giữ ngữ cảnh, chia tác vụ thành bước hợp lý, chọn đúng công cụ được hỗ trợ, hỏi lại khi dữ liệu thiếu và cho người dùng kiểm soát trước hành động có hậu quả.

Ví dụ, câu lệnh “sắp lịch gặp An tuần sau và nhắn địa điểm cho An” không chỉ là một câu trả lời. Điện thoại phải nhận ra người liên hệ, kiểm tra lịch, đề xuất thời gian, mở hoặc tạo sự kiện, chuẩn bị nội dung tin nhắn, hiển thị người nhận và giữ bước xác nhận. Nếu thiếu quyền lịch hoặc quyền liên hệ, trải nghiệm tốt không im lặng thất bại; nó đưa người dùng tới đường phục hồi rõ ràng.

L4 đòi hỏi thận trọng hơn. MIIT nêu rằng phần L4 sẽ tiếp tục được làm rõ và hoàn thiện khi ngành phát triển. Vì vậy, không nên biến L4 thành checklist cố định ngay trong năm 2026. Cách đọc hợp lý là xem L4 như hướng phối hợp sâu hơn giữa người dùng, thiết bị, app, dữ liệu và môi trường, đồng thời yêu cầu bằng chứng lặp lại ở nhiều nhóm tác vụ. Nếu một sản phẩm tự gọi là L4 nhưng chỉ có một video thao tác đẹp, người mua và nhà phát triển nên yêu cầu bộ test, điều kiện thử, giới hạn thất bại và cách kiểm soát.

Bài Nền tảng OS agent cho phone AI agent đi sâu hơn vào kiến trúc hệ điều hành, nơi ngữ cảnh, công cụ và quyền thiết bị gặp nhau. Trong bài này, điểm chính là: L3 và L4 phải được nhìn qua hành vi có thể quan sát, không qua lời hứa về độ thông minh.

Bài kiểm tra trí tuệ smartphone có thể lặp lại

Một bài kiểm tra trí tuệ smartphone hữu ích không thay thế đánh giá chính thức, nhưng giúp người mua và nhóm sản phẩm nhìn thấy năng lực thật. Hãy giữ cùng một thiết bị, tài khoản, quyền, ngôn ngữ, khu vực, mạng và phiên bản phần mềm trong mỗi lượt thử. Khi so sánh hai điện thoại, đừng thay đổi tài khoản hoặc quyền giữa chừng; nếu không, bạn đang đo điều kiện môi trường thay vì đo hành vi của trợ lý.

Tác vụMục tiêu quan sátĐiều cần ghi riêngTín hiệu cấp độ
Hỏi một câu thông tin về thiết bị hoặc nội dung phổ thông.Đo phản hồi cơ bản.Đúng sai, độ liên quan, thời gian phản hồi, khả năng nói rõ giới hạn.Gần L1 nếu phản hồi ổn định.
Mở một app cụ thể và đưa người dùng tới đúng màn hình.Đo khả năng gọi công cụ hoặc chức năng.App có mở đúng không, màn hình có đúng không, có báo lỗi rõ khi app vắng mặt không.Gần L2 nếu công cụ hoạt động có kiểm chứng.
Tạo nhắc việc thấp rủi ro từ một câu tự nhiên.Đo hiểu ý định và điền trường.Nội dung, thời gian, xác nhận, trạng thái sau khi tạo, khả năng sửa trước khi lưu.Tín hiệu L2 đến L3 tùy mức ngữ cảnh.
Đọc màn hình hiện tại và đề xuất bước tiếp theo.Đo ngữ cảnh màn hình.Người dùng có chủ động cung cấp màn hình không, trợ lý có hiểu đúng thành phần chính không.Tín hiệu L3 khi kết hợp với hành động được hỗ trợ.
Hoàn thành workflow hai app, ví dụ lịch và tin nhắn.Đo duy trì mạch qua nhiều bước.Chia bước, lựa chọn app, xác nhận người nhận, dừng và tiếp tục sau gián đoạn.Tín hiệu L3 nếu lặp lại ổn định.
Cố tình thiếu quyền rồi yêu cầu cùng tác vụ.Đo phục hồi và kiểm soát thất bại.Thông báo thiếu quyền, đường mở cài đặt, quay lại tác vụ, không vượt quyền.Điều kiện cần cho đánh giá tác vụ cao hơn.

Khi ghi kết quả, hãy tách năm cột: hoàn thành, kiểm soát, xác minh, phục hồi và độ lặp lại. Hoàn thành nghĩa là tác vụ xong. Kiểm soát nghĩa là người dùng có thấy và duyệt bước quan trọng. Xác minh nghĩa là thiết bị kiểm tra trạng thái sau hành động. Phục hồi nghĩa là thiếu quyền hoặc lỗi app có đường xử lý. Độ lặp lại nghĩa là cùng điều kiện cho kết quả tương tự sau nhiều lượt.

Không nên cộng năm cột thành một điểm rồi tuyên bố cấp chính thức. Bài kiểm tra này là cách ra quyết định thực tế, không phải conformity assessment. Nếu bạn muốn thiết kế benchmark sâu hơn cho Android phone agent, bài Benchmark phone agent Android: cách đánh giá mobile agent đáng tin cậy năm 2026 mở rộng phần mẫu tác vụ, dữ liệu quan sát và cách ghi lỗi.

Đánh giá quyền, phê duyệt, dừng, phục hồi và dấu vết

Một tiêu chuẩn điện thoại AI có ích phải xem thất bại có kiểm soát là một phần của chất lượng. Điện thoại AI càng làm được nhiều việc, câu hỏi an toàn càng trở nên cụ thể: quyền nào được cấp, hành động nào cần phê duyệt, người dùng có thể dừng không, sau khi dừng có tiếp tục được không, và kết quả cuối có dấu vết để kiểm tra không?

Quyền là ranh giới đầu tiên nhưng chưa đủ. Nếu một trợ lý có quyền SMS, điều đó không có nghĩa là nó nên tự gửi mọi tin nhắn. Nếu nó có quyền lịch, người dùng vẫn cần xem thời gian, khách mời và tiêu đề trước khi tạo sự kiện quan trọng. Nếu nó có quyền ảnh hoặc màn hình, người dùng cần biết khi nào ngữ cảnh được đưa vào tác vụ. Kiểm soát tốt phải xuất hiện trong giao diện đúng lúc, không nằm ở một dòng mô tả chung.

Phê duyệt là nơi thiết kế sản phẩm quyết định niềm tin. Với hành động có hậu quả, trợ lý nên đưa ra bản nháp, người nhận, thay đổi cài đặt hoặc kết quả dự kiến trước khi tiếp tục. Nếu bạn đang thiết kế luồng này, bài UX phê duyệt tác vụ AI agent trên điện thoại: thiết kế để quyết định đúng phân tích cách trình bày lý do, mức rủi ro và lựa chọn cho người dùng.

Dừng và phục hồi cũng phải được ghi trong bài test. Một agent có thể hoàn thành tác vụ trong điều kiện sạch nhưng rối khi mạng yếu, app đổi màn hình, quyền bị tắt hoặc người dùng đổi ý. Với điện thoại thật, trạng thái luôn biến động. Vì vậy, đánh giá tốt cần ghi cả đường sai: lúc nào agent dừng, có giải thích được không, có đưa người dùng tới cài đặt cần thiết không, và có quay lại mạch tác vụ sau khi phục hồi không.

Dùng FoneClaw như một lối thử Android có quản trị

Tại FoneClaw, chúng tôi xây sản phẩm từ bài học rất thực tế: trí tuệ của model chỉ là một phần của điện thoại AI; phần khó là đưa ý định thành hành động Android có kiểm soát. Theo thông tin sản phẩm mới nhất tại thời điểm cập nhật bài viết, FoneClaw cung cấp lối truy cập nổi có thể di chuyển để người dùng gọi trợ lý khi đang ở app khác, cùng khả năng đính kèm màn hình hiện tại khi người dùng chủ động yêu cầu. Nhờ vậy, ngữ cảnh không bị lấy như một giả định mơ hồ; người dùng đưa màn hình vào tác vụ đúng lúc họ muốn.

Mạch tác vụ là phần chúng tôi ưu tiên vì người dùng hiếm khi làm việc trong một bước. Một yêu cầu có thể bắt đầu ở màn hình hiện tại, chuyển về Home, gọi công cụ Android được hỗ trợ, chờ phê duyệt, gặp thiếu quyền, rồi quay lại tiếp tục. FoneClaw giữ các điểm đó trong cùng một luồng thực thi: công cụ có phạm vi, quyền được kiểm tra, bước nhạy cảm có phê duyệt, người dùng có thể dừng, và đường phục hồi quyền giúp tác vụ không rơi vào trạng thái mơ hồ. Thông tin tải hiện tại được đặt tại trang tải FoneClaw.

Khi nói về bề mặt hành động, chúng tôi mô tả FoneClaw bằng các nhóm năng lực người dùng thấy được: màn hình và app, trạng thái thiết bị, cài đặt hệ thống, liên lạc, lịch, ghi chú, điều hướng, web, tác vụ, workflow, kỹ năng và plugin được quản trị. Chi tiết khả năng hiện hành được duy trì trên trang tính năng FoneClaw; trong bài về chuẩn L1-L4 này, điều quan trọng không phải là tự gắn cấp cho FoneClaw, mà là dùng FoneClaw như một đường thử quan sát được cho thực thi Android có quyền, phê duyệt và phục hồi.

Bài test khởi đầu nên thấp rủi ro: mở một app, kiểm tra trạng thái âm lượng, tạo nhắc việc nháp, hoặc đính kèm màn hình hiện tại để hỏi bước tiếp theo rồi chỉ thực hiện hành động sau khi bạn xác nhận. Nếu kết quả hiển thị đúng, quyền rõ và tác vụ dừng đúng lúc, bạn có bằng chứng tốt hơn nhiều so với một nhãn marketing. Nếu bạn muốn hiểu riêng vì sao trợ lý nổi và ngữ cảnh màn hình quan trọng với phone agent, bài Trợ lý AI nổi Android với ngữ cảnh màn hình hiện tại đi sâu vào trải nghiệm đó.

Chọn hoặc xây điện thoại AI bằng bằng chứng

Với người mua, câu hỏi đầu tiên không phải là điện thoại có ghi L3 hay L4 hay không. Hãy hỏi tiêu chuẩn nào được nhắc tới, phần nào áp dụng cho mobile terminal, phạm vi test là gì, ai thực hiện test, điều kiện thiết bị ra sao và kết quả có lặp lại không. Một tuyên bố cấp độ nên đi kèm bằng chứng theo tác vụ, không chỉ đi kèm tên model hoặc video trình diễn.

Với nhà phát triển, khung L1-L4 là cách tốt để chia yêu cầu sản phẩm. L1 cần phản hồi đúng. L2 cần công cụ hoạt động và trạng thái sau hành động. L3 cần ngữ cảnh, chia bước, phê duyệt, phục hồi và mạch tác vụ. L4 cần được theo dõi cẩn trọng vì MIIT đã nói phần này sẽ tiếp tục được làm rõ và hoàn thiện khi ngành phát triển. Xây sản phẩm tốt nghĩa là ghi lại bằng chứng cho từng lớp, không nhảy thẳng tới nhãn cao nhất.

  1. Xác định thiết bị, tài khoản, ngôn ngữ, khu vực và phiên bản phần mềm trước khi thử.
  2. Chọn sáu tác vụ đại diện: phản hồi, công cụ, nhắc việc, màn hình, workflow hai app và thiếu quyền.
  3. Ghi riêng hoàn thành, kiểm soát, xác minh, phục hồi và độ lặp lại.
  4. Yêu cầu phê duyệt rõ cho tin nhắn, lịch, cài đặt, thanh toán hoặc dữ liệu nhạy cảm.
  5. Thử lại sau mỗi cập nhật lớn vì hành vi AI phone có thể thay đổi theo model, app và hệ điều hành.

Kết luận thực dụng: GB/Z 177-2026 cho ngành một ngôn ngữ tốt hơn để nói về điện thoại AI, nhưng bằng chứng vẫn phải nằm trên thiết bị thật. Hãy dùng khung L1-L4 để hỏi đúng câu hỏi, dùng bài test để ghi đúng hành vi và chọn sản phẩm theo khả năng hoàn thành tác vụ có kiểm soát.

Câu hỏi thường gặp

Theo cách diễn giải thực dụng từ tên cấp chính thức, L1 là phản hồi, L2 là dùng công cụ, L3 là hỗ trợ tác vụ có ngữ cảnh và L4 là phối hợp sâu hơn giữa người dùng, thiết bị, app và dữ liệu. Mức thông minh tăng dần, nhưng từng cấp cần được chứng minh bằng hành vi có thể kiểm tra.
GB/Z 177-2026 là tài liệu hướng dẫn tiêu chuẩn hóa quốc gia. Phần 3 áp dụng cho mobile terminal, nhưng bản ghi tiêu chuẩn không tự biến một điện thoại cụ thể thành sản phẩm đã được chứng nhận L3 hoặc L4. Mọi tuyên bố cấp độ cần kèm phạm vi và bằng chứng đánh giá.
Hãy thử tác vụ có ngữ cảnh và nhiều bước: đọc màn hình hiện tại, tạo nhắc việc, chuyển qua app khác, xin xác nhận, xử lý thiếu quyền và tiếp tục sau gián đoạn. Ghi riêng hoàn thành, kiểm soát, xác minh, phục hồi và độ lặp lại thay vì chỉ ghi thành công hoặc thất bại.
MIIT nêu rằng L4 sẽ được làm rõ và hoàn thiện thêm khi ngành phát triển. Điều đó hợp lý vì phối hợp người-máy trên điện thoại liên quan tới nhiều app, dữ liệu cá nhân, quyền, rủi ro hành động và điều kiện thiết bị thay đổi liên tục.
FoneClaw đóng vai trò ví dụ chưa tự xếp hạng cho lối thực thi Android có quản trị. Người dùng có thể thử truy cập nổi, đính kèm màn hình theo yêu cầu, mạch tác vụ, phê duyệt, dừng, phục hồi quyền và định tuyến năng lực để đánh giá hành vi thật trên tác vụ Android được hỗ trợ.