Industry Analysis
📅 2026-07-22 ⏱️ 9 phút Dean Dean

Kimi K3, DeepSeek V4 và GLM-5.2: chọn mô hình cho phone agent

Chọn mô hình tốt nhất cho phone agent không chỉ nhìn benchmark: cần xét chi phí, độ trễ, ngữ cảnh, tool-use, đa ngôn ngữ và cách FoneClaw thực hiện tác vụ Android.

Định tuyến mô hình Kimi K3, DeepSeek V4, GLM-5.2, Qwen và Hy3 cho phone agent Android
📋 Điểm chính
📑 Mục lục
  1. Đừng chọn mô hình phone agent chỉ bằng bảng xếp hạng
  2. Các tiêu chí routing: chi phí, độ trễ, ngữ cảnh và độ tin cậy khi dùng công cụ
  3. Kimi K3, DeepSeek V4, GLM-5.2, Qwen và Hy3 trong bức tranh model routing
  4. Vì sao hành động Android không chỉ phụ thuộc vào suy luận mô hình
  5. FoneClaw chọn mô hình để lập kế hoạch, rồi thực hiện tác vụ Android được hỗ trợ
  6. Checklist chọn hoặc đổi mô hình cho phone-agent workflow

Đừng chọn mô hình phone agent chỉ bằng bảng xếp hạng

Khi một mô hình mới ra mắt, phản xạ quen thuộc là hỏi mô hình nào mạnh nhất. Với phone agent, câu hỏi đó chưa đủ. Một phone agent không chỉ cần trả lời đúng; nó còn phải hiểu yêu cầu ngắn, giữ ngữ cảnh đủ lâu, chọn công cụ đúng, lập kế hoạch nhiều bước, tiết kiệm chi phí, phản hồi nhanh và giúp môi trường Android thực hiện hành động có kiểm soát. Mô hình đứng đầu benchmark có thể không phải lựa chọn tốt nhất cho mọi tác vụ điện thoại.

bài so sánh của MarkTechPost về Kimi K3, DeepSeek V4 Pro và GLM-5.2 đặt ba mô hình MoE quy mô rất lớn cạnh nhau theo năng lực đo được, giấy phép và chi phí phục vụ. Bài viết nhấn mạnh cả ba đều nhắm tới coding dài hơi và agent workload, nhưng khác nhau đáng kể về tổng tham số, ngữ cảnh, API, trọng số mở, tốc độ và giá. Đây là cách đọc phù hợp hơn cho phone agent: không chỉ ai mạnh hơn, mà mô hình nào hợp với tác vụ nào.

Với người dùng FoneClaw, mô hình là phần dẫn dắt hiểu yêu cầu, suy luận và lập kế hoạch. FoneClaw là phone agent thực hiện các hành động Android được hỗ trợ. Vì vậy, chọn mô hình cho FoneClaw không nên biến thành cuộc đua tên tuổi. Một tác vụ như chuẩn bị tin nhắn cần ngôn ngữ tự nhiên và xác nhận rõ. Một tác vụ đọc tài liệu dài cần ngữ cảnh lớn. Một tác vụ lặp lại hằng ngày cần chi phí thấp và độ trễ tốt. Một tác vụ nhiều công cụ cần khả năng lập kế hoạch ổn định.

Nếu bạn muốn một cái nhìn rộng hơn về các mô hình AI agent trong năm 2026, bài Mô hình AI agent 2026: chọn theo năng lực, không theo hype là bối cảnh phù hợp. Bài này đi hẹp hơn: routing mô hình cho phone agent, nơi kết quả cuối cùng không phải điểm số mà là hành động Android được hỗ trợ, hiển thị và xác nhận đúng lúc.

Nếu bạn cần phân biệt rõ mô hình trò chuyện với lớp thực thi trên điện thoại, hãy đọc trước Điều khiển điện thoại bằng AI agent trên Android, rồi quay lại bài này để quyết định Kimi K3, DeepSeek V4 hay GLM-5.2 nên được định tuyến cho nhóm tác vụ nào.

Các tiêu chí routing: chi phí, độ trễ, ngữ cảnh và độ tin cậy khi dùng công cụ

Routing mô hình nghĩa là chọn hoặc chuyển mô hình theo từng loại tác vụ. Một phone agent tốt có thể dùng mô hình mạnh hơn cho yêu cầu khó, mô hình rẻ hơn cho tác vụ lặp lại, mô hình có ngữ cảnh dài cho tài liệu lớn, hoặc mô hình phản hồi nhanh cho thao tác cần ít chờ. Cách này thực tế hơn việc ép mọi yêu cầu đi qua một mô hình duy nhất.

Các tiêu chí quan trọng nhất gồm chi phí, độ trễ, độ dài ngữ cảnh, khả năng dùng công cụ, độ ổn định đa ngôn ngữ, quyền riêng tư và khả dụng API. Chi phí quyết định tác vụ có thể chạy thường xuyên không. Độ trễ ảnh hưởng tới cảm giác điều khiển điện thoại. Ngữ cảnh quyết định agent có giữ được cuộc trò chuyện, màn hình, tài liệu và lịch sử thao tác không. Tool-use reliability là khả năng mô hình chọn đúng công cụ, đi đúng thứ tự và biết khi nào cần hỏi lại.

Đa ngôn ngữ cũng rất quan trọng với người dùng Việt Nam. Một mô hình có thể giỏi code nhưng không xử lý tốt tên liên hệ, tiếng Việt có dấu, câu nói ngắn hoặc lối diễn đạt đời thường. Phone agent thường nhận yêu cầu không hoàn hảo: nhắc tôi gửi cái file hôm qua cho chị Lan, mở nhóm nhà mình, hay gọi lại anh Minh sau khi họp. Mô hình cần hiểu đúng ý, nhưng FoneClaw vẫn phải kiểm tra tác vụ Android được hỗ trợ trước khi thực hiện.

Tiêu chí routingVì sao quan trọng với phone agentCách FoneClaw dùng trong tác vụ Android
Chi phíTác vụ lặp lại cần chạy nhiều lần mà không đội giáChọn mô hình phù hợp mức phức tạp của yêu cầu
Độ trễĐiện thoại cần phản hồi nhanh khi mở app, chuẩn bị tin hoặc tạo nhắc việcƯu tiên đường xử lý nhanh cho tác vụ ngắn
Ngữ cảnhTài liệu dài, màn hình nhiều thông tin và workflow nhiều bước cần giữ bối cảnhDùng mô hình có ngữ cảnh phù hợp rồi hiển thị kết quả
Dùng công cụMô hình phải chọn đúng hành động, không chỉ trả lời hayFoneClaw thực hiện tác vụ Android được hỗ trợ và yêu cầu xác nhận

Với tác vụ chạy ngay trên thiết bị, bạn cũng cần nhìn tới tối ưu LLM. Bài Tối ưu LLM trên thiết bị cho AI agent điện thoại đi sâu hơn vào độ trễ, bộ nhớ và hành vi cục bộ. Ở đây, routing được hiểu rộng hơn: dùng mô hình nào, qua API nào, ở đâu, cho tác vụ nào, và FoneClaw biến kế hoạch đó thành hành động Android ra sao.

Kimi K3, DeepSeek V4, GLM-5.2, Qwen và Hy3 trong bức tranh model routing

Mỗi mô hình trong nhóm này đáng chú ý vì một lý do khác nhau. MarkTechPost mô tả Kimi K3 là mô hình 2.8 nghìn tỷ tham số, có ngữ cảnh 1 triệu token, thêm vision và reasoning luôn bật, đồng thời đứng cao trong các đo lường năng lực được bài viết trích dẫn. DeepSeek V4 Pro được mô tả là MoE 1.6 nghìn tỷ tham số, có 49 tỷ tham số hoạt động và lợi thế chi phí rất mạnh. GLM-5.2 nhỏ hơn về tổng tham số, nhưng vẫn thuộc nhóm MoE lớn, có ngữ cảnh 1 triệu token và tốc độ được đánh giá nổi bật trong bài so sánh.

đánh giá CAISI của NIST về Z.ai GLM-5.2 cho biết GLM-5.2 được phát hành dưới dạng open-weight vào tháng 6 năm 2026 và CAISI hoàn tất đánh giá ngày 8 tháng 7. NIST ghi nhận GLM-5.2 có khả năng rất mạnh trong nhóm open-weight khi ra mắt. Với phone agent, nguồn đánh giá như vậy hữu ích vì nó nhắc chúng ta nhìn vào năng lực được kiểm tra độc lập, không chỉ thông điệp từ nhà cung cấp.

Qwen cũng là một tín hiệu cần theo dõi. South China Morning Post về bản xem trước Qwen mới của Alibaba ghi nhận tuyên bố rằng mô hình mới xếp sau Claude Fable 5 trong một số so sánh. Với phone agent, điều này cho thấy nhóm mô hình Trung Quốc đang cạnh tranh mạnh ở năng lực tổng quát, nhưng routing vẫn phải dựa trên tác vụ thực tế, không chỉ tiêu đề. Hy3 của Tencent lại đại diện cho hướng mô hình được đưa vào WorkBuddy, CodeBuddy, Yuanbao, Marvis, ima và API, tạo thêm lựa chọn cho phone-agent reasoning.

OpenRouter-style access và các nền tảng API tổng hợp làm routing linh hoạt hơn: agent có thể chọn mô hình theo giá, độ trễ, vùng triển khai hoặc ngữ cảnh. Nhưng tính linh hoạt đó cũng cần kỷ luật sản phẩm. Nếu đổi mô hình mà không kiểm tra quyền Android, app state và xác nhận người dùng, phone agent vẫn có thể thất bại ở bước hành động dù mô hình rất mạnh.

Vì sao hành động Android không chỉ phụ thuộc vào suy luận mô hình

Phone-agent reliability là câu chuyện khác benchmark. Một mô hình có thể hiểu đúng rằng người dùng muốn gửi WhatsApp cho mẹ, nhưng Android cần biết app nào đang được dùng, liên hệ nào đúng, quyền danh bạ đã cấp chưa, nội dung tin nhắn đã hiển thị chưa và người dùng đã xác nhận gửi chưa. Nếu chỉ có suy luận mà thiếu trạng thái điện thoại, tác vụ dễ dừng ở lời khuyên hoặc nhầm bước.

Độ tin cậy hành động phụ thuộc vào bốn yếu tố. Thứ nhất là quyền truy cập: danh bạ, microphone, thông báo, lịch, tệp hoặc app đích. Thứ hai là app state: người dùng đã đăng nhập chưa, màn hình hiện tại có nút nào, app có thay đổi giao diện không. Thứ ba là kết quả hiển thị: sau khi chuẩn bị tác vụ, người dùng có thấy nội dung không. Thứ tư là xác nhận: gửi, gọi, lưu, xóa, mua hoặc thay đổi cài đặt đều cần điểm quyết định rõ.

Đây là lý do không nên nói một mô hình trực tiếp điều khiển điện thoại. Mô hình có thể lập kế hoạch cho agent, nhưng hành động Android cần môi trường được thiết kế riêng. FoneClaw là phone agent cho các hành động Android được hỗ trợ. Khi mô hình được cấu hình trong FoneClaw, nó giúp hiểu yêu cầu và chọn hướng xử lý; FoneClaw thực hiện phần điện thoại bằng quyền phù hợp, trạng thái hiển thị và xác nhận khi cần.

Ví dụ với DeepSeek, người dùng có thể quan tâm tới chi phí và năng lực code. Nhưng trong tác vụ Android, câu hỏi không phải DeepSeek có giỏi trả lời không, mà là khi được cấu hình trong phone agent, nó có giúp lập kế hoạch đúng hơn không và FoneClaw có hỗ trợ hành động Android đó không. Bài DeepSeek, trợ lý AI và điều khiển điện thoại Android: có thể và không thể làm gì giúp đặt DeepSeek vào bối cảnh điện thoại cụ thể hơn.

FoneClaw chọn mô hình để lập kế hoạch, rồi thực hiện tác vụ Android được hỗ trợ

Tại FoneClaw, chúng tôi xem mô hình như động cơ hiểu yêu cầu, suy luận và lập kế hoạch. Người dùng hoặc cấu hình sản phẩm có thể chọn mô hình phù hợp cho phone agent. Sau đó FoneClaw là môi trường thực hiện các hành động Android được hỗ trợ: mở đúng nơi, chuẩn bị nội dung, dùng quyền truy cập phù hợp, hiển thị kết quả và hỏi xác nhận ở bước nhạy cảm.

Model routing trong FoneClaw không phải là việc đổi nhãn mô hình để chạy theo xu hướng. Nó là cách chọn mô hình theo tác vụ. Một yêu cầu ngắn, lặp lại và ít rủi ro có thể ưu tiên độ trễ và chi phí. Một yêu cầu dài có nhiều tài liệu cần ngữ cảnh lớn. Một tác vụ đa ngôn ngữ cần mô hình hiểu tiếng Việt tự nhiên. Một workflow liên quan đến nhiều công cụ cần mô hình có khả năng lập kế hoạch ổn định. Dù chọn mô hình nào, FoneClaw vẫn giữ phần hành động Android trong phạm vi được hỗ trợ.

Cách này giúp tách rõ giữa năng lực mô hình và năng lực sản phẩm. Kimi K3 có thể là lựa chọn mạnh cho tác vụ khó. DeepSeek V4 Pro có thể hấp dẫn về chi phí. GLM-5.2 có thể phù hợp khi cần open-weight và tốc độ. Qwen hoặc Hy3 có thể có lợi thế trong hệ sinh thái và API cụ thể. Nhưng với phone agent, mô hình chỉ là một phần quyết định. Phần còn lại là quyền thiết bị, app state, kết quả hiển thị và xác nhận người dùng.

FoneClaw tập trung vào chính phần còn lại đó. Chúng tôi giúp biến kế hoạch của mô hình thành hành động Android được hỗ trợ, có thể kiểm tra và có điểm dừng hợp lý. Nếu tác vụ chưa được hỗ trợ, FoneClaw đưa ra cách xử lý tiếp. Đây là cách phone agent tận dụng làn sóng mô hình mới mà không biến benchmark thành lời hứa quá rộng.

Checklist chọn hoặc đổi mô hình cho phone-agent workflow

Trước khi chọn Kimi K3, DeepSeek V4, GLM-5.2, Qwen, Hy3 hay một tuyến API khác, hãy bắt đầu từ workflow điện thoại. Bạn cần tác vụ gì: nhắn tin, gọi, mở app, tóm tắt nội dung, đọc tài liệu, điền biểu mẫu, tạo nhắc việc hay xử lý công việc dài? Mỗi tác vụ đặt ra nhu cầu khác nhau về chi phí, tốc độ, ngữ cảnh và xác nhận. Chọn mô hình từ tác vụ sẽ thực tế hơn chọn mô hình từ bảng xếp hạng.

Checklist nên gồm:

Không có một mô hình tốt nhất cho mọi phone agent. Có mô hình tốt nhất cho từng loại tác vụ, từng mức chi phí, từng nhu cầu riêng tư và từng thiết bị. Kimi K3, DeepSeek V4, GLM-5.2, Qwen và Hy3 đều đáng theo dõi, nhưng giá trị của chúng trong phone agent chỉ xuất hiện khi được gắn vào một môi trường thực hiện hành động Android đáng tin.

Đó là lý do FoneClaw coi routing là một quyết định sản phẩm, không phải cuộc đua hype. Mô hình dẫn dắt suy luận. FoneClaw thực hiện hành động Android được hỗ trợ. Người dùng nhìn thấy kết quả, cấp quyền có chủ đích và xác nhận ở bước quan trọng. Khi ba phần này đi cùng nhau, phone agent mới trở thành công cụ hằng ngày thay vì chỉ là một mô hình đẹp trên bảng so sánh.

Câu hỏi thường gặp

Không có một mô hình tốt nhất cho mọi tình huống. Phone agent nên chọn mô hình theo tác vụ: chi phí, độ trễ, ngữ cảnh, khả năng dùng công cụ, tiếng Việt, quyền riêng tư và API khả dụng.
Kimi K3 được chú ý nhờ năng lực đo được và ngữ cảnh rất dài, DeepSeek V4 Pro nổi bật về chi phí trong các so sánh được trích dẫn, còn GLM-5.2 có lợi thế open-weight, tốc độ và đánh giá độc lập từ CAISI. Phone agent nên dùng từng mô hình theo workflow cụ thể.
Mô hình mạnh có thể hiểu yêu cầu và lập kế hoạch, nhưng hành động Android cần quyền thiết bị, app state, kết quả hiển thị và xác nhận người dùng. FoneClaw xử lý phần hành động Android được hỗ trợ.
FoneClaw cho phép mô hình dẫn dắt phần hiểu yêu cầu và lập kế hoạch. FoneClaw thực hiện các tác vụ Android được hỗ trợ với quyền truy cập rõ ràng, trạng thái hiển thị, xác nhận ở bước nhạy cảm và cách xử lý khi tác vụ chưa được hỗ trợ.