Tin tức
📅 2026-08-08 ⏱️ 12 phút Dean Dean

SeedRealtime, Seeduplex và phone agent song công toàn phần trên Android

Giải thích SeedRealtime, Seeduplex, AI giọng nói song công toàn phần và vì sao phone agent Android vẫn cần lớp thực thi có quyền, phê duyệt, xác minh và phục hồi.

Minh họa phone agent Android dùng AI giọng nói song công toàn phần và lớp thực thi có phê duyệt trong FoneClaw
📋 Điểm chính
  • SeedRealtime và Seeduplex làm cho voice agent thời gian thực tự nhiên hơn bằng khả năng lắng nghe trong khi đang nói, xử lý ngắt lời và chống nhiễu hội thoại tốt hơn theo công bố của ByteDance Seed.
  • AI giọng nói song công toàn phần cải thiện lớp tương tác, nhưng hành động Android vẫn cần lớp thực thi riêng với quyền, trạng thái tác vụ, phê duyệt, xác minh kết quả và phục hồi.
  • Từ kinh nghiệm xây FoneClaw, chúng tôi xem phone agent đáng tin như hai mặt phẳng phối hợp: mặt phẳng hội thoại để hiểu ý định và mặt phẳng thực thi để làm việc trên điện thoại trong phạm vi được hỗ trợ.
  • Nền hiện có của FoneClaw là nền hiện tại cho lớp thực thi: trợ lý nổi, liên tục tác vụ trên cùng điện thoại, phục hồi quyền và quick actions cho các tác vụ Android được quản trị.

SeedRealtime và Seeduplex thay đổi gì cho phone agent

SeedRealtime và Seeduplex đáng chú ý với người xây phone agent vì chúng đẩy trải nghiệm giọng nói tiến gần hơn tới hội thoại tự nhiên. Trong bài công bố Seed Full-Duplex Speech LLM ngày 9 tháng 4 năm 2026, ByteDance Seed giới thiệu Seeduplex như một mô hình speech LLM có khung lắng nghe trong khi đang nói. Nói đơn giản, voice agent có thể tiếp tục nghe người dùng chen ngang, sửa ý, ngập ngừng hoặc nói trong môi trường có nhiễu thay vì đợi hết một lượt nói mới phản hồi.

Trang mô hình SeedRealtime của ByteDance Seed đặt SeedRealtime trong nhóm mô hình thời gian thực của Seed. Với phone agent, điều này rất quan trọng: điện thoại là thiết bị được dùng khi người dùng đang đi, đang làm việc, đang nhìn màn hình khác, hoặc đang cần sửa một câu giữa chừng. Một agent giọng nói bán song công thường tạo cảm giác phải xếp hàng: người dùng nói xong, máy xử lý, máy nói xong, người dùng mới sửa. Song công toàn phần giúp cuộc trao đổi linh hoạt hơn.

Từ góc nhìn FoneClaw, bước tiến ở lớp hội thoại này mở ra cơ hội lớn, nhưng nó vẫn là phần đầu của bài toán. Một mô hình lắng nghe tốt hơn giúp hiểu ý định nhanh hơn; để biến ý định thành hành động điện thoại, phone agent vẫn cần quyền Android, hợp đồng công cụ, phê duyệt, xác minh kết quả và phục hồi. Bài Điện thoại AI ưu tiên giọng nói: vì sao màn hình không biến mất giải thích rộng hơn vì sao giọng nói là đường vào chính, còn màn hình và nút vẫn giữ vai trò kiểm soát.

AI giọng nói song công xử lý im lặng, tiếng ồn và ngắt lời thế nào

Trong tương tác giọng nói truyền thống, hệ thống thường làm việc theo lượt. Người dùng nói, hệ thống đoán điểm kết thúc câu, xử lý, rồi trả lời. Cách này hoạt động tốt với câu lệnh ngắn, nhưng dễ vấp khi người dùng đổi ý giữa câu, nói thêm chi tiết lúc agent đang trả lời, hoặc có tiếng nền làm hệ thống tưởng rằng lượt nói đã kết thúc. Full-duplex voice AI thay đổi nhịp này bằng cách cho mô hình tiếp tục lắng nghe trong lúc đang tạo phản hồi.

Điểm kỹ thuật quan trọng là ngắt lời và phân luồng âm thanh. Khi người dùng chen vào câu trả lời của agent, hệ thống cần biết đó là yêu cầu sửa, tín hiệu dừng, tiếng ồn, hay lời nói của người khác ở gần. ByteDance Seed công bố các cải thiện của Seeduplex về chống nhiễu, phát hiện điểm kết thúc và xử lý ngắt lời trong môi trường hội thoại. Các kết quả này cần được đọc như số liệu và mô tả do Seed công bố cho hệ thống của họ, nhưng bài học thiết kế rất rõ: phone agent cần lắng nghe linh hoạt hơn để giảm cảm giác máy đang độc thoại.

Nghiên cứu How Should LLMs Listen While Speaking? chỉ ra một câu hỏi sâu hơn: khi âm thanh người dùng đến trong lúc mô hình đang nói, hệ thống nên đưa tín hiệu đó vào đâu? Các cách định tuyến như hợp nhất kênh hoặc cross-attention tạo ra đánh đổi giữa bám sát âm thanh mới và giữ ngữ cảnh đang nói. Với điện thoại, đánh đổi này chạm trực tiếp vào trải nghiệm: agent phải phản ứng nhanh khi người dùng nói “dừng lại”, nhưng cũng cần bỏ qua tiếng ồn hoặc câu nói bên cạnh.

Độ trễ cũng là một phần của cảm giác tự nhiên. Mô hình càng phản hồi nhanh, người dùng càng dễ nói theo cách đời thường. Bài LLM 1000 TPS thay đổi phone agent thế nào? đi sâu vào lớp tốc độ suy luận; còn trong bài này, điểm mấu chốt là tốc độ hội thoại cần đi cùng lớp thực thi có kiểm soát.

Vì sao hội thoại và thực thi Android là hai mặt phẳng riêng

Chúng tôi tách phone agent thành hai mặt phẳng. Mặt phẳng thứ nhất là hội thoại: nghe, hiểu, ngắt lời, làm rõ, đọc lại, sửa câu và giữ mạch trao đổi. SeedRealtime phone agent song công toàn phần làm lớp này hấp dẫn hơn vì người dùng có thể nói tự nhiên, dừng agent giữa câu và sửa ý định ngay lập tức. Mặt phẳng thứ hai là thực thi Android: xin quyền, chọn công cụ, mở app, thao tác màn hình được hỗ trợ, gửi dữ liệu, đổi cài đặt và xác minh kết quả.

Lý do tách hai mặt phẳng rất thực tế. Một câu “ừ gửi đi” trong hội thoại có thể là xác nhận hợp lệ khi người nhận, nội dung và nút gửi đã rõ. Cùng câu đó trở nên mơ hồ nếu có hai bản nháp, hai người cùng tên, hai SIM hoặc một app đang mở sai cuộc trò chuyện. Hội thoại tự nhiên giúp người dùng nói ít hơn; lớp thực thi đảm bảo điện thoại làm đúng việc, trong đúng phạm vi, với kết quả người dùng thấy được.

FoneClaw được xây ở mặt phẳng thực thi này. Một mô hình được cấu hình giúp hiểu yêu cầu và lập kế hoạch, còn công cụ được quản trị thực hiện hành động Android được hỗ trợ qua quyền của hệ thống. Khi người dùng cần bật Không làm phiền, chuẩn bị SMS, mở cuộc gọi, chuyển sang bản đồ hoặc xử lý một cài đặt được hỗ trợ, FoneClaw quan tâm tới trạng thái, phê duyệt và phục hồi. Bài Điều khiển điện thoại bằng AI agent trên Android là phần nền cho cách chúng tôi nhìn phone-agent execution.

Bảy bước từ ý định bằng giọng nói tới kết quả đã xác minh

Để một voice agent thời gian thực trở thành phone agent đáng tin, chúng tôi dùng một hợp đồng bảy bước. Bước đầu tiên là thu nhận: người dùng chủ động gọi agent hoặc đưa ngữ cảnh vào tác vụ. Bước thứ hai là làm rõ: agent xác định mục tiêu, người nhận, app, dữ liệu cần dùng và các điểm còn mơ hồ. Bước thứ ba là lập kế hoạch: tác vụ được chia thành hành động có thứ tự, quyền cần dùng và kết quả cần quan sát.

Bước thứ tư là phê duyệt. Với hành động có tác động như gửi tin, đổi cài đặt, chia sẻ dữ liệu hoặc gọi điện, người dùng cần nhìn thấy điều sắp xảy ra. Bước thứ năm là thực thi: công cụ Android được quản trị chạy trong phạm vi được hỗ trợ. Bước thứ sáu là xác minh: hệ thống kiểm tra trạng thái sau hành động, ví dụ chế độ Không làm phiền đã đổi, bản nháp SMS đã hiện, app bản đồ đã nhận điểm đến, hoặc cuộc gọi đã sẵn sàng. Bước thứ bảy là phục hồi: khi thiếu quyền, app đổi giao diện, kết quả trống hoặc người dùng ngắt giữa chừng, tác vụ chuyển sang đường sửa, cấp quyền, chọn lại hoặc dừng.

Full-duplex voice AI làm hai bước đầu mạnh hơn: thu nhận và làm rõ trở nên tự nhiên vì người dùng có thể chen ngang, sửa câu và thêm chi tiết trong lúc agent đang phản hồi. Các bước sau thuộc trách nhiệm của lớp thực thi. Khi chúng tôi thiết kế phê duyệt trong FoneClaw, mục tiêu là giúp người dùng quyết định đúng ở thời điểm đúng. Bài UX phê duyệt tác vụ AI agent trên điện thoại: thiết kế để quyết định đúng đi sâu hơn vào lý do, bằng chứng, mục tiêu và hậu quả cần hiện trước khi hành động được áp dụng.

Cách chúng tôi xây lớp thực thi hiện tại trong FoneClaw

FoneClaw hiện dùng giọng nói và ngữ cảnh màn hình theo cách người dùng kích hoạt. Người dùng gọi FoneClaw, nói yêu cầu, hoặc gắn màn hình hiện tại khi ngữ cảnh đang thấy là phần cần thiết của tác vụ. Các khả năng hiện có của FoneClaw thêm trợ lý nổi, liên tục tác vụ trên cùng điện thoại, phục hồi quyền và quick actions. Bản hiện tại có thể được tải từ trang tải FoneClaw.

Điều chúng tôi đang xây không phải là một cuộc trò chuyện nằm riêng trong app. Chúng tôi xây lớp thực thi cho điện thoại: tác vụ giữ trạng thái khi người dùng chuyển giữa Home và trợ lý nổi; quyền được phục hồi khi thiếu; hành động nhạy cảm đi qua bản xem lại; kết quả được đưa ra để người dùng thấy. Với các tác vụ như Không làm phiền, SMS hiển thị, cuộc gọi, điều hướng và một số cài đặt Android được hỗ trợ, FoneClaw dùng công cụ được quản trị thay vì để mô hình tự đoán mọi nút.

Ở lớp sản phẩm, FoneClaw chưa công bố kết nối chính thức với SeedRealtime hoặc Seeduplex. Chúng tôi xem các mô hình song công toàn phần như tín hiệu quan trọng cho mặt phẳng hội thoại tương lai: agent sẽ hiểu ngắt lời tốt hơn, hỏi lại mượt hơn và sửa ý định nhanh hơn. Khi một mô hình như vậy được đưa vào phone agent, lớp thực thi vẫn cần hợp đồng quyền, phê duyệt, xác minh và phục hồi. Người đọc muốn hiểu riêng cơ chế gắn màn hình hiện tại có thể xem Trợ lý AI nổi Android với ngữ cảnh màn hình hiện tại, vì đó là phần hiện tại FoneClaw đã xây theo hướng người dùng chủ động đưa ngữ cảnh vào tác vụ.

Trang tính năng FoneClaw trình bày các nhóm năng lực hiện có bằng ngôn ngữ người dùng có thể kiểm tra. Với chúng tôi, đây là cách đưa kiến trúc về thực tế: không chỉ nói agent thông minh hơn, mà cho thấy tác vụ nào có thể chạy, quyền nào cần dùng, kết quả nào được xác minh và khi nào người dùng tiếp quản.

Kịch bản phone agent song công cần lớp bảo vệ thực thi

Kịch bản đầu tiên là cuộc họp. Người dùng nói: “Bật Không làm phiền đến 3 giờ, trừ cuộc gọi từ gia đình.” Một voice agent song công có thể nghe người dùng sửa giữa chừng: “à, đến 3 giờ 30.” Lớp hội thoại ghi nhận thay đổi; lớp thực thi cần kiểm tra cài đặt được hỗ trợ, hiển thị phương án, xin phê duyệt và xác minh trạng thái sau khi áp dụng.

Kịch bản thứ hai là nhắn tin. Người dùng đọc: “Soạn cho Minh: tôi tới muộn 10 phút.” Trong lúc agent đang đọc lại, người dùng ngắt lời: “đổi thành 15 phút và thêm xin lỗi nhé.” Full-duplex giúp sửa mượt hơn. Lớp thực thi cần giữ bản nháp hiển thị, kiểm tra người nhận, nội dung, app mặc định, nút gửi ổn định và điều kiện gửi. Nếu có hai SIM hoặc tệp đính kèm, tác vụ nên dừng ở màn hình để người dùng chọn.

Kịch bản thứ ba là cuộc gọi hoặc điều hướng. Người dùng nói trong lúc đi bộ: “Gọi cho An, hoặc nếu không được thì mở bản đồ tới văn phòng của An.” Hội thoại song công giúp agent làm rõ “An nào?” ngay khi người dùng chen thêm chi tiết. Lớp thực thi cần chuẩn bị cuộc gọi hoặc chuyển điểm đến sang app bản đồ được chọn, rồi cho người dùng thấy trạng thái trước khi bước có tác động diễn ra.

Kịch bản thứ tư là tác vụ bị ngắt. Người dùng đang yêu cầu tạo ghi chú, nhận cuộc gọi, quay lại và nói “tiếp tục phần vừa rồi.” FoneClaw cần trạng thái tác vụ, dữ liệu đã dùng, kết quả tạm thời và đường phục hồi. Đó là lý do chúng tôi đặt liên tục tác vụ cùng quyền và phê duyệt vào phần nền của phone agent, như đã trình bày trong Điều khiển điện thoại bằng AI agent trên Android.

Riêng tư, pin, giới hạn nghe nhìn và phần cần xây tiếp

AI giọng nói song công đưa microphone vào trung tâm trải nghiệm, nên ranh giới riêng tư phải rõ. Với FoneClaw hiện tại, giọng nói do người dùng kích hoạt và ngữ cảnh màn hình hiện tại cũng do người dùng chủ động gắn vào tác vụ. Điều này giúp người dùng biết khi nào agent đang nhận yêu cầu và dữ liệu nào đang được dùng. Khi phone agent tiến tới hội thoại thời gian thực hơn, chỉ báo nghe, nút dừng, lịch sử tác vụ và phạm vi dữ liệu sẽ càng quan trọng.

Pin và độ trễ là bài toán thực dụng. Lắng nghe trong khi nói, lọc nhiễu, giữ ngữ cảnh và thực thi trên Android đều tiêu tốn tài nguyên. Một phone agent tốt cần chọn khi nào xử lý trên thiết bị, khi nào dùng mô hình trực tuyến, khi nào tạm dừng và khi nào chuyển sang thao tác màn hình. Trải nghiệm mượt chỉ có giá trị khi điện thoại vẫn bền pin và người dùng vẫn hiểu agent đang làm gì.

Thị giác là phần tiếp theo của câu chuyện. Trong bài công bố Seeduplex, Seed nêu visual input và tương tác chủ động như hướng tương lai. Nghiên cứu VideoFDB về benchmark song công nghe nhìn cũng cho thấy grounding âm thanh-hình ảnh trực tuyến vẫn là thách thức riêng, và nhiều hệ thống chưa tận dụng tốt luồng hình ảnh ngoài các câu hỏi trực tiếp về thị giác. Với phone agent, điều đó củng cố cách chúng tôi xây hiện tại: ngữ cảnh màn hình được người dùng kích hoạt, hành động Android đi qua quyền và kết quả được xác minh.

Checklist cho đội xây phone agent rất cụ thể: hội thoại phải cho phép chen ngang; lệnh dừng phải được ưu tiên; ngữ cảnh phải có nguồn rõ; hành động phải có quyền; bước có tác động phải có phê duyệt; kết quả phải được kiểm tra; lỗi phải có đường phục hồi; pin và riêng tư phải được đo trong điều kiện điện thoại thật. Đó là lớp mà FoneClaw đang xây để một mô hình tương tác mạnh, dù là SeedRealtime, Seeduplex hay mô hình thời gian thực khác trong tương lai, có thể trở thành hành động Android đáng tin.

Câu hỏi thường gặp

SeedRealtime là tên trong nhóm mô hình thời gian thực của ByteDance Seed, còn Seeduplex được Seed giới thiệu như một speech LLM song công toàn phần có thể lắng nghe trong khi đang nói. Với phone agent, chúng quan trọng vì làm hội thoại giọng nói tự nhiên hơn.
Full duplex cho phép hệ thống tiếp tục nghe người dùng trong lúc đang phản hồi, nên agent có thể xử lý ngắt lời, sửa ý, khoảng im lặng và tiếng ồn linh hoạt hơn. Điều này cải thiện mặt phẳng hội thoại, nhất là trên điện thoại.
Mô hình full duplex giúp hiểu và trao đổi bằng giọng nói tốt hơn, còn điều khiển Android cần lớp thực thi riêng: quyền hệ thống, công cụ được quản trị, trạng thái tác vụ, phê duyệt, xác minh kết quả và phục hồi.
Cần một hợp đồng từ ý định tới kết quả: thu nhận, làm rõ, lập kế hoạch, phê duyệt, thực thi, xác minh và phục hồi. Nếu thiếu các bước này, hội thoại tự nhiên vẫn có thể dẫn tới hành động mơ hồ hoặc khó kiểm tra trên điện thoại.
FoneClaw hiện xây lớp thực thi Android cho các tác vụ được hỗ trợ. Người dùng kích hoạt giọng nói hoặc gắn ngữ cảnh màn hình, mô hình được cấu hình lập kế hoạch, còn công cụ được quản trị thực hiện hành động qua quyền Android với phê duyệt, kết quả và phục hồi rõ.