뉴스
📅 2026-08-08 ⏱️ 12분 Dean Dean

SeedRealtime 풀듀플렉스 폰 에이전트: 실시간 음성 대화와 Android 실행 계층의 차이

SeedRealtime과 Seeduplex가 보여 준 풀듀플렉스 음성 AI의 의미를 설명하고, 실제 Android 폰 에이전트가 대화 이후 권한, 승인, 검증, 복구 실행 계층을 어떻게 갖춰야 하는지 FoneClaw 제품팀 관점에서 정리합니다.

풀듀플렉스 음성 AI 대화가 FoneClaw Android 폰 에이전트의 승인과 실행 계층으로 이어지는 구조
📋 핵심 요약
  • SeedRealtime과 Seeduplex는 사용자가 말하는 동안 모델도 듣고 반응을 조정하는 풀듀플렉스 음성 AI 흐름을 보여 줍니다.
  • 풀듀플렉스는 대화의 자연스러움을 크게 바꾸지만, Android 폰 작업에는 별도의 권한, 승인, 실행, 검증, 복구 계층이 필요합니다.
  • FoneClaw에서 우리는 현재 공개된 기준으로 사용자가 호출하는 음성 입력, 현재 화면 첨부, 플로팅 어시스턴트, 같은 휴대폰 안 작업 연속성, 권한 복구를 실행 계층의 기반으로 만들고 있습니다.
  • 미래의 실시간 음성 에이전트는 듣기와 말하기만 잘해서 완성되지 않습니다. 의도 포착, 확인, 실행, 결과 검증, 복구까지 이어지는 계약이 있어야 실용적인 폰 에이전트가 됩니다.

SeedRealtime과 Seeduplex가 폰 에이전트에 바꾸는 것

SeedRealtime 풀듀플렉스 폰 에이전트라는 질문의 핵심은 “더 자연스러운 대화가 실제 휴대폰 실행을 어디까지 바꾸는가”입니다. ByteDance Seed는 2026년 4월 9일 Seed Full-Duplex Speech LLM 소개 글에서 Seeduplex가 말하는 동안에도 사용자의 음성을 계속 듣는 listen-while-speaking 구조를 쓴다고 설명했습니다. Seed는 간섭 억제, 발화 종료 판단, 끼어들기 처리에서 개선을 보고했고, Doubao에 이 흐름을 적용한다고 밝혔습니다.

SeedRealtime 모델 페이지는 Seed의 현재 모델군 맥락을 확인하는 데 도움이 됩니다. 여기서 중요한 변화는 음성 AI가 “사용자가 말하고, 모델이 기다리고, 다시 대답하는” 순서형 대화에서 벗어난다는 점입니다. 풀듀플렉스에서는 모델이 말하는 중에도 사용자의 짧은 정정, 망설임, 중단 요청, 주변 소음을 함께 판단합니다. 전화 통화처럼 자연스러운 흐름에 가까워지는 것입니다.

FoneClaw를 만들면서 우리는 이 변화가 폰 에이전트에 매우 중요하다고 봅니다. 사용자는 휴대폰에게 길게 명령을 외우고 싶어 하지 않습니다. “잠깐, 그건 민지가 아니라 민수야”, “보내지는 말고 초안으로 둬”, “회의 모드로 바꿔, 그런데 알람은 살려 둬”처럼 말 중간에 계속 고칩니다. 더 넓은 음성 우선 관점은 음성 우선 AI 폰: 다음 휴대폰 인터페이스는 왜 말하기에서 시작해야 하나에서 다루고, 이 글은 그 대화가 Android 실행으로 이어질 때 필요한 구조를 설명합니다.

풀듀플렉스 음성 AI가 멈춤, 소음, 끼어들기를 다루는 방식

기존 음성 assistant의 많은 경험은 반이중에 가깝습니다. 사용자가 말하고, 시스템이 발화가 끝났다고 판단하고, 그다음 모델이 답합니다. 이 구조에서는 사용자가 말을 고치려 해도 assistant가 이미 답변을 시작했거나, 사용자의 짧은 “아니”를 잡지 못하는 일이 생깁니다. 풀듀플렉스 음성 AI는 듣기와 말하기를 동시에 다루며, 사용자가 중간에 끼어드는 순간을 대화의 일부로 처리합니다.

실제 구현에서는 세 가지가 중요합니다. 첫째, 발화 종료 판단입니다. 사용자가 잠깐 멈춘 것인지 말을 끝낸 것인지 구분해야 합니다. 둘째, 끼어들기 처리입니다. 모델이 말하는 중 사용자가 “잠깐”이라고 말하면 답변을 줄이거나 멈추고 새 의도를 받아야 합니다. 셋째, 간섭 억제입니다. TV 소리, 옆 사람 말, 도로 소음이 사용자의 실제 명령과 섞일 수 있습니다. Seed는 앞선 발표에서 이런 영역의 개선을 자체 기준으로 보고했습니다. 이런 수치는 Seed가 발표한 성능 설명으로 읽는 것이 정확합니다.

연구 관점에서는 사용자가 모델 발화 중에 말한 오디오를 어떻게 라우팅할지도 중요한 문제입니다. How Should LLMs Listen While Speaking?는 full-duplex 시스템에서 생성 중 들어오는 사용자 음성을 모델이 어떻게 반영할지, 채널 융합과 cross-attention 방식이 grounding과 문맥 강건성 사이에서 어떤 tradeoff를 만드는지 다룹니다. 폰 에이전트에는 이 tradeoff가 바로 제품 문제로 나타납니다. 사용자의 중간 정정을 잘 들어야 하지만, 주변 소음을 실행 명령으로 오해해서도 안 됩니다.

추론 속도도 영향을 줍니다. 대화가 자연스러워지려면 듣기, 판단, 응답이 짧은 지연 안에 돌아야 합니다. 빠른 모델 추론이 휴대폰 에이전트 경험에 주는 의미는 1000 TPS LLM과 휴대폰 AI 에이전트: 빠른 추론이 바꾸는 것에서 더 깊게 볼 수 있습니다.

대화 계층과 Android 실행 계층을 나눠야 하는 이유

풀듀플렉스 모델은 대화 계층을 크게 발전시킵니다. 사용자가 끼어들고, 말을 고치고, 생각을 바꾸고, 짧은 신호로 확인하는 과정을 더 자연스럽게 처리할 수 있습니다. 하지만 대화가 자연스럽다는 사실이 곧 Android 행동을 실행할 권한이 생겼다는 뜻은 아닙니다. 휴대폰에서는 메시지 전송, 방해금지 변경, 전화 준비, 지도 앱 호출, 설정 변경처럼 외부 결과가 생기는 행동이 많습니다.

우리는 FoneClaw를 만들며 이 둘을 명확히 나누고 있습니다. 첫 번째는 interaction plane입니다. 여기서는 음성, 텍스트, 현재 화면 맥락, 사용자의 정정과 끼어들기를 이해합니다. 두 번째는 execution plane입니다. 여기서는 Android 권한, 지원되는 도구, 승인, 실행 상태, 결과 검증, 복구가 작동합니다. SeedRealtime이나 Seeduplex 같은 실시간 음성 모델은 interaction plane을 강하게 만들 수 있습니다. Android 폰 에이전트 구조는 그다음 실행 계층을 별도로 가져야 합니다.

두 계층을 섞으면 제품이 불안정해집니다. 사용자가 “그거 보내”라고 말했을 때, “그거”가 어느 메시지인지, 받는 사람이 누구인지, 본문이 완성됐는지, 보내기 버튼이 안정적으로 보이는지, 듀얼 SIM 선택이 필요한지 확인해야 합니다. 모델이 사람처럼 말을 잘 주고받아도 이런 조건은 Android 실행 계약의 문제입니다. 폰 작업 실행의 큰 틀은 AI 에이전트 폰 제어란 무엇인가: 안드로이드 폰 에이전트가 실제로 해야 할 일에서 이어서 볼 수 있습니다.

말한 의도에서 검증된 결과까지의 7단계 계약

실시간 음성 에이전트가 Android에서 유용해지려면 대화 뒤에 실행 계약이 붙어야 합니다. 우리가 FoneClaw에서 쓰는 관점은 일곱 단계입니다. 이 구조는 모델 종류와 독립적입니다. 어떤 풀듀플렉스 모델이 붙더라도, 휴대폰에서 실제 행동을 하려면 같은 질문을 통과해야 합니다.

  1. 포착: 사용자의 음성, 텍스트, 화면 맥락을 받습니다. FoneClaw의 현재 화면 맥락은 사용자가 호출하고 첨부하는 방식입니다.
  2. 명확화: 수신자, 앱, 시간, 대상 파일, 설정 범위처럼 애매한 부분을 확인합니다.
  3. 계획: 요청을 지원되는 Android 작업으로 나눕니다. 예를 들어 방해금지 변경, SMS 초안, 전화 준비, 지도 앱 넘기기가 서로 다른 계획이 됩니다.
  4. 승인: 외부 효과가 있는 단계에서 사용자에게 대상, 이유, 결과를 보여 줍니다.
  5. 실행: Android 권한과 관리되는 도구 안에서 작업을 수행합니다.
  6. 검증: 설정이 바뀌었는지, 초안이 보이는지, 길 안내가 선택한 앱에 전달됐는지 확인합니다.
  7. 복구: 권한 부족, 화면 변화, 네트워크 문제, 모호한 버튼이 있으면 사용자가 이어갈 수 있는 경로를 보여 줍니다.

풀듀플렉스 대화는 이 일곱 단계 중 포착과 명확화를 크게 개선합니다. 사용자가 중간에 정정해도 흐름을 놓치지 않고, 모델이 말하는 도중 사용자가 멈춤을 요청할 수 있습니다. 하지만 승인, 실행, 검증, 복구는 여전히 제품 설계의 영역입니다. 작업 이유와 승인 화면을 더 깊게 보고 싶다면 AI 에이전트 승인 UX: 신뢰도, 작업 이유, 확인과 복구를 설계하는 법이 도움이 됩니다.

우리가 현재 FoneClaw 실행 계층을 만드는 방식

현재 공개된 FoneClaw는 Android 실행 계층의 기준입니다. 우리는 플로팅 어시스턴트, 같은 휴대폰 안의 작업 연속성, 권한 복구, 빠른 작업을 제공합니다. 사용자는 앱을 쓰는 도중 플로팅 어시스턴트를 열고 요청을 시작할 수 있고, Home과 플로팅 어시스턴트 사이에서 같은 작업의 승인과 복구를 이어갈 수 있습니다. 현재 버전은 FoneClaw 다운로드에서 확인할 수 있습니다.

FoneClaw의 음성 입력은 사용자가 호출할 때 시작됩니다. 현재 화면 맥락도 사용자가 한 번 눌러 첨부하는 방식입니다. 우리는 이 방식을 중요하게 봅니다. 폰 에이전트는 사용자에게 어떤 맥락이 들어갔는지 보여 줘야 하고, 외부 결과가 생기는 작업은 승인과 검증을 거쳐야 합니다. FoneClaw의 현재 화면 흐름은 Android 플로팅 AI 어시스턴트 현재 화면: 묻고 확인하고 실행하는 방법에서 더 자세히 설명합니다.

현재 제품에서 FoneClaw는 SeedRealtime이나 Seeduplex를 공식 통합 항목으로 제공하는 글이 아닙니다. 이 글에서 SeedRealtime은 interaction plane의 중요한 참고 사례입니다. FoneClaw가 맡는 계층은 그다음입니다. 사용자의 의도를 Android 권한, 관리되는 도구, 보이는 승인, 결과 검증, 복구로 이어 가는 실행 계층입니다. 현재 지원되는 예로는 방해금지 변경 준비와 상태 확인, 보이는 메시지 초안, 전화 준비, 선택한 지도 앱으로 내비게이션 넘기기, 일부 Android 설정 workflow가 있습니다. FoneClaw의 사용자 관점 기능은 FoneClaw 기능에서 확인할 수 있습니다.

실행 안전장치가 필요한 풀듀플렉스 폰 에이전트 상황

첫 번째 상황은 회의 전 방해금지입니다. 사용자가 “회의 모드로 바꿔 줘, 그런데 알람은 살려 둬”라고 말하고, 에이전트가 답하는 중 사용자가 “30분만”이라고 끼어들 수 있습니다. 풀듀플렉스 모델은 이 정정을 자연스럽게 받아들일 수 있습니다. 실행 계층은 그다음에 설정 범위, 시간, 예외 알림, 현재 상태를 확인하고 결과를 보여 줍니다.

두 번째는 메시지 받아쓰기입니다. 사용자가 “민수에게 10분 늦는다고 보내”라고 했다가, 모델이 읽어 주는 중 “아니, 민지가 아니라 민수 팀장”이라고 고칠 수 있습니다. 대화 계층은 정정을 이해합니다. 실행 계층은 수신자, 본문, 기본 메시지 앱, 보내기 컨트롤이 안정적인지 확인합니다. 조건이 맞으면 전송으로 이어지고, 수신자나 화면이 모호하면 초안을 보이는 상태로 남깁니다.

세 번째는 전화와 길 안내입니다. 사용자가 “고객에게 전화하고, 끝나면 회사로 길 안내해 줘”라고 말할 수 있습니다. 이 요청은 하나의 문장처럼 들리지만 실제로는 전화 준비, 통화 완료 후 상태, 지도 앱 선택, 목적지 전달이 이어지는 작업입니다. 중간에 사용자가 “아니, 먼저 길 안내부터”라고 끼어들면 대화 계층은 계획을 바꿔야 하고 실행 계층은 이미 진행한 단계와 남은 단계를 분리해야 합니다. 이런 구조가 실제 Android 폰 에이전트의 핵심입니다.

개인정보, 배터리, 시청각 한계와 다음에 만들 것

풀듀플렉스 음성 AI는 마이크, 지연 시간, 배터리, 주변 소음이라는 현실 조건을 갖습니다. 사용자가 말하는 동안 계속 듣는 구조는 대화 품질을 높일 수 있지만, 폰에서는 호출 상태와 듣기 상태를 사용자가 이해할 수 있어야 합니다. FoneClaw의 현재 방향은 사용자가 호출하는 음성 입력과 사용자가 첨부하는 화면 맥락입니다. 이 방식은 작업에 필요한 정보를 명확한 순간에 전달하게 만듭니다.

시각 정보는 또 다른 과제입니다. Seed의 2026년 4월 발표는 visual input과 proactive interaction을 향후 과제로 제시했습니다. 이는 풀듀플렉스 음성 모델이 곧바로 listen-see-speak 전체를 해결했다는 의미보다, 음성 뒤에 시각 grounding이 계속 중요해진다는 신호입니다. VideoFDB full-duplex audio-visual benchmark는 스트리밍 시청각 grounding이 별도 평가 과제이며, 많은 시스템이 명시적인 시각 질문 밖에서는 시각 스트림을 충분히 쓰지 못하는 경향을 보인다고 설명합니다.

우리가 다음에 계속 만들어야 할 것도 분명합니다. 더 자연스러운 대화 포착, 낮은 지연 시간, 사용자 호출 중심의 맥락 첨부, 권한별 승인, 결과 검증, 실패 복구가 한 제품 흐름으로 이어져야 합니다. builder checklist로 보면 다섯 가지입니다. 사용자가 듣기 상태를 아는가. 중간 정정이 작업 상태에 반영되는가. 권한과 승인이 실제 행동에 묶이는가. 결과가 검증되는가. 실패했을 때 사용자가 이어갈 수 있는가. SeedRealtime 같은 실시간 음성 모델이 더 좋아질수록, FoneClaw가 맡는 Android 실행 계약의 중요성도 더 커집니다.

자주 묻는 질문

SeedRealtime은 ByteDance Seed의 모델군 맥락에서 소개되는 실시간 모델 이름이고, Seeduplex는 2026년 4월 9일 Seed가 발표한 full-duplex speech LLM입니다. Seed는 이 구조가 말하는 동안에도 사용자의 음성을 듣고, 간섭 억제와 끼어들기 처리를 개선한다고 설명했습니다.
풀듀플렉스는 사용자가 말한 뒤 모델이 기다리는 순서형 대화에서 벗어나, 모델이 말하는 중에도 사용자의 정정, 끼어들기, 멈춤 신호를 받을 수 있게 합니다. 폰 에이전트에서는 “잠깐”, “그 사람 말고”, “보내지 말고 초안으로” 같은 중간 수정이 더 자연스러워집니다.
풀듀플렉스 모델은 대화 계층을 강화합니다. Android 폰 작업에는 별도의 실행 계층이 필요합니다. 권한, 지원되는 도구, 사용자 승인, 결과 검증, 복구가 있어야 메시지 전송, 설정 변경, 전화 준비, 길 안내 같은 행동이 안정적으로 이어집니다.
말한 의도를 실제 결과로 바꾸려면 포착, 명확화, 계획, 승인, 실행, 검증, 복구의 단계가 필요합니다. 특히 외부 효과가 있는 행동은 대상과 결과가 보이고, 사용자가 승인하거나 멈출 수 있어야 합니다.
FoneClaw는 Android 폰 에이전트의 실행 계층을 만들고 있습니다. 현재 공개된 기준으로 사용자가 호출하는 음성 입력, 플로팅 어시스턴트, 현재 화면 첨부, 같은 휴대폰 안 작업 연속성, 권한 복구를 바탕으로 지원되는 Android 행동을 보이는 승인과 결과 검증으로 이어 갑니다.