Noticias
📅 2026-08-08 ⏱️ 12 min Dean Dean

SeedRealtime y FoneClaw: voz full duplex y ejecución Android gobernada

Qué cambian SeedRealtime y Seeduplex para un agente telefónico full duplex, y por qué un agente Android práctico necesita permisos, aprobaciones, verificación y recuperación.

Agente de voz en tiempo real hablando con un usuario mientras FoneClaw verifica una acción Android en el teléfono
📋 Puntos clave
  • SeedRealtime y Seeduplex apuntan a una IA de voz full duplex capaz de escuchar mientras responde, gestionar interrupciones y hacer que la conversación se sienta más natural.
  • La conversación full duplex mejora el plano de interacción, pero la ejecución Android sigue necesitando permisos, estado de tarea, aprobación, verificación y recuperación.
  • En FoneClaw construimos la capa de ejecución gobernada: un modelo configurado razona y herramientas Android soportadas realizan acciones visibles y revisables.
  • El siguiente salto para agentes de teléfono combina baja latencia, escucha robusta, contexto visual bajo demanda, privacidad, batería cuidada y contratos de acción verificables.

Qué cambian SeedRealtime y Seeduplex para agentes de teléfono

SeedRealtime y Seeduplex importan para cualquier constructor de agentes de teléfono porque trasladan la conversación de voz hacia un patrón más cercano al diálogo humano. En el anuncio de ByteDance Seed del 9 de abril de 2026 sobre su modelo de habla full duplex, Seed describe Seeduplex como un marco nativo capaz de escuchar mientras habla, manejar interrupciones, mejorar la detección de fin de turno y reducir interferencias. Seed también indicó despliegue en Doubao, lo que convierte el avance en algo más que una demostración de laboratorio.

La página oficial de SeedRealtime en la familia de modelos Seed sitúa el nombre dentro de una línea de modelos en tiempo real. Para un agente de teléfono, la idea clave es la latencia conversacional: el usuario puede corregir, interrumpir, añadir contexto o cambiar de intención sin esperar a que la IA termine un monólogo. Esa fluidez reduce fricción en tareas móviles como dictar, corregir, confirmar, cancelar o pedir una explicación rápida.

Desde FoneClaw, leemos este avance como una señal fuerte para la interfaz de voz. Estamos construyendo hacia un teléfono donde la voz es la primera entrada, los botones físicos aportan control y la pantalla muestra evidencia y aprobación. Teléfono con IA de voz primero: por qué la próxima interfaz no elimina botones ni pantalla desarrolla esa tesis de interacción; aquí damos el siguiente paso: una voz más natural necesita una capa de ejecución Android igualmente gobernada.

Cómo la IA full duplex maneja pausas, ruido e interrupciones

En un sistema half duplex, la conversación se parece a una llamada por turnos: una parte habla, la otra espera, y la interrupción suele ser torpe. En una IA de voz full duplex, el modelo puede generar audio mientras sigue escuchando al usuario. Eso permite corregir sobre la marcha: “espera, no envíes eso”, “cambia Marta por Marcos”, “hazlo después de la reunión” o “repíteme solo el destino”. Para un agente de voz en tiempo real, esa capacidad cambia la sensación de control.

La mecánica central incluye detección de fin de intervención, manejo de interrupciones, supresión de habla lateral y decisión de enrutamiento del audio entrante. Si el usuario hace una pausa breve para pensar, el modelo necesita distinguirla de un turno terminado. Si alguien habla de fondo, debe evitar que esa voz cambie la tarea. Si el usuario interrumpe mientras el agente responde, la interrupción puede ser una corrección, una cancelación o una nueva instrucción. Seed atribuye mejoras en esas áreas al marco Seeduplex; la lectura técnica es que el modelo ya no trata el habla entrante como ruido residual, sino como señal que puede modificar el turno actual.

La investigación How Should LLMs Listen While Speaking? ayuda a explicar el problema. El trabajo estudia cómo enrutar audio del usuario mientras el modelo genera respuesta, y muestra intercambios entre fusión de canales, atención cruzada, robustez de contexto y anclaje de la señal. En términos de producto, escuchar mientras se habla exige decidir qué parte de la señal modifica el plan y qué parte se ignora.

Para agentes de teléfono, la velocidad del modelo también importa. Una respuesta full duplex pierde valor si el retraso hace que el usuario repita o abandone. Por eso enlazamos esta discusión con LLM de 1000 TPS para agentes de teléfono: qué cambia, donde analizamos cómo la inferencia de baja latencia influye en agentes móviles. La voz natural necesita escucha continua durante el turno, pero también necesita planificación rápida y una salida que el teléfono pueda ejecutar con seguridad.

Por qué conversación y ejecución Android son dos planos separados

Una IA de voz full duplex mejora el plano de interacción. Hace más natural hablar con el sistema, interrumpirlo, corregirlo y aclarar una intención. La ejecución Android vive en otro plano: permisos, apps, ajustes, contactos, mensajes, llamadas, mapas, archivos, estado de pantalla y consecuencias externas. Confundir esos planos produce el error clásico de los asistentes móviles: una conversación fluida se interpreta como autorización suficiente para actuar.

En FoneClaw los separamos de forma deliberada. El plano de interacción capta intención, preguntas, correcciones, cambios de prioridad y cancelaciones. El plano de ejecución toma esa intención y la convierte en una tarea con contrato: qué acción se va a intentar, qué permiso hace falta, qué herramienta gobernada se usará, qué resultado se espera y qué punto de aprobación corresponde. Esta separación permite que un usuario diga “sí, pero antes revisa el destinatario” o “cancela el envío y guarda un recordatorio” sin perder el hilo.

Un modelo full duplex puede entender una frase como “pon el teléfono en modo reunión”. Android necesita más precisión: cuánto tiempo, qué ajustes cambian, si se activa No molestar, qué excepciones quedan, cómo se confirma el estado y cómo se revierte. El modelo conversa; el agente de teléfono gobierna ejecución. Para una base más amplia de esta capa, Control del teléfono con agente de IA: qué puede hacer de verdad un phone AI agent explica cómo una intención se transforma en acciones Android soportadas.

Un contrato de siete etapas desde intención hablada hasta resultado verificado

Cuando construimos FoneClaw, una de las lecciones más útiles fue convertir cada tarea de voz en un contrato observable. Un usuario no necesita ver cada detalle técnico, pero sí necesita saber qué está pasando y dónde puede intervenir. Para un agente telefónico full duplex, proponemos siete etapas desde la frase hablada hasta el resultado verificado.

  1. Capturar. El sistema recibe la voz iniciada por el usuario y mantiene el turno abierto para pausas, correcciones e interrupciones.
  2. Aclarar. El agente resuelve ambigüedades: contacto, app, duración, destino, cuenta, SIM, adjunto o ajuste.
  3. Planificar. La intención se convierte en pasos Android soportados, con herramienta, permiso, entrada y salida esperada.
  4. Aprobar. Las acciones con efecto externo muestran objetivo, consecuencia y evidencia antes de aplicar el cambio.
  5. Ejecutar. La herramienta gobernada realiza la acción dentro del permiso y estado disponibles en Android.
  6. Verificar. El agente comprueba el resultado visible o el estado devuelto por la ruta soportada.
  7. Recuperar. Si falta permiso, la pantalla cambió, el control es ambiguo o el usuario interrumpe, la tarea queda en un estado continuable.

Este contrato es más importante con IA de voz full duplex porque la conversación se mueve rápido. El usuario puede decir “hazlo”, corregir mientras el agente responde y después pedir otra acción. El estado debe acompañar esa velocidad. La aprobación también debe seguir vinculada a la tarea correcta, no a una frase aislada. UX de aprobación de agentes de IA: decisiones claras en el teléfono profundiza en cómo mostrar razón, objetivo, consecuencia y evidencia sin convertir cada tarea en un formulario pesado.

Cómo estamos construyendo la capa de ejecución actual de FoneClaw

La base actual de FoneClaw es nuestra referencia para esta capa de ejecución. Aporta asistente flotante, continuidad de tareas en el mismo teléfono, recuperación de permisos y acciones rápidas; puedes revisar la información más reciente disponible desde la página de descarga de FoneClaw. Estas funciones no intentan replicar Seeduplex. Resuelven el otro lado del problema: una vez que la conversación produce una intención, el teléfono necesita mantener estado, permisos, aprobación, detención y recuperación.

La entrada de voz de FoneClaw es iniciada por el usuario. El contexto de pantalla actual también se adjunta bajo demanda, de forma deliberada. Esa decisión nos permite construir una experiencia útil para tareas reales sin convertir el teléfono en un micrófono o cámara permanentes. Cuando el usuario aporta voz o pantalla, el modelo configurado razona dentro de FoneClaw y las herramientas gobernadas trabajan sobre acciones Android soportadas.

Los ejemplos actuales incluyen cambios gobernados de No molestar, borradores de mensajes visibles, preparación de llamadas, entrega de navegación a la app de mapas elegida y determinados flujos de ajustes Android. En todos esos casos, nos importa que el usuario vea el paso sensible, pueda aprobar, detener y recuperar. La página de funciones de FoneClaw resume capacidades actuales y 100+ built-in tools desde una vista de producto.

El artículo sobre Asistente de IA flotante en Android: usar la pantalla actual con control explica la pieza visual actual: asistente flotante, panel compacto, pantalla actual bajo demanda y continuidad entre entradas del mismo teléfono. Esa es la base que una voz full duplex necesitaría para convertirse en acción Android responsable: conversación rápida arriba, ejecución verificable abajo.

Escenarios full duplex que necesitan garantías de ejecución

El primer escenario es modo reunión. El usuario dice: “activa modo reunión hasta las cuatro”. Mientras el agente responde, el usuario añade: “deja pasar llamadas de mi familia”. La voz full duplex ayuda a recibir esa corrección sin reiniciar el flujo. La ejecución gobernada traduce la intención en ajustes concretos, muestra la duración, excepciones y efecto, pide aprobación y verifica el estado final.

El segundo escenario es mensajería. El usuario dicta: “prepara un SMS para Marta diciendo que llego tarde”. A mitad de respuesta corrige: “mejor pon veinte minutos, no diez”. El plano de interacción debe incorporar la corrección; el plano de ejecución debe verificar destinatario, cuerpo completo, app predeterminada y control de envío. Si aparece doble SIM o una pantalla ambigua, la tarea se mantiene visible para revisión.

El tercer escenario es llamada o navegación. El usuario dice: “llama al taller y abre la ruta si no contestan”. Esa frase combina telefonía, decisión condicional y mapas. Un modelo full duplex puede aclarar el taller correcto y recibir cambios durante la conversación. La ejecución Android debe preparar la llamada, entregar navegación a la app de mapas seleccionada cuando proceda y mostrar qué paso quedó completado.

El cuarto escenario es una tarea interrumpida. El usuario empieza una secuencia, recibe una notificación y vuelve más tarde. La base actual de FoneClaw ya trabaja la continuidad en el mismo teléfono para que la tarea conserve aprobación, detención y recuperación. Para más ejemplos de flujos Android soportados, Control del teléfono con agente de IA: qué puede hacer de verdad un phone AI agent ofrece el marco práctico.

Privacidad, batería, límites audiovisuales y próximos pasos

La IA de voz full duplex exige cuidado en privacidad y batería. Escuchar mientras se habla aumenta la complejidad del audio: hay micrófono, ruido, voz lateral, interrupciones y decisiones en tiempo real. En un teléfono, además, cada milisegundo de latencia compite con energía, temperatura y conectividad. Una buena experiencia no consiste solo en responder rápido; consiste en responder cuando el usuario inició la interacción, mantener señales claras y conservar control de permisos.

La parte visual añade otro reto. Seed menciona entrada visual e interacción proactiva como trabajo futuro en el lanzamiento citado. La investigación VideoFDB sobre evaluación full duplex audiovisual muestra que el anclaje audiovisual en streaming sigue siendo difícil, y que los sistemas evaluados pueden infrautilizar la señal visual fuera de preguntas explícitas sobre imagen. Para un agente Android, mirar la pantalla, escuchar al usuario y actuar en apps son tres problemas distintos.

La ruta que estamos construyendo en FoneClaw combina contexto bajo demanda y ejecución gobernada. El usuario aporta voz o pantalla cuando la tarea lo requiere; el agente mantiene estado; las herramientas trabajan dentro de permisos Android; las acciones sensibles se revisan; el resultado se verifica; la recuperación devuelve control cuando algo cambia. Ese patrón nos prepara para modelos de interacción más fluidos sin perder el contrato de acción.

Checklist para construir un agente telefónico full duplex práctico: captar voz iniciada por el usuario, manejar interrupciones, distinguir ruido de intención, pedir contexto visual solo cuando aporta valor, planificar acciones Android soportadas, aprobar antes de efectos externos, verificar resultados, ofrecer recuperación y medir batería, latencia y errores de acción. SeedRealtime y Seeduplex elevan el listón de conversación; el agente de teléfono completo se gana la confianza cuando esa conversación termina en una acción clara, permisada y verificable.

Preguntas frecuentes

SeedRealtime forma parte de la familia de modelos de ByteDance Seed y Seeduplex es el marco de habla full duplex presentado por Seed el 9 de abril de 2026. Su idea central es permitir que la IA escuche mientras habla, con mejor manejo de interrupciones, fin de turno e interferencias.
Cambia el ritmo de la conversación. El usuario puede interrumpir, corregir o añadir información mientras el agente responde. Para teléfonos, eso ayuda a dictar, cancelar, aclarar y ajustar tareas sin reiniciar cada turno.
Un modelo full duplex mejora la interacción de voz, pero Android requiere una capa de ejecución con permisos, estado de tarea, herramientas gobernadas, aprobación, verificación y recuperación. La conversación y la acción del teléfono deben coordinarse mediante un contrato claro.
Falta convertir la intención hablada en etapas verificables: capturar, aclarar, planificar, aprobar, ejecutar, verificar y recuperar. Ese contrato mantiene la tarea correcta, evita cambios ambiguos y permite que el usuario conserve control sobre acciones sensibles.
FoneClaw aporta la capa de agente Android: voz iniciada por el usuario, contexto de pantalla bajo demanda, modelo configurado, herramientas gobernadas, permisos Android, aprobaciones visibles, resultados verificables y recuperación cuando una tarea necesita intervención.