Guía de agentes de IA
📅 2026-08-25 ⏱️ 9 min Dean Dean

Contexto de imagen con IA en Android: conservar, reanalizar y verificar

Cómo mantener la misma foto o captura en una tarea de IA, reanalizar los píxeles cuando cambia la pregunta y verificar cada acción en Android.

Asistente de IA en Android que mantiene una captura identificada, la reanaliza y verifica una acción posterior
📋 Puntos clave
  • Mantener una imagen en una conversación exige conservar el archivo correcto, su identidad y su acceso; el resumen textual anterior resulta insuficiente para algunas preguntas nuevas.
  • El selector de fotos, la cámara y la captura de pantalla ofrecen fuentes distintas, con requisitos propios de consentimiento, resolución, orientación y duración del acceso.
  • Un cambio de pregunta puede exigir volver a analizar los píxeles originales, especialmente al leer texto pequeño, revisar un recorte distinto o resolver resultados contradictorios.
  • FoneClaw mantiene referencias y dimensiones para tareas compatibles, renueva adjuntos cuando hace falta y lleva los hallazgos revisados a acciones Android con confirmación y verificación.

Qué significa mantener el contexto de una imagen

El contexto de imagen con IA en Android consiste en mantener disponible el mismo recurso visual durante una tarea de varias preguntas. Imagina que adjuntas una foto de un recibo. Primero preguntas por el comercio; después, por el total con impuestos; finalmente, quieres crear una nota con la fecha, el importe y la categoría. Las tres peticiones parten de la misma imagen, pero cada una necesita evidencias visuales diferentes.

Para que el recorrido sea fiable, el asistente debe distinguir tres elementos. El primero son los píxeles originales o una representación con resolución suficiente. El segundo es la referencia que identifica el archivo activo. El tercero son los hallazgos obtenidos en análisis anteriores, como “el recibo pertenece a una cafetería”. La conversación puede conservar ese texto y, aun así, haber perdido el detalle necesario para leer una línea pequeña situada al final.

Recordar una conclusión previa tampoco equivale a recordar toda la imagen. El primer análisis puede centrarse en el encabezado y omitir descuentos, impuestos o estado físico de un objeto. Cuando cambia la pregunta, el agente debe decidir si los hallazgos guardados bastan o si necesita abrir otra vez la imagen, usar un recorte diferente o preparar más detalle para el modelo multimodal.

Una secuencia breve ayuda a entenderlo:

  1. El usuario selecciona una captura y el asistente registra cuál es.
  2. La primera pregunta analiza el mensaje de error principal.
  3. Una segunda pregunta solicita el código pequeño de la esquina.
  4. El agente vuelve a los píxeles, amplía esa zona y compara la nueva lectura con la anterior.
  5. El usuario revisa el código antes de guardarlo o utilizarlo en otra acción.

El punto clave es la identidad del recurso. Si hay varias fotos en la conversación, el agente debe saber cuál sigue vinculada a la tarea. Expresiones como “esta”, “la anterior” o “la captura del error” necesitan resolverse contra una referencia visible y estable. Así se evitan respuestas construidas con una miniatura antigua, una imagen parecida o el último archivo adjuntado por accidente.

Elegir la foto, la cámara o la captura correcta

El origen de la imagen determina su calidad, procedencia y duración de acceso. Android ofrece tres recorridos habituales: seleccionar un elemento existente, tomar una foto o capturar la pantalla. Antes de analizar, conviene comprobar que la fuente corresponde a la tarea y que muestra el detalle necesario.

OrigenCuándo resulta útilQué conviene revisar
Selector de fotosRecibos guardados, documentos fotografiados e imágenes existentesArchivo seleccionado, recorte, orientación y duración del acceso
CámaraObjetos, etiquetas, daños o documentos presentes físicamenteEnfoque, luz, resolución y diferencia entre miniatura y archivo guardado
Captura de pantallaErrores, formularios, conversaciones o estados visibles de una appConsentimiento, ventana capturada, elementos superpuestos y datos sensibles

La guía de Android sobre el selector de fotos explica que el usuario puede conceder acceso a imágenes o vídeos concretos en vez de abrir toda la biblioteca. El sistema devuelve referencias a los elementos seleccionados y admite selección individual o múltiple. Para una tarea prolongada, la aplicación debe gestionar correctamente la duración de ese acceso.

Con la cámara, captura y análisis son pasos separados. La documentación de Android sobre captura mediante la aplicación de cámara describe cómo delegar una foto y recibir datos de imagen o un resultado guardado. Una miniatura puede servir para confirmar que se tomó la foto, mientras que leer texto pequeño o evaluar una grieta suele requerir el archivo de mayor resolución.

La captura de pantalla utiliza otro consentimiento. Según la guía de Android para capturar la pantalla con MediaProjection, el usuario autoriza cada sesión mediante un token de un solo uso. Según el recorrido disponible, puede capturarse la pantalla completa o una ventana de aplicación elegida. Antes de continuar, hay que comprobar que la imagen corresponde a la app correcta y que no incluye notificaciones, conversaciones u otros datos ajenos a la tarea.

Una captura también puede quedar desactualizada en segundos. Si la app cambió después de tomarla, el agente debe tratarla como una imagen de un momento concreto, no como una vista permanente del estado actual. Para adquirir ese contexto desde una ventana superpuesta con controles visibles, consulta Asistente de IA flotante en Android: usar la pantalla actual con control.

Conservar una referencia estable entre preguntas

Mantener la misma imagen exige algo más preciso que guardar “hay una captura en el chat”. La tarea necesita una identidad estable que diferencie ese archivo de versiones editadas, miniaturas y nuevos adjuntos. También debe conservar su origen: seleccionado por el usuario, tomado con la cámara o capturado desde una pantalla concreta.

Como mínimo, una referencia útil reúne estos datos:

  • Identificador del recurso vinculado a la conversación y a la tarea activa.
  • Origen y momento de selección o captura.
  • Tipo MIME y orientación de la imagen.
  • Anchura y altura originales o de la versión analizada.
  • Referencia local o remota disponible para volver a abrir los píxeles.
  • Estado del acceso y necesidad de renovación.
  • Historial de análisis, recortes utilizados y hallazgos confirmados.

Las dimensiones importan porque una coordenada carece de sentido sin conocer el tamaño al que se refiere. Un error situado cerca del píxel 900 puede estar en el centro de la imagen original y fuera de un recorte reducido. También influyen al trasladar una región detectada entre una miniatura, una versión comprimida y el archivo completo.

El acceso a una URI seleccionada puede ser temporal. Si la tarea continúa después de que caduque el permiso, el agente debe pedir que se renueve el acceso o que el usuario vuelva a seleccionar el elemento. Sustituirlo silenciosamente por otra imagen rompe la continuidad y puede llevar información incorrecta a una nota, un mensaje o un evento.

En FoneClaw hemos trabajado este recorrido para conservar dimensiones y referencias locales o remotas durante tareas compatibles. La referencia queda asociada a la conversación que la usa y puede renovarse cuando la preparación multimodal detecta que el adjunto necesita acceso actualizado. Para el usuario, la señal práctica es sencilla: la misma miniatura y la misma procedencia deben seguir visibles antes de una nueva pregunta.

Si el archivo cambia deliberadamente, el flujo debe reflejarlo. Recortar una foto para ampliar una etiqueta crea una nueva representación relacionada con la original. Conviene registrar qué versión se analizó y permitir volver al archivo completo. Esta relación evita que una conclusión obtenida en un recorte se aplique a una zona que nunca estuvo presente.

Cuándo volver a analizar la imagen original

El reanálisis de imágenes con IA se activa cuando la nueva pregunta necesita pruebas que el análisis anterior no recogió. El agente puede empezar revisando los hallazgos disponibles. Si contienen la evidencia necesaria y siguen vinculados al archivo correcto, puede reutilizarlos. Si la petición cambia de zona, nivel de detalle o tipo de razonamiento, debe regresar a los píxeles.

Un recibo ilustra tres motivos distintos. “¿De qué comercio es?” se resuelve normalmente con el encabezado. “¿Cuál es el total después del descuento?” exige revisar importes, signos y líneas cercanas al final. “¿Hay dos cargos del mismo producto?” requiere recorrer las partidas y comparar cantidades. Repetir el primer resumen para responder las otras preguntas produciría una falsa continuidad.

En una captura de error, la primera consulta puede identificar la app y el mensaje principal. Una petición posterior sobre el código exacto necesita ampliar una región pequeña y preservar mayúsculas, guiones y números. Cuando hay una interfaz estructurada disponible, combinar píxeles con información de elementos puede ofrecer más contexto. La guía Comprensión de pantalla en agentes IA Android: árbol UI, captura o ambos explica cuándo conviene usar cada fuente.

Una foto de un objeto plantea otro tipo de evidencia. Reconocer que es un electrodoméstico y evaluar si una pieza parece dañada son tareas diferentes. La segunda puede requerir la imagen original, un recorte de mayor resolución y quizá otra foto tomada desde un ángulo distinto. El agente debe pedir esa nueva evidencia cuando la imagen actual no muestra la zona con claridad.

La preparación multimodal también tiene límites prácticos. Las imágenes consumen contexto y pueden reducirse o comprimirse para ajustarse al presupuesto del modelo. Ese proceso favorece la velocidad, pero puede ocultar letras pequeñas, texturas o bordes finos. Para una pregunta detallada, es preferible preparar un recorte preciso o una versión de mayor resolución en lugar de confiar en una representación comprimida para una consulta general.

El ciclo fiable tiene cuatro decisiones: identificar la nueva pregunta, localizar la evidencia necesaria, elegir la versión o recorte adecuado y comparar el resultado con los hallazgos anteriores. Si aparece una contradicción relevante, la acción posterior se detiene mientras el usuario revisa la imagen o aporta otra fuente. Un total leído como 18,90 en un turno y 78,90 en otro necesita resolución antes de crear un registro de gastos.

FoneClaw prepara de nuevo el adjunto cuando una pregunta requiere otra lectura, conserva la relación con el recurso original y renueva el acceso cuando corresponde. El modelo configurado dentro del agente recibe la imagen adecuada para esa petición; los resultados anteriores sirven como contexto, pero no sustituyen la evidencia visual que exige la nueva pregunta.

Verificar acciones y recuperar un contexto desactualizado

Extraer información es solo la mitad de una tarea de imagen a acción. Antes de crear una nota, programar un recordatorio o preparar un mensaje, el usuario debe ver los valores que el agente pretende utilizar. La vista previa conecta la evidencia visual con el cambio que ocurrirá en Android.

Si una captura contiene una fecha de vencimiento, la propuesta puede mostrar “Recordatorio: renovar el servicio; fecha: 14 de septiembre; hora: 09:00”. Si procede de un recibo, una nota puede incluir comercio, fecha, total y categoría. Cada campo importante debe poder compararse con la imagen antes de aprobar.

Señal de falloRiesgo para la tareaRecuperación adecuada
El adjunto ha caducadoLos píxeles ya no están disponibles para confirmar detallesRenovar el acceso o volver a seleccionar el mismo archivo
La miniatura no coincideLa pregunta puede estar vinculada a otra imagenDetener la acción y elegir explícitamente el recurso correcto
Texto borroso o cortadoFechas, importes o códigos pueden quedar incompletosUsar la imagen completa, otro recorte o una nueva captura
Dos análisis discrepanEl valor enviado podría ser incorrectoMostrar ambas lecturas y solicitar revisión humana
La app de destino cambióLa acción puede quedar sin guardar o en otra ubicaciónComprobar el estado actual y repetir solo el paso pendiente
La pantalla final no confirma el resultadoUna interacción aparente puede haberse perdidoBuscar la nota, evento o registro creado antes de continuar

La comprobación posterior debe apoyarse en una señal del destino. Para una nota, hay que verla guardada con el contenido correcto. Para un evento, debe aparecer en el calendario elegido. Para un borrador, destinatario y texto deben seguir visibles. Pulsar un botón o cerrar una ventana indica que se intentó la acción; el resultado verificable demuestra que quedó registrada.

Cuando el contexto visual está desactualizado, la recuperación conserva lo que sí es fiable. Si ya se confirmó el comercio, pero el total permanece dudoso, no hace falta reiniciar toda la conversación. El agente puede mantener el dato confirmado, renovar la imagen y repetir únicamente la lectura del importe. Este enfoque reduce trabajo sin arrastrar una suposición insegura.

Permisos concretos y conservación deliberada

El contexto visual debe empezar con la selección más estrecha que resuelva la tarea. La recomendación de Android para reducir solicitudes de permisos destaca recorridos como el selector de fotos, que concede acceso temporal a los elementos elegidos por el usuario. Este mecanismo permite trabajar con una imagen concreta sin abrir toda la biblioteca.

Antes de seleccionar o capturar, revisa qué aparece alrededor del objeto de interés. Un recibo puede mostrar los últimos dígitos de una tarjeta; una captura puede incluir notificaciones; una foto de una etiqueta puede revelar una dirección. Recortar o volver a tomar la imagen ayuda a limitar el contexto antes de compartirlo con el modelo configurado.

Durante la tarea, conviene mantener visible cuál es el archivo activo y para qué se usa. Una pregunta nueva puede requerir más detalle, pero ese cambio debe conducir a una ampliación deliberada, a otro recorte o a una nueva selección. El consentimiento de MediaProjection corresponde a una sesión de captura y ofrece al usuario un punto claro para decidir qué pantalla comparte.

Después, la conservación debe responder a la duración de la tarea. Algunas referencias temporales caducan al terminar el acceso concedido. Otras pueden mantenerse cuando la aplicación obtiene permiso persistente mediante el mecanismo correspondiente. En ambos casos, el usuario debe poder cerrar la conversación, retirar el recurso o volver a seleccionarlo cuando cambie el objetivo.

  • Antes: elige un archivo concreto, revisa los bordes y elimina información ajena.
  • Durante: confirma la miniatura activa, limita los recortes y revisa cada nuevo uso.
  • Después: verifica el resultado, elimina adjuntos que ya no hagan falta y revoca accesos asociados a un recorrido terminado.

Para aplicar estos criterios a otras fuentes de contexto, consulta Asistente de IA proactivo en el móvil: contexto, acciones y controles. El mismo principio se mantiene: cada señal debe tener una finalidad clara, una duración comprensible y una acción que el usuario pueda revisar.

Un flujo fiable de imagen a acción con FoneClaw

En FoneClaw construimos el contexto de imagen como una entrada duradera de la tarea, no como una ilustración que desaparece después de la primera respuesta. El recurso seleccionado o capturado conserva identidad, dimensiones y referencias suficientes para que el modelo configurado dentro del agente pueda volver a analizarlo cuando cambie la pregunta.

Una prueba de bajo riesgo puede comenzar con un recibo. Primero, adjunta la foto o captura y pregunta: “¿Qué comercio aparece y qué fecha tiene?”. Comprueba que FoneClaw muestra la imagen correcta y revisa la respuesta. Después formula una pregunta diferente: “Vuelve a mirar el recibo y dime el total final después de descuentos”. Esta segunda petición obliga a buscar otra evidencia en los píxeles.

Si el archivo necesita renovación, el flujo debe recuperarlo antes del análisis. FoneClaw prepara el contenido multimodal según la pregunta, administra el presupuesto de imagen y aplica compresión cuando resulta adecuada. Para texto pequeño, puede ser necesario conservar más detalle o trabajar con un recorte. El progreso visible permite saber si el agente está recuperando el adjunto, analizando o preparando la acción posterior.

Cuando ambos valores estén revisados, pide una acción compatible: “Prepara una nota con el comercio, la fecha y el total”. FoneClaw presenta los campos y utiliza la herramienta correspondiente dentro de los permisos concedidos. Confirma el contenido y comprueba después que la nota aparece guardada en el destino esperado.

El mismo recorrido sirve para una captura de error. Una primera pregunta identifica el mensaje principal; la siguiente vuelve a analizar el código exacto; finalmente, el usuario puede crear una nota técnica o un recordatorio para continuar más tarde. Si la captura caduca, cambia o pierde calidad, el agente solicita una renovación o una nueva selección en lugar de trasladar una lectura incierta.

Las posibilidades dependen de la versión de Android, los permisos, el estado de las aplicaciones, la región, la capacidad del modelo y el alcance de la tarea. Nuestra página de funciones de FoneClaw permite revisar las herramientas de imagen, contexto y acciones Android compatibles. Después, la página de descarga de FoneClaw ofrece el punto de partida para probar una foto o captura con una acción reversible.

La prueba queda completa cuando puedes responder cinco preguntas: ¿sigue activa la imagen correcta?, ¿la nueva respuesta procede de los píxeles necesarios?, ¿los valores están visibles antes de actuar?, ¿la herramienta usa los permisos esperados? y ¿el resultado aparece en la app de destino? Ese ciclo convierte una conversación multimodal en un flujo Android verificable.

Preguntas frecuentes

Puede mantener la referencia y los hallazgos mientras el archivo siga vinculado y accesible. Para una pregunta nueva, conviene confirmar que continúa activa la misma imagen y volver a analizar los píxeles cuando el resumen anterior no contenga la evidencia necesaria.
Cuando la pregunta cambia de zona, detalle o finalidad: leer un importe pequeño, comprobar un código, comparar objetos o revisar el estado de una pieza. También hace falta reanalizar si la imagen fue comprimida, recortada o produjo resultados contradictorios.
MediaProjection requiere consentimiento del usuario para cada sesión de captura y utiliza tokens de un solo uso. El recorrido puede ofrecer la pantalla completa o una ventana de aplicación seleccionada, según la versión y la implementación.
Renueva el acceso al mismo recurso o vuelve a seleccionarlo de forma explícita. Comprueba la miniatura, el origen y las dimensiones antes de continuar; la tarea debe conservar los datos ya confirmados y repetir solo el análisis pendiente.