Guide des agents IA
📅 2026-08-25 ⏱️ 9 min Dean Dean

Contexte d’image IA sur Android : conserver, réanalyser et vérifier

Comment conserver la même photo ou capture dans un assistant multimodal Android, relancer l’analyse des pixels et vérifier chaque action issue de l’image.

Assistant multimodal Android réanalysant la même capture d’écran avant de créer une action vérifiée
📋 Points clés
  • Un contexte d’image fiable conserve l’identité du fichier, sa provenance, ses dimensions et son lien avec la tâche, en plus des conclusions déjà produites.
  • Le sélecteur de photos, l’appareil photo et la capture d’écran offrent des sources différentes, avec des durées d’accès et des contrôles utilisateur propres à chaque parcours.
  • Une nouvelle question peut exiger une réanalyse des pixels d’origine, car la première réponse, le recadrage ou la compression peuvent avoir écarté un détail devenu important.
  • Toute action dérivée d’une image doit montrer les valeurs reconnues, demander la validation des éléments sensibles et vérifier le résultat obtenu dans Android.

Ce que signifie conserver le contexte d’une image

Un bon contexte d’image IA sur Android permet de poser plusieurs questions sur la même photo ou la même capture sans perdre le fichier de départ. Prenons un reçu photographié : vous demandez d’abord le nom du commerçant, puis le total TTC, puis la date limite d’un éventuel retour. Ces trois demandes portent sur une seule image, mais chacune exige d’observer une zone et des détails différents.

Trois éléments doivent rester distincts. Le premier est l’image elle-même, c’est-à-dire ses pixels dans une version identifiable. Le deuxième est sa référence active dans la tâche : l’assistant doit savoir quel fichier rouvrir. Le troisième regroupe les observations précédentes, par exemple « total estimé à 42,80 € » ou « date située en haut à droite ». Ces observations accélèrent la conversation, mais elles ne remplacent pas l’image.

La mémoire textuelle peut avoir omis un détail inutile lors de la première question. Si l’utilisateur demande ensuite le numéro de commande, reprendre uniquement le résumé précédent produira une réponse fragile. L’assistant doit décider si les éléments déjà extraits suffisent ou s’il doit examiner de nouveau les pixels, éventuellement avec une résolution ou un recadrage mieux adaptés.

  1. L’utilisateur joint une photo ou une capture clairement identifiée.
  2. L’assistant répond à la première question à partir de cette source.
  3. Une nouvelle demande introduit un autre détail à rechercher.
  4. L’assistant rouvre la même image, cible la zone pertinente et compare le nouveau résultat aux observations antérieures.
  5. Une action éventuelle commence seulement après validation des données extraites.

La continuité repose donc sur une source durablement identifiable, pas sur l’idée d’une mémoire visuelle parfaite. Si une autre image devient active, si le fichier a changé ou si son accès a expiré, l’assistant doit le signaler et rétablir une référence explicite avant de poursuivre.

Choisir la bonne photo ou capture d’écran

La qualité de l’analyse dépend d’abord de la source fournie. Android propose trois parcours courants : sélectionner un média existant, prendre une nouvelle photo ou capturer l’écran. Chacun convient à une situation différente et laisse une provenance utile pour la suite de la tâche.

Choisir la source adaptée à l’analyse visuelle
SourceUsage recommandéPoint à contrôler
Sélecteur de photosDocument, reçu ou image déjà enregistréVérifier le bon fichier et la durée d’accès accordée
Appareil photoObjet, étiquette ou document présent devant l’utilisateurConfirmer que l’image enregistrée est nette et en pleine définition
Capture d’écranErreur, formulaire, conversation ou état d’une applicationContrôler la fenêtre capturée et masquer les informations hors sujet

Le sélecteur de photos recommandé par Android permet de donner accès aux images ou vidéos choisies au lieu d’ouvrir toute la bibliothèque. L’application reçoit une URI correspondant au média sélectionné. Pour une tâche prolongée, elle peut avoir besoin de conserver cet accès selon les mécanismes prévus par Android.

Une photo prise par une application de caméra suit un autre parcours. Le guide Android sur la capture avec une application de caméra distingue notamment les données d’aperçu et le résultat enregistré. Une miniature peut suffire pour reconnaître un objet général, tandis que des caractères fins, un numéro de série ou les lignes d’un reçu demandent souvent l’image enregistrée dans une définition supérieure.

La capture d’écran passe par un consentement visible. La documentation Android consacrée à MediaProjection et au partage de l’écran précise que l’utilisateur autorise chaque session et qu’un jeton sert une seule fois. Selon le parcours disponible, il peut choisir l’écran complet ou une fenêtre d’application. Cette étape établit clairement quelle surface fournit l’image.

Avant l’analyse, vérifiez l’orientation, le recadrage, la netteté et la résolution. Regardez aussi les zones sensibles : notifications, coordonnées, identifiants, photos personnelles ou informations bancaires peuvent apparaître autour du sujet principal. Pour apprendre à joindre précisément l’écran actif, consultez Assistant IA flottant Android : comprendre et agir depuis l’écran actuel.

Garder une référence stable entre les questions

Une conversation multimodale devient fiable lorsque l’image possède une identité stable pendant toute la tâche. Un simple libellé comme « la capture » devient ambigu dès que l’utilisateur ajoute un deuxième fichier. La référence active doit rester liée au message d’origine, à la tâche courante et aux analyses déjà effectuées.

Les informations minimales comprennent la provenance, le type MIME, les dimensions, l’orientation et une référence locale ou distante encore accessible. Les dimensions sont particulièrement importantes. Une coordonnée repérée sur une image de 1080 × 2400 pixels perd son sens si l’assistant travaille ensuite sur une miniature recadrée sans connaître la transformation appliquée.

  • Identité du média et message auquel il a été joint
  • Source : sélecteur, caméra, capture d’écran ou fichier reçu
  • Largeur, hauteur, orientation et type de fichier
  • Référence actuellement utilisable par la tâche
  • Version analysée : originale, redimensionnée ou recadrée
  • Questions déjà posées et zones examinées
  • Durée d’accès et méthode de renouvellement prévue

Les URI Android peuvent avoir une durée de vie limitée. Une référence distante peut elle aussi devenir inaccessible après un certain temps. Si la tâche se poursuit après cette échéance, l’assistant doit renouveler l’accès au même média ou demander à l’utilisateur de le sélectionner de nouveau. Il doit alors comparer l’identité et les dimensions afin d’éviter de remplacer silencieusement l’image par un autre fichier portant un nom proche.

Dans FoneClaw, nous conservons les dimensions et les références utiles pour que l’image capturée ou jointe reste rattachée à la tâche. Lorsque son accès doit être renouvelé, le traitement multimodal prépare de nouveau la pièce jointe avant l’appel au modèle. Cette continuité réduit les substitutions accidentelles et permet de revenir à la source pour une question différente.

Le périmètre doit également rester clair entre plusieurs conversations. Une image active dans une tâche ne devient pas automatiquement la source d’une autre. L’utilisateur peut la joindre explicitement au nouveau parcours, ce qui maintient une relation lisible entre le média, la demande et l’action envisagée.

Réanalyser l’image lorsque la question change

La réanalyse d’image par IA devient nécessaire dès que la nouvelle question réclame une preuve absente de la première réponse. L’assistant commence par examiner les observations disponibles. Si elles contiennent la valeur demandée avec son emplacement et un niveau de lisibilité suffisant, elles peuvent être réutilisées. Dans le cas contraire, il faut rouvrir les pixels.

Un reçu illustre une recherche de précision. La première demande, « de quel magasin vient ce reçu ? », cible le logo et l’en-tête. La suivante, « quel est le total après remise ? », demande d’inspecter les dernières lignes et de distinguer sous-total, réduction, taxes et montant payé. Le nom du magasin déjà extrait ne fournit aucune preuve sur le calcul final.

Une capture d’erreur exige une autre forme de réanalyse. L’assistant peut d’abord résumer le problème général, puis recevoir la question « quel est le code exact ? ». Il doit alors revenir à la zone du message, conserver les majuscules, chiffres et signes, et éviter de reconstruire le code à partir du résumé. Une photo d’objet peut enfin demander une comparaison d’état : reconnaître un appareil, puis rechercher une fissure ou une référence imprimée mobilise des détails visuels différents.

La résolution transmise au modèle compte. Les limites de traitement multimodal peuvent conduire à redimensionner, compresser ou découper l’image. Une vue globale convient pour comprendre la scène ; un texte fin nécessite parfois un recadrage plus précis. La compression peut atténuer des caractères, des contours ou de petites différences de couleur. L’assistant doit donc adapter la préparation de l’image à la nouvelle question plutôt que répéter exactement la première analyse.

Lorsque l’écran contient aussi une structure d’interface exploitable, les pixels ne sont pas toujours la seule source. Un arbre d’interface peut fournir le texte, le rôle d’un bouton et l’état d’un champ, tandis que la capture révèle la mise en page, les icônes ou un rendu graphique. Le guide Arbre UI ou capture d’écran : comprendre un écran Android avec un agent IA aide à choisir ou à combiner ces deux formes de contexte.

Enfin, deux lectures incompatibles doivent interrompre l’action prévue. Si une première analyse trouve 48,90 € et la seconde 43,90 €, l’assistant doit montrer la zone concernée, demander une vérification ou relancer l’analyse avec une meilleure source. Une action financière, un message ou une saisie ne doit pas partir d’une valeur visuelle encore contradictoire.

Vérifier l’action et récupérer après un échec

Extraire une information ne termine pas le workflow. Avant de créer un rappel, une note, un événement ou un message, l’assistant doit présenter les champs issus de l’image. L’utilisateur peut alors corriger un montant, une date, un nom ou un destinataire avant que l’information soit transmise à un outil Android.

Signaux d’échec et reprise recommandée
SignalRisqueReprise
Pièce jointe expiréeL’ancienne image ne peut plus être relueRenouveler l’accès ou faire sélectionner de nouveau le même média
Dimensions différentesUne miniature ou un recadrage a remplacé la source attendueComparer les métadonnées et revenir à l’original
Résultats contradictoiresUne valeur importante reste ambiguëAgrandir la zone, relancer l’analyse et demander une validation
Mauvaise capture activeLa question porte sur un autre écranAfficher l’aperçu et demander la sélection correcte
Action sans résultat visibleLa tentative peut avoir échoué ou produit un doublonContrôler l’écran ou l’enregistrement cible avant de réessayer

Imaginons une capture affichant une erreur de livraison et une nouvelle date proposée. L’assistant peut extraire la date, préparer un rappel et montrer son titre ainsi que son horaire. Après confirmation, l’outil de calendrier crée l’événement. Le workflow vérifie ensuite que l’événement apparaît avec les valeurs approuvées.

Cette vérification après action évite de confondre l’appel d’un outil avec sa réussite. Si Android refuse une permission, si l’application cible change d’état ou si un champ requis manque, la progression doit indiquer le blocage. L’utilisateur peut accorder la permission, corriger la valeur ou abandonner sans perdre l’image et les observations validées.

Le même principe protège contre les répétitions. Avant de relancer la création d’une note ou d’un événement, l’assistant vérifie si le premier essai a déjà produit un résultat. Pour une action conséquente, un aperçu clair et une preuve finale sont plus utiles qu’un simple score de confiance.

Limiter l’accès et maîtriser la conservation

Le contrôle du contexte commence avant la sélection. Android recommande de demander l’accès le plus étroit adapté à la tâche. Le guide Android sur la réduction des demandes d’autorisation cite le sélecteur de photos comme moyen d’accorder un accès temporaire aux seuls médias choisis.

Avant la tâche : sélectionnez uniquement l’image nécessaire, vérifiez son aperçu et recadrez les zones hors sujet si possible. Pour une capture d’écran, choisissez la fenêtre pertinente lorsque le parcours Android le permet. Fermez ou masquez les notifications contenant des informations personnelles.

Pendant la tâche : gardez visible l’image active et contrôlez les nouvelles données demandées. Une question différente peut justifier une nouvelle analyse, mais elle ne justifie pas automatiquement une nouvelle source. Si la tâche change de périmètre, sélectionnez explicitement l’autre fichier ou relancez une session de capture.

Après la tâche : décidez si la référence doit rester disponible pour une conversation ultérieure. Un accès temporaire peut expirer naturellement. Un accès conservé plus longtemps doit répondre à un besoin clair, par exemple une tâche interrompue que l’utilisateur souhaite reprendre. Une fois le workflow terminé, la pièce jointe et les données extraites doivent suivre les contrôles de suppression et de conservation proposés par l’application.

MediaProjection fonctionne par session consentie. Lorsque la session se termine, une nouvelle capture demande un nouveau parcours d’autorisation. Cette séparation aide l’utilisateur à savoir quand son écran fournit réellement du contexte. Pour définir des règles plus larges autour des déclencheurs et de l’accès anticipé au contexte, consultez Assistant IA proactif sur téléphone : déclencheurs, contexte et contrôles.

Tester un parcours image vers action avec FoneClaw

Chez FoneClaw, nous avons construit le traitement des images autour de cette continuité. Une photo, une capture ou l’écran actuel peut devenir une entrée explicite de la tâche. FoneClaw conserve la référence et les dimensions utiles, prépare l’image pour le modèle configuré, renouvelle son accès lorsque c’est nécessaire et affiche la progression pendant les analyses plus longues.

Un test simple consiste à transformer un reçu en note vérifiée. Joignez la photo depuis le sélecteur ou prenez-la avec l’appareil photo. Demandez d’abord : « Quel commerce a émis ce reçu ? » Cette question établit la source et vérifie que l’en-tête reste lisible.

Posez ensuite une demande qui nécessite une nouvelle observation : « Relis l’image originale et indique le total payé, la date et le moyen de paiement visible. » FoneClaw peut préparer de nouveau le contexte multimodal, ajuster la quantité de données visuelles envoyées au modèle et cibler les zones pertinentes. Les nouvelles conclusions restent associées à la même image plutôt qu’à une pièce jointe choisie implicitement.

Demandez enfin : « Prépare une note avec ces informations et rappelle-moi de vérifier la dépense vendredi. » FoneClaw présente les valeurs reconnues avant l’action. Après votre confirmation, les outils pris en charge peuvent créer la note ou le rappel selon les permissions accordées. Le résultat est ensuite vérifié afin de confirmer le titre, la date et le contenu enregistrés.

Si l’image a expiré, FoneClaw tente de renouveler la pièce jointe ou vous demande de sélectionner de nouveau la source. Si le modèle lit deux montants différents, le workflow revient à l’analyse avant de créer la note. Si Android demande une permission, la tâche garde son état et reprend après votre décision.

Ce parcours fonctionne aussi avec une capture d’erreur transformée en note de diagnostic, une étiquette convertie en rappel d’entretien ou une affiche utilisée pour préparer un événement. Les résultats varient selon la qualité de l’image, les capacités du modèle, la version Android, les permissions, l’état de l’application, la région et les outils disponibles pour la tâche.

La page Fonctionnalités FoneClaw présente les capacités liées aux images, au contexte et aux actions Android prises en charge. La page Télécharger FoneClaw permet ensuite d’essayer ce workflow avec une image non sensible et une action facilement réversible.

Questions fréquentes

La continuité dépend de la conservation d’une référence vers le même média et de son rattachement à la tâche. Les observations textuelles précédentes peuvent aider, mais une nouvelle question peut nécessiter de rouvrir les pixels d’origine.
Une réanalyse est utile lorsque la nouvelle question porte sur un détail absent de la réponse précédente, lorsqu’un recadrage différent est nécessaire, lorsque la compression a pu masquer du texte ou lorsque deux lectures produisent des résultats contradictoires.
La capture via MediaProjection repose sur un consentement utilisateur propre à chaque session et sur un jeton à usage unique. Selon le parcours disponible, l’utilisateur peut autoriser l’écran complet ou une fenêtre d’application sélectionnée.
L’assistant doit renouveler l’accès au même média ou demander sa sélection de nouveau, puis vérifier son identité, ses dimensions et sa provenance. Il peut ensuite relancer l’analyse nécessaire sans substituer silencieusement une autre image.