Guia de agentes de IA
📅 2026-09-24 ⏱️ 12 min Dean Dean

Melhores frameworks open source para agentes móveis: como escolher

Compare Open-AutoGLM, Mobilerun e Minitap mobile-use por execução, dispositivos, modelos, licença, inspeção e custo de manutenção.

Comparação conceitual de frameworks open source controlando telas de celulares, modelos de IA e execução no dispositivo
📋 Pontos-chave
  • Open-AutoGLM, Mobilerun e Minitap mobile-use resolvem problemas diferentes: pesquisa visual de telefone, automação com inspeção e tarefas móveis estruturadas.
  • Framework, inferência de modelo e executor do telefone são camadas separadas; código aberto não elimina custo de modelo, manutenção, dispositivo, nuvem ou depuração.
  • Mobilerun Framework e Mobilerun Cloud devem ser avaliados como rotas operacionais distintas, e o suporte a iOS depende do projeto e do ambiente configurado.
  • FoneClaw é nosso app Android pronto para uso, uma rota diferente de desenvolver e manter um framework open source para executar ações suportadas.

Escolha pelo trabalho que o agente precisa fazer

Os melhores frameworks de agentes móveis de código aberto não formam um placar único. A escolha começa pelo tipo de trabalho: entender visualmente uma tela de telefone, executar ações por uma árvore de acessibilidade, inspecionar trajetórias, usar dispositivos locais ou pagar por uma rota gerenciada. Open source dá acesso ao código do framework, mas não torna chamadas de modelo, manutenção, cloud devices, licenças de dependências ou depuração automaticamente gratuitos.

EscolhaMelhor encaixePrimeira condição
Open-AutoGLMPesquisa e execução visual em Android com ADB, usando modelo hospedado ou inferência própriaPreparar dispositivo, teclado ADB, endpoint de modelo e intervenção humana para login ou captcha
Mobilerun FrameworkAutomação local com CLI/Python, árvore de acessibilidade, screenshots, resultados estruturados e rastrosRodar o agente na sua máquina e configurar Portal, ADB e provedor de modelo
Minitap mobile-useTarefas móveis estruturadas com linguagem natural, extração e provedores de LLM configuráveisValidar Android por ADB ou simulador iOS no macOS; iOS físico não é suportado pelo README

FoneClaw entra em outra categoria. Nós oferecemos uma rota Android pronta, com modelo configurável e ferramentas governadas, para leitores que querem usar ações suportadas no telefone sem manter um framework, executor e pipeline de modelo.

Compare configuração, execução, modelos e licença

Antes de escolher entre Open-AutoGLM ou Mobilerun, separe quatro camadas. O framework decide como o agente observa, planeja e registra o fluxo. A inferência do modelo pode estar em uma API hospedada, em um servidor próprio ou em outro provedor. A execução no telefone depende de ADB, acessibilidade, simulador, serviço auxiliar ou conexão de dispositivo. A operação diária inclui logs, rastros, custos de modelo, manutenção do ambiente e recuperação quando a tela muda.

CritérioOpen-AutoGLMMobilerunMinitap mobile-use
RepositórioOpen-AutoGLM oficialMobilerun oficialmobile-use oficial
Licença do repositórioApache-2.0MITApache-2.0
Execução AndroidADB, depuração USB e ADB KeyboardADB, depuração USB e serviço Portal de acessibilidadeADB para aparelhos físicos ou emuladores Android
ModelosAPI hospedada de modelo ou inferência própria documentadaSeleção de provedor de modelo no frameworkProvedores de LLM configuráveis
InspeçãoFoco em agente visual e confirmação em operações sensíveisTrajetórias salvas e integração com Arize Phoenix ou LangfuseExtração estruturada e automação por linguagem natural
iOSConfiguração separada com WebDriverAgentFluxo separado de Portal para iOSSimuladores iOS no macOS; aparelho iOS físico ainda não suportado pelo README

A licença do repositório não cobre automaticamente pesos de modelo, serviços de inferência, cloud devices ou dados de teste. Para aprofundar a escolha do modelo, veja Melhores modelos de IA para agentes: escolha pela tarefa no Android.

Quando Open-AutoGLM faz sentido

Open-AutoGLM é uma boa escolha quando o projeto precisa estudar agentes visuais de telefone e você aceita preparar um ambiente técnico em torno de ADB. O repositório documenta controle por ADB para Android, HDC para HarmonyOS e uma rota separada de iOS com WebDriverAgent. No Android, entram configurações como depuração USB e ADB Keyboard, além do agente Python e de um endpoint de modelo.

Esse encaixe favorece equipes que querem explorar uma pilha de pesquisa, adaptar inferência e observar como um agente visual decide ações. O projeto também descreve confirmação para operações sensíveis e tomada humana em login ou captcha, o que é importante para não tratar automação de tela como execução irrestrita.

O ponto de custo fica na operação: uma API hospedada pode cobrar por uso, e inferência própria exige infraestrutura. Usar Open-AutoGLM não significa que o modelo roda no próprio celular, nem que todo app terá sucesso. Avalie dispositivo, executor, modelo e recuperação de falhas como peças separadas.

Quando escolher Mobilerun Framework ou Cloud

Mobilerun, antigo DroidRun, é útil quando você quer um framework local com CLI ou Python, observação por árvore de acessibilidade, screenshots, seleção de provedor de modelo e resultados estruturados. A preparação Android usa ADB, depuração USB e o serviço Portal de acessibilidade. Para equipes que precisam entender por que uma ação falhou, a documentação de trajetórias salvas e rastreamento com Arize Phoenix ou Langfuse é um diferencial prático.

Separe Mobilerun Framework de Mobilerun Cloud. O Framework roda o agente na sua máquina e depende do seu dispositivo, configuração, provedor de modelo e manutenção. A rota Cloud é gerenciada e pode trabalhar com telefones locais conectados ou dispositivos virtuais e físicos hospedados, com workflows por API. Isso muda custo, privacidade operacional, latência, disponibilidade e responsabilidade de infraestrutura.

O suporte a iOS também não deve ser presumido como paridade universal. O projeto documenta um fluxo separado para iOS por Portal. Antes de adotar, confirme qual aparelho, sistema, serviço auxiliar e provedor de modelo serão usados no seu ambiente real.

Quando Minitap mobile-use encaixa melhor

Minitap mobile-use faz sentido quando você quer automação móvel por linguagem natural com extração estruturada e provedores de LLM configuráveis. O projeto documenta Android físico ou emulador por ADB, e o quickstart em Docker é voltado ao Android. Para iOS, o README lista simuladores no macOS e afirma que dispositivos iOS físicos ainda não são suportados, mesmo que outras mensagens do ecossistema falem de forma mais ampla sobre plataformas.

Esse framework é atraente para tarefas estruturadas, como navegar por uma interface, extrair um resultado ou validar uma sequência simples. O próprio projeto nota limites quando jogos ou apps não expõem informação suficiente por árvore de acessibilidade. Isso não é um defeito isolado: em agentes móveis, qualidade da observação determina a qualidade da ação.

Antes de colocar mobile-use em uma esteira de teste, confirme a licença Apache-2.0 do repositório, o provedor de LLM, o tipo de dispositivo, a forma de inspeção e o custo operacional. Código aberto reduz bloqueio de fornecedor no framework, mas não remove a necessidade de manter o ambiente.

Teste uma tarefa reversível e inspecione falhas

Compare frameworks com uma tarefa pequena, reversível e observável. Não comece por pagamento, envio externo, exclusão, login sensível ou alteração de conta. Uma boa primeira tarefa é abrir um app de notas de teste, criar uma nota com uma frase neutra, confirmar que a nota existe e depois removê-la manualmente. O objetivo não é declarar vencedor; é ver como cada pilha observa, escolhe ação, executa, registra e se recupera.

  1. Preparação: registre aparelho, sistema, conexão, permissões, serviço auxiliar, provedor de modelo e custo esperado.
  2. Entrada: use a mesma instrução em todos os frameworks, sem atalhos manuais escondidos.
  3. Execução: observe se o agente usa tela, árvore de acessibilidade, screenshots ou outro executor.
  4. Falha planejada: mude a tela ou negue uma permissão simples e veja se o framework explica o bloqueio.
  5. Inspeção: guarde logs, screenshots, trajetórias e respostas estruturadas quando existirem.
  6. Resultado: confirme no telefone, não apenas na resposta do modelo.

Para transformar esse roteiro em avaliação mais completa, use Benchmark de agentes Android: como avaliar phone agents em 2026. Se a dúvida for como intenção, aprovação e ação aparecem no telefone, Controlar telefone Android com agente de IA: da intenção à ação aprofunda a camada de execução.

Escolha uma rota Android pronta

Nem todo leitor precisa manter um framework open source. Se você quer usar um agente Android para tarefas suportadas, revisar permissões e trabalhar com um modelo configurável sem montar ADB, servidor de inferência, serviço auxiliar, rastreamento e dispositivos de teste, FoneClaw é nosso app Android pronto para uso: uma rota diferente de desenvolver e manter um framework open source.

Na FoneClaw, o modelo ajuda no raciocínio; as ferramentas governadas cuidam das ações Android suportadas, com permissões e aprovações quando necessárias. O modelo padrão gratuito facilita começar, e rotas opcionais de provedor têm suas próprias condições. Também deixamos mais claros erros do agente, seleção de modelo e navegação de respostas na Inbox para reduzir ambiguidade durante o uso.

Para conferir o escopo atual, veja recursos da FoneClaw. A escolha prática é simples: se você quer pesquisar, modificar e manter uma pilha de agente, compare os frameworks acima; se quer uma experiência Android pronta para tarefas suportadas, avalie FoneClaw como produto.