Melhores frameworks open source para agentes móveis: como escolher
Compare Open-AutoGLM, Mobilerun e Minitap mobile-use por execução, dispositivos, modelos, licença, inspeção e custo de manutenção.
- Open-AutoGLM, Mobilerun e Minitap mobile-use resolvem problemas diferentes: pesquisa visual de telefone, automação com inspeção e tarefas móveis estruturadas.
- Framework, inferência de modelo e executor do telefone são camadas separadas; código aberto não elimina custo de modelo, manutenção, dispositivo, nuvem ou depuração.
- Mobilerun Framework e Mobilerun Cloud devem ser avaliados como rotas operacionais distintas, e o suporte a iOS depende do projeto e do ambiente configurado.
- FoneClaw é nosso app Android pronto para uso, uma rota diferente de desenvolver e manter um framework open source para executar ações suportadas.
Escolha pelo trabalho que o agente precisa fazer
Os melhores frameworks de agentes móveis de código aberto não formam um placar único. A escolha começa pelo tipo de trabalho: entender visualmente uma tela de telefone, executar ações por uma árvore de acessibilidade, inspecionar trajetórias, usar dispositivos locais ou pagar por uma rota gerenciada. Open source dá acesso ao código do framework, mas não torna chamadas de modelo, manutenção, cloud devices, licenças de dependências ou depuração automaticamente gratuitos.
| Escolha | Melhor encaixe | Primeira condição |
|---|---|---|
| Open-AutoGLM | Pesquisa e execução visual em Android com ADB, usando modelo hospedado ou inferência própria | Preparar dispositivo, teclado ADB, endpoint de modelo e intervenção humana para login ou captcha |
| Mobilerun Framework | Automação local com CLI/Python, árvore de acessibilidade, screenshots, resultados estruturados e rastros | Rodar o agente na sua máquina e configurar Portal, ADB e provedor de modelo |
| Minitap mobile-use | Tarefas móveis estruturadas com linguagem natural, extração e provedores de LLM configuráveis | Validar Android por ADB ou simulador iOS no macOS; iOS físico não é suportado pelo README |
FoneClaw entra em outra categoria. Nós oferecemos uma rota Android pronta, com modelo configurável e ferramentas governadas, para leitores que querem usar ações suportadas no telefone sem manter um framework, executor e pipeline de modelo.
Compare configuração, execução, modelos e licença
Antes de escolher entre Open-AutoGLM ou Mobilerun, separe quatro camadas. O framework decide como o agente observa, planeja e registra o fluxo. A inferência do modelo pode estar em uma API hospedada, em um servidor próprio ou em outro provedor. A execução no telefone depende de ADB, acessibilidade, simulador, serviço auxiliar ou conexão de dispositivo. A operação diária inclui logs, rastros, custos de modelo, manutenção do ambiente e recuperação quando a tela muda.
| Critério | Open-AutoGLM | Mobilerun | Minitap mobile-use |
|---|---|---|---|
| Repositório | Open-AutoGLM oficial | Mobilerun oficial | mobile-use oficial |
| Licença do repositório | Apache-2.0 | MIT | Apache-2.0 |
| Execução Android | ADB, depuração USB e ADB Keyboard | ADB, depuração USB e serviço Portal de acessibilidade | ADB para aparelhos físicos ou emuladores Android |
| Modelos | API hospedada de modelo ou inferência própria documentada | Seleção de provedor de modelo no framework | Provedores de LLM configuráveis |
| Inspeção | Foco em agente visual e confirmação em operações sensíveis | Trajetórias salvas e integração com Arize Phoenix ou Langfuse | Extração estruturada e automação por linguagem natural |
| iOS | Configuração separada com WebDriverAgent | Fluxo separado de Portal para iOS | Simuladores iOS no macOS; aparelho iOS físico ainda não suportado pelo README |
A licença do repositório não cobre automaticamente pesos de modelo, serviços de inferência, cloud devices ou dados de teste. Para aprofundar a escolha do modelo, veja Melhores modelos de IA para agentes: escolha pela tarefa no Android.
Quando Open-AutoGLM faz sentido
Open-AutoGLM é uma boa escolha quando o projeto precisa estudar agentes visuais de telefone e você aceita preparar um ambiente técnico em torno de ADB. O repositório documenta controle por ADB para Android, HDC para HarmonyOS e uma rota separada de iOS com WebDriverAgent. No Android, entram configurações como depuração USB e ADB Keyboard, além do agente Python e de um endpoint de modelo.
Esse encaixe favorece equipes que querem explorar uma pilha de pesquisa, adaptar inferência e observar como um agente visual decide ações. O projeto também descreve confirmação para operações sensíveis e tomada humana em login ou captcha, o que é importante para não tratar automação de tela como execução irrestrita.
O ponto de custo fica na operação: uma API hospedada pode cobrar por uso, e inferência própria exige infraestrutura. Usar Open-AutoGLM não significa que o modelo roda no próprio celular, nem que todo app terá sucesso. Avalie dispositivo, executor, modelo e recuperação de falhas como peças separadas.
Quando escolher Mobilerun Framework ou Cloud
Mobilerun, antigo DroidRun, é útil quando você quer um framework local com CLI ou Python, observação por árvore de acessibilidade, screenshots, seleção de provedor de modelo e resultados estruturados. A preparação Android usa ADB, depuração USB e o serviço Portal de acessibilidade. Para equipes que precisam entender por que uma ação falhou, a documentação de trajetórias salvas e rastreamento com Arize Phoenix ou Langfuse é um diferencial prático.
Separe Mobilerun Framework de Mobilerun Cloud. O Framework roda o agente na sua máquina e depende do seu dispositivo, configuração, provedor de modelo e manutenção. A rota Cloud é gerenciada e pode trabalhar com telefones locais conectados ou dispositivos virtuais e físicos hospedados, com workflows por API. Isso muda custo, privacidade operacional, latência, disponibilidade e responsabilidade de infraestrutura.
O suporte a iOS também não deve ser presumido como paridade universal. O projeto documenta um fluxo separado para iOS por Portal. Antes de adotar, confirme qual aparelho, sistema, serviço auxiliar e provedor de modelo serão usados no seu ambiente real.
Quando Minitap mobile-use encaixa melhor
Minitap mobile-use faz sentido quando você quer automação móvel por linguagem natural com extração estruturada e provedores de LLM configuráveis. O projeto documenta Android físico ou emulador por ADB, e o quickstart em Docker é voltado ao Android. Para iOS, o README lista simuladores no macOS e afirma que dispositivos iOS físicos ainda não são suportados, mesmo que outras mensagens do ecossistema falem de forma mais ampla sobre plataformas.
Esse framework é atraente para tarefas estruturadas, como navegar por uma interface, extrair um resultado ou validar uma sequência simples. O próprio projeto nota limites quando jogos ou apps não expõem informação suficiente por árvore de acessibilidade. Isso não é um defeito isolado: em agentes móveis, qualidade da observação determina a qualidade da ação.
Antes de colocar mobile-use em uma esteira de teste, confirme a licença Apache-2.0 do repositório, o provedor de LLM, o tipo de dispositivo, a forma de inspeção e o custo operacional. Código aberto reduz bloqueio de fornecedor no framework, mas não remove a necessidade de manter o ambiente.
Teste uma tarefa reversível e inspecione falhas
Compare frameworks com uma tarefa pequena, reversível e observável. Não comece por pagamento, envio externo, exclusão, login sensível ou alteração de conta. Uma boa primeira tarefa é abrir um app de notas de teste, criar uma nota com uma frase neutra, confirmar que a nota existe e depois removê-la manualmente. O objetivo não é declarar vencedor; é ver como cada pilha observa, escolhe ação, executa, registra e se recupera.
- Preparação: registre aparelho, sistema, conexão, permissões, serviço auxiliar, provedor de modelo e custo esperado.
- Entrada: use a mesma instrução em todos os frameworks, sem atalhos manuais escondidos.
- Execução: observe se o agente usa tela, árvore de acessibilidade, screenshots ou outro executor.
- Falha planejada: mude a tela ou negue uma permissão simples e veja se o framework explica o bloqueio.
- Inspeção: guarde logs, screenshots, trajetórias e respostas estruturadas quando existirem.
- Resultado: confirme no telefone, não apenas na resposta do modelo.
Para transformar esse roteiro em avaliação mais completa, use Benchmark de agentes Android: como avaliar phone agents em 2026. Se a dúvida for como intenção, aprovação e ação aparecem no telefone, Controlar telefone Android com agente de IA: da intenção à ação aprofunda a camada de execução.
Escolha uma rota Android pronta
Nem todo leitor precisa manter um framework open source. Se você quer usar um agente Android para tarefas suportadas, revisar permissões e trabalhar com um modelo configurável sem montar ADB, servidor de inferência, serviço auxiliar, rastreamento e dispositivos de teste, FoneClaw é nosso app Android pronto para uso: uma rota diferente de desenvolver e manter um framework open source.
Na FoneClaw, o modelo ajuda no raciocínio; as ferramentas governadas cuidam das ações Android suportadas, com permissões e aprovações quando necessárias. O modelo padrão gratuito facilita começar, e rotas opcionais de provedor têm suas próprias condições. Também deixamos mais claros erros do agente, seleção de modelo e navegação de respostas na Inbox para reduzir ambiguidade durante o uso.
Para conferir o escopo atual, veja recursos da FoneClaw. A escolha prática é simples: se você quer pesquisar, modificar e manter uma pilha de agente, compare os frameworks acima; se quer uma experiência Android pronta para tarefas suportadas, avalie FoneClaw como produto.