Executar o Qwen 3.5 4B num iPhone com MLX
Se já executa o Qwen num portátil, conhece a família. Esta é a configuração concreta para executar o Qwen num iPhone: que variante, como está quantizada, quanta memória e armazenamento precisa, o que o runtime faz entre turnos, e o que um modelo de quatro mil milhões de parâmetros consegue e não consegue fazer depois de ligado ao seu calendário.
O modelo
O Qwen 3.5 4B é um dos modelos pequenos do Qwen 3.5, da equipa Qwen da Alibaba (a família tem também os tamanhos 0,8B, 2B e 9B), publicado no início de 2026 sob a licença Apache 2.0. Tem cerca de quatro mil milhões de parâmetros, um codificador de visão para conseguir ler imagens, um modo de raciocínio ativado por predefinição, um contexto nativo de 262 144 tokens e treino para chamadas de ferramentas. A Alibaba indica 201 idiomas e dialetos. Num telemóvel, as duas propriedades que mais importam são as chamadas de ferramentas e o tamanho: este é, aproximadamente, o maior modelo que funciona com folga em 8 GB de memória.
O Orvena descarrega mlx-community/Qwen3.5-4B-4bit, fixado numa única revisão. O download tem dez ficheiros, num total de 3,06 GB, dos quais os pesos ocupam 3,03 GB; a app arredonda para "3,1 GB". Uma segunda opção, "Qwen 3.5 4B Mixed", mantém algumas das camadas mais sensíveis (os embeddings, metade das projeções down do MLP e algumas projeções de valor da atenção) a oito bits e o resto a quatro. Tem 3,57 GB e produz argumentos de chamadas de ferramentas mais precisos, que é onde a quantização a quatro bits se nota primeiro. Pode alternar entre as duas na página Modelos.
Porquê quatro bits
A dezasseis bits por peso, quatro mil milhões de parâmetros ocupam cerca de 8 GB, que é toda a memória do telemóvel. A quatro bits, os pesos ocupam cerca de 3 GB em disco e um pouco mais em memória, o que deixa espaço para o iOS, a app e a memória de trabalho de que o modelo precisa enquanto responde. É essa a razão do requisito de hardware: o Orvena verifica a memória física do telemóvel no primeiro arranque e não oferece o download abaixo de cerca de 8 GB. Os telemóveis que a têm são o iPhone 15 Pro e 15 Pro Max, todos os iPhone 16, incluindo o 16e, e o iPhone 17 e 17e. O iPhone Air e os modelos 17 Pro têm 12 GB. A Apple também indica o iPhone 18 Pro, o 18 Pro Max e o iPhone Duo para a Apple Intelligence; em qualquer telemóvel, quem decide é a verificação de memória durante a configuração.
O runtime
A inferência corre através do MLX, a framework de arrays da Apple para o seu próprio silício, com as bindings em Swift. O modelo corre na GPU com a memória unificada do telemóvel, por isso não há cópia de pesos entre processadores. Depois de carregados, os pesos ficam em memória entre turnos; um aviso de memória do iOS limpa as caches, mas não o modelo.
Duas caches fazem o telemóvel parecer mais rápido do que o seu débito bruto faria supor. Quando o modelo carrega, o Orvena calcula a parte fixa do prompt, o prompt de sistema e as descrições das ferramentas, e guarda esse estado, para que uma nova conversa não volte a pagar por esses tokens. Dentro de uma conversa, a cache de chave-valor passa de turno para turno, por isso cada resposta só tem de ler a sua última mensagem e os resultados das ferramentas, e não o histórico inteiro.
A janela de contexto está limitada a 16 384 tokens no telemóvel, em vez dos 262k completos do modelo. Isso equivale a cerca de 12 000 palavras de conversa, e o limite existe porque ler um prompt longo é a parte lenta num telemóvel e a cache de um contexto longo é o que esgota a memória. Quando uma conversa ultrapassa a janela, o Orvena mantém os turnos completos mais recentes e deixa de fora os mais antigos, em vez de os resumir. Se um único resultado de ferramenta for demasiado grande para caber, mostra, em inglês, "The latest tool result is too large for this model's context window. Try a narrower request." (o último resultado da ferramenta é demasiado grande para a janela de contexto deste modelo; experimente um pedido mais restrito).
A amostragem usa temperatura 1,0 com top-p 0,95 em toda a resposta quando o raciocínio está ativado, e temperatura 0,7 com top-p 0,8 quando está desativado.
Modo de raciocínio
O Qwen 3.5 raciocina antes de responder, a menos que lhe digam o contrário. O Orvena dá a esse raciocínio um limite de tokens: 288 tokens num telemóvel de 8 GB e 576 num de 12 GB, metade disso no Modo de baixo consumo. Quando o limite se esgota, a app obriga o modelo a fechar o raciocínio e a começar a resposta, para que uma pergunta difícil não fique parada indefinidamente. A página Modelos tem duas opções, Automático e Desativado, e Ajustes, Avançado, acrescenta um limite personalizado entre 128 e 2 048 tokens. O raciocínio ajuda sobretudo em tarefas com ferramentas em vários passos, um alarme que depende do tempo de viagem, por exemplo, e custa alguns segundos; para uma pergunta factual rápida, Desativado é visivelmente mais rápido.
Chamadas de ferramentas
As ferramentas são descritas ao modelo como esquemas de funções JSON e inseridas no prompt pelo próprio template de conversa do modelo, por isso o modelo emite as chamadas no formato com que foi treinado. O Orvena mantém o prompt pequeno ao revelar as ferramentas de forma progressiva: o modelo começa com algumas ferramentas essenciais e resumos curtos, depois carrega a competência de que precisa, calendário, lembretes, mapas, saúde e assim por diante, e só então vê os esquemas completos. Um pedido pode levar até 32 rondas do modelo. Cada chamada é verificada contra o esquema declarado; uma chamada a um nome não declarado ou com argumentos malformados é devolvida ao modelo como um erro que ele pode ler e corrigir, em vez de ser descartada em silêncio.
A aritmética que importa é feita pelas ferramentas e não pelo modelo. Quando pede um alarme para chegar a algum lado a horas, a ferramenta de viagem calcula a hora a que tem de sair e o modelo limita-se a comunicá-la.
Velocidade
Ainda não há nenhum benchmark publicado para o Orvena. O texto aparece à medida que é escrito, e as primeiras palavras de uma resposta curta surgem em um ou dois segundos. O que vai notar é que uma conversa longa demora mais até a resposta começar, porque ler o prompt é a parte cara num telemóvel, e que o raciocínio acrescenta uma pausa visível.
Idiomas e imagens
O modelo responde no idioma em que escrever. Para que isso seja fiável em mensagens curtas, o Orvena deteta o idioma de cada mensagem com o reconhecedor de idioma da Apple no dispositivo e acrescenta uma nota de runtime que o indica; a nota é retirada de tudo o que o modelo escreve de volta, por isso nunca a vê. As fotografias anexadas passam pelo codificador de visão no telemóvel.
Comparado com executar o Qwen num Mac
Num Mac pode escolher os tamanhos maiores do Qwen 3.5, e são modelos mais fortes. Num telemóvel, o 4B é hoje o limite prático. O que o telemóvel acrescenta é tudo o que rodeia o modelo: o seu calendário, lembretes, alarmes, fotografias, resumos de saúde, mapas, e um registo de cada ação do modelo que pode ler e anular. Se quiser um modelo maior a partir do telemóvel, o Premium acrescenta o Private Cloud Compute da Apple no iOS 27, sem chave para configurar, ou qualquer modelo do OpenRouter com a sua própria chave, e o Orvena pede consentimento antes de qualquer conversa sair do dispositivo.
Perguntas frequentes
Que variante do Qwen descarrega o Orvena?
Por predefinição, mlx-community/Qwen3.5-4B-4bit numa revisão fixa, 3,06 GB em dez ficheiros. Uma variante mista de quatro e oito bits, com 3,57 GB, está disponível na página Modelos para chamadas de ferramentas mais precisas.
Posso carregar o meu próprio modelo GGUF ou MLX?
Não. O catálogo de downloads tem duas entradas, e cada uma é testada com testes de ciclos de ferramentas em dispositivos físicos antes de ser incluída. No iOS 27, a página Modelos também oferece a Apple Intelligence, que está integrada no iOS. O Orvena é um assistente, e não um executor genérico de modelos.
De onde vêm os pesos, e são verificados?
Do servidor espelho do Orvena, com o Hugging Face como alternativa. Cada ficheiro é verificado contra o tamanho e o hash SHA-256 fixados antes de o modelo ser ativado. O download decorre em segundo plano, é retomado se for interrompido e fica excluído da cópia de segurança do iCloud.
Os meus dados são usados para treinar o Qwen?
Não. O modelo funciona no seu telemóvel. Nada do que escreve ou diz é enviado para a Alibaba ou para o Orvena. Uma ferramenta envia o que precisa ao seu próprio serviço, uma pesquisa na web ao DuckDuckGo, por exemplo, e a sua conversa só sai do telemóvel se escolher o Private Cloud Compute ou se ligar um modelo na nuvem por iniciativa própria.
O Orvena é gratuito na App Store para iPhone 15 Pro e posteriores. O download de 3,1 GB acontece uma vez e o modelo funciona no telemóvel.
Descarregar na App Store