En el dispositivo

Cómo ejecutar Qwen 3.5 4B en un iPhone con MLX

ACTUALIZADO EL 29 DE SEPTIEMBRE DE 2026 · 6 MIN DE LECTURA · ORVENA LABS

Si usas Qwen en un portátil, ya conoces la familia. Esta es la configuración concreta para ejecutar Qwen en un iPhone: qué variante, cómo está cuantizada, cuánta memoria y almacenamiento necesita, qué hace el runtime entre turnos y qué puede hacer y qué no un modelo de cuatro mil millones de parámetros una vez conectado a tu calendario.

Orvena es gratis para iPhone 15 Pro y posteriores. El modelo funciona en el propio móvil. Descargar

El modelo

Qwen 3.5 4B es uno de los modelos pequeños de Qwen 3.5 del equipo Qwen de Alibaba (la familia también tiene tamaños de 0.8B, 2B y 9B), publicado a principios de 2026 con licencia Apache 2.0. Tiene unos cuatro mil millones de parámetros, un codificador de visión para poder leer imágenes, un modo de razonamiento activado por defecto, un contexto nativo de 262.144 tokens y entrenamiento para llamar a herramientas. Alibaba indica 201 idiomas y dialectos. En un móvil, las dos propiedades que más importan son las llamadas a herramientas y el tamaño: es más o menos el modelo más grande que funciona con margen en 8 GB de memoria.

Orvena descarga mlx-community/Qwen3.5-4B-4bit, fijado a una única revisión. La descarga son diez archivos que suman 3,06 GB, de los que 3,03 GB son los pesos; la app lo redondea a "3,1 GB". Una segunda opción, "Qwen 3.5 4B Mixed", mantiene a ocho bits algunas de las capas más sensibles (los embeddings, la mitad de las proyecciones de bajada del MLP y algunas proyecciones de valor de la atención) y el resto a cuatro. Ocupa 3,57 GB y genera argumentos más precisos en las llamadas a herramientas, que es donde primero se nota la cuantización a cuatro bits. Puedes cambiar entre las dos en la página Modelos.

Por qué cuatro bits

A dieciséis bits por peso, cuatro mil millones de parámetros ocupan unos 8 GB, que es toda la memoria del móvil. A cuatro bits, los pesos ocupan unos 3 GB en disco y algo más en memoria, lo que deja sitio para iOS, la app y la memoria de trabajo que el modelo necesita mientras responde. Ese es el motivo del requisito de hardware: Orvena comprueba la memoria física del móvil la primera vez que se abre y no ofrece la descarga por debajo de unos 8 GB. Los móviles que la tienen son el iPhone 15 Pro y 15 Pro Max, todos los iPhone 16, incluido el 16e, y el iPhone 17 y 17e. El iPhone Air y los modelos 17 Pro tienen 12 GB. Apple también incluye el iPhone 18 Pro, el 18 Pro Max y el iPhone Duo para Apple Intelligence; en cualquier móvil, lo que decide es la comprobación de memoria durante la configuración.

El runtime

La inferencia funciona con MLX, el framework de arrays de Apple para sus propios chips, mediante los bindings de Swift. El modelo se ejecuta en la GPU con la memoria unificada del móvil, así que no hay que copiar pesos entre procesadores. Una vez cargados, los pesos se quedan en memoria entre turnos; un aviso de memoria de iOS vacía las cachés, pero no el modelo.

Dos cachés hacen que el móvil parezca más rápido de lo que indicaría su rendimiento bruto. Cuando se carga el modelo, Orvena calcula la parte fija del prompt, es decir, el prompt del sistema y las descripciones de las herramientas, y guarda ese estado, así que una conversación nueva no vuelve a pagar esos tokens. Dentro de una conversación, la caché de claves y valores se mantiene de un turno a otro, así que cada respuesta solo tiene que leer tu último mensaje y los resultados de las herramientas, no todo el historial.

La ventana de contexto está limitada a 16.384 tokens en el móvil, en lugar de los 262k completos del modelo. Son unas 12.000 palabras de conversación, y el límite existe porque leer un prompt largo es la parte lenta en un móvil y la caché de un contexto largo es lo que agota la memoria. Cuando una conversación supera la ventana, Orvena conserva los turnos completos más recientes y deja fuera los más antiguos en lugar de resumirlos. Si un solo resultado de herramienta es demasiado grande para caber, muestra en inglés "The latest tool result is too large for this model's context window. Try a narrower request." (el último resultado de herramienta es demasiado grande para la ventana de contexto del modelo; prueba con una petición más acotada).

El muestreo usa temperatura 1,0 con top-p 0,95 para toda la respuesta cuando el razonamiento está activado, y temperatura 0,7 con top-p 0,8 cuando está desactivado.

Modo de razonamiento

Qwen 3.5 razona antes de responder salvo que se le indique lo contrario. Orvena da a ese razonamiento un presupuesto de tokens: 288 tokens en un móvil de 8 GB y 576 en uno de 12 GB, y la mitad en modo de bajo consumo. Cuando se agota el presupuesto, la app obliga al modelo a cerrar su razonamiento y empezar la respuesta, así que una pregunta difícil no puede quedarse atascada indefinidamente. La página Modelos tiene dos opciones, Automático y Desactivado, y Ajustes, Avanzado, añade un presupuesto personalizado de entre 128 y 2.048 tokens. El razonamiento ayuda sobre todo en tareas de varios pasos con herramientas, por ejemplo una alarma que depende del tiempo de viaje, y cuesta unos segundos; para una pregunta rápida sobre un dato, Desactivado es bastante más rápido.

Llamadas a herramientas

Las herramientas se describen al modelo como esquemas de funciones en JSON y se insertan en el prompt con la propia plantilla de chat del modelo, así que el modelo emite las llamadas en el formato con el que se entrenó. Orvena mantiene el prompt pequeño mostrando las herramientas de forma progresiva: el modelo empieza con unas pocas herramientas básicas y resúmenes breves, luego carga la habilidad que necesita (calendario, recordatorios, mapas, salud, etc.) y solo entonces ve los esquemas completos. Una petición puede llevar hasta 32 rondas del modelo. Cada llamada se comprueba con el esquema declarado; una llamada a un nombre no declarado o con argumentos mal formados vuelve al modelo como un error que puede leer y corregir, en lugar de descartarse sin avisar.

Los cálculos que importan los hacen las herramientas, no el modelo. Cuando pides una alarma para llegar a tiempo a un sitio, la herramienta de viaje calcula la hora a la que tienes que salir y el modelo solo la comunica.

Velocidad

Todavía no hay un benchmark publicado de Orvena. El texto aparece a medida que se escribe, y las primeras palabras de una respuesta corta salen en un segundo o dos. Lo que notarás es que en una conversación larga la respuesta tarda más en empezar, porque leer el prompt es la parte costosa en un móvil, y que el razonamiento añade una pausa visible.

Idiomas e imágenes

El modelo responde en el idioma en el que escribas. Para que eso sea fiable con mensajes cortos, Orvena detecta el idioma de cada mensaje con el reconocedor de idioma de Apple en el dispositivo y añade una nota en tiempo de ejecución que lo indica; la nota se elimina de todo lo que el modelo escribe de vuelta, así que nunca la ves. Las fotos adjuntas pasan por el codificador de visión en el móvil.

Comparado con ejecutar Qwen en un Mac

En un Mac puedes elegir los tamaños más grandes de Qwen 3.5, y son modelos más potentes. En un móvil, 4B es hoy el techo práctico. Lo que añade el móvil es todo lo que rodea al modelo: tu calendario, recordatorios, alarmas, fotos, resúmenes de salud, mapas y un registro de cada acción del modelo que puedes leer y deshacer. Si quieres un modelo más grande desde el móvil, Premium añade Private Cloud Compute de Apple en iOS 27, sin claves que configurar, o cualquier modelo de OpenRouter con tu propia clave, y Orvena pide tu consentimiento antes de que cualquier conversación salga del dispositivo.

Preguntas frecuentes

¿Qué variante de Qwen descarga Orvena?

Por defecto, mlx-community/Qwen3.5-4B-4bit en una revisión fijada, 3,06 GB en diez archivos. En la página Modelos hay una variante mixta de cuatro y ocho bits, de 3,57 GB, para llamadas a herramientas más precisas.

¿Puedo cargar mi propio modelo GGUF o MLX?

No. El catálogo de descargas tiene dos entradas, y cada una pasa pruebas del bucle de herramientas en dispositivos físicos antes de incluirse. En iOS 27, la página Modelos también ofrece Apple Intelligence, que viene integrado en iOS. Orvena es un asistente, no un ejecutor genérico de modelos.

¿De dónde vienen los pesos y se verifican?

Del servidor espejo de Orvena, con Hugging Face como alternativa. Cada archivo se comprueba con el tamaño y el hash SHA-256 fijados antes de activar el modelo. La descarga se hace en segundo plano, se reanuda si se interrumpe y queda excluida de la copia de seguridad de iCloud.

¿Se usan mis datos para entrenar Qwen?

No. El modelo funciona en tu móvil. Nada de lo que escribes o dices se envía a Alibaba ni a Orvena. Una herramienta envía lo que necesita a su propio servicio, por ejemplo una búsqueda web a DuckDuckGo, y tu conversación solo sale del móvil si eliges Private Cloud Compute o conectas tú mismo un modelo en la nube.

Qwen 3.5 4B, en el móvil, con tu calendario.

Orvena es gratis en el App Store para iPhone 15 Pro y posteriores. La descarga de 3,1 GB se hace una sola vez y el modelo funciona en el móvil.

Descargar en el App Store