
Muchos, no todos, cuando pensamos en «Inteligencia Artificial» solemos imaginar una aplicación propiedad de una gran empresa a la que solo se accede mediante un Chat de texto o voz. Pero desde 2023, y de forma muy acelerada en 2025 y 2026, ha ido creciendo en paralelo todo un ecosistema de modelos de código abierto: sistemas de iA cuyos «cerebros» se pueden descargar gratis, ejecutar en un ordenador personal o incluso en el móvil, y modificar libremente sin depender de ninguna empresa ni pagar por cada Chat.
Es algo tan importante como necesario si realmente queremos democratizar su uso. Implica que hoy en día ya es posible tener una iA que converse, programe o genere imágenes funcionando por completo en local, sin que los datos salgan de nuestros dispositivos y sin costes añadidos. La contrapartida es que elegir bien exige entender algo de su vocabulario asociado y lo que podemos esperar en función del hardware que tengamos disponible.
A continuación trataremos de desarrollar una sencilla guía para quien desee introducirse en el tema o simplemente tenga curiosidad por la situación actual. Se estructura en cuatro aspectos principales:
- Cómo se crea una IA, los desarrollos que condicionan las prestaciones y el tamaño (peso) de cada modelo.
- Opciones de código abierto, totales y «parciales».
- Hardware necesario, desde un simple móvil a un servidor, siempre condicionado por el tamaño del modelo.
- Cómo empezar, aplicaciones concretas para probar la iA local de inmediato.
1 · ¿De qué consta una Inteligencia Artificial?
Antes de comparar modelos conviene abrir el melón. Toda iA generativa actual comparte el mismo esquema: una arquitectura de tipo Transformer que decide cómo se relaciona la información consigo misma (el conocido como «mecanismo de atención») y unos pesos, que no son más que archivos con miles de millones de números, resultado de haber «leído» (sin permiso las más de las veces) una gigantesca base de datos con texto, código o imágenes. Cuanto mayor sea ese archivo de pesos, más memoria necesitarás para cargarlo: por eso un modelo de mil millones de parámetros cabe en un móvil, y uno de setecientos mil millones solo cabe en un servidor.
Ése esqueleto recién entrenado (el «modelo base») todavía no se comporta como un asistente de voz o texto. Hace falta una fase de ajuste fino (a menudo con retroalimentación humana, lo que se conoce como RLHF) para que aprenda a seguir instrucciones y a ser razonablemente «prudente». Antes de eso, ni siquiera entiende el lenguaje tal cual lo escribimos: un tokenizador traduce nuestras palabras a fragmentos numéricos que el modelo sí puede procesar, y determina cuánto «cuesta» cada idioma en la factura de la API. Ligada a esto está la ventana de contexto: la cantidad de texto previo que el modelo puede tener en memoria a la vez, crucial si le pides que lea un documento largo o mantenga una conversación extensa.
Para que ese modelo ya entrenado quepa en tu ordenador sin perder demasiada calidad, se recurre a la cuantización: redondear sus números a una precisión menor, algo parecido al proceso de comprimir una imagen. Es la técnica que ha democratizado la IA local, porque reduce a la mitad o incluso menos, la memoria necesaria. Una vez cuantificado, pasa a la fase de ejecución: llevada a cabo por un motor de inferencia como puede ser Ollama o llama.cpp, el programa que carga el modelo y gestiona su funcionamiento sobre la CPU o GPU.
Por último, hay piezas que amplían lo que el modelo puede hacer sin modificar sus pesos: la multimodalidad le permite procesar imagen o audio; la memoria externa o RAG da acceso a documentos privados o información actualizada sin la necesidad de volver a entrenar; los guardrails filtran respuestas indebidas; y la interfaz (un chat, una app, una API) se constituye como la parte que utilizaremos como usuarios finales.
| Componente | Función |
|---|---|
| Arquitectura / red neuronal | Define cómo fluye y se relaciona la información (atención). |
| Pesos / parámetros | El «conocimiento» aprendido; su tamaño marca la RAM/VRAM necesaria. |
| Dataset de entrenamiento | Da al modelo su base de conocimiento — y sus sesgos. |
| Tokenizador | Traduce lenguaje humano a unidades numéricas (tokens). |
| Ventana de contexto | Cuánto texto previo puede «recordar» el modelo a la vez. |
| Ajuste fino / RLHF | Convierte un modelo «base» crudo en uno «chat» usable. |
| Cuantización | Reduce la precisión numérica para que quepa en menos memoria. |
| Motor de inferencia | Software que ejecuta el modelo sobre CPU/GPU (Ollama, vLLM…). |
| Multimodalidad | Módulos añadidos para entender imagen, audio o vídeo. |
| Memoria externa / RAG | Conecta el modelo a datos externos sin reentrenarlo. |
| Guardrails / moderación | Filtra respuestas dañinas o no deseadas. |
| Interfaz | El chat, app o API por donde el humano accede al modelo. |
2 · El mapa del open source en 2026
Empresas chinas como DeepSeek, Alibaba con su familia Qwen, Zhipu AI (rebautizada Z.ai) o Moonshot AI, son quienes lideran a fecha de hoy los mayores modelos abiertos, con actualizaciones más frecuentes y en muchos casos, con las licencias más permisivas. Mientras tanto, Meta, que popularizó la idea de la IA «abierta» con Llama, ha frenado: su modelo más ambicioso (Behemoth) nunca llegó a publicarse, y el desarrollo de frontera de la compañía se trasladó a un modelo cerrado, Muse Spark. Llama 4 (Scout y Maverick) sigue siendo su referencia de código abierto, pero no al nivel de las más avanzada del mercado.
Llegados a éste punto, hay matices muy importantes:
No todo lo que se autodenomina como de «código abierto» lo es en sentido estricto.
Modelos como Llama o Gemma publican sus modelos ya entrenados (pesos) pero bajo licencias propias con restricciones (lo que se conoce como open weights), mientras que otros, como los de Zhipu, Alibaba, DeepSeek o el propio gpt-oss de OpenAI, usan licencias reconocidas por la Open Source Initiative (MIT o Apache 2.0), sin matiz alguno.
Código abierto real (MIT / Apache 2.0)Pesos abiertos con restriccionesPropietario / cerrado
Generalistas de gran tamaño
Son modelos «todoterreno», pensados para conversar, razonar y programar. El más comentado en 2026 es GLM-5.2, de la china Zhipu AI: en solo cuatro meses pasó de GLM-5 a esta versión, que Artificial Analysis sitúa como el modelo abierto número uno del mundo, con un millón de tokens de contexto y licencia MIT completa. DeepSeek es otro nombre inevitable, aunque con una advertencia: su esperado R2 nunca llegó a publicarse pese a años de rumores, y quien realmente está en producción es la familia V4 (Pro y Flash). Qwen 3.5 y 3.6, de Alibaba, cubren desde modelos de bolsillo hasta gigantes de 397.000 millones de parámetros, todos bajo Apache 2.0. Del lado occidental, Llama 4 (Meta), Gemma 3 (Google), Phi-4 (Microsoft) y Mistral/Mixtral (Francia) siguen siendo las alternativas más usadas fuera de China, aunque con licencias más restrictivas que sus rivales chinos.
GLM-5.2 — Zhipu AI / Z.ai 🇨🇳
MIT
744.000 millones de parámetros (40.000 millones activos), contexto de 1 millón de tokens. Solo texto, sin visión nativa. Chat, API y self-hosting para agentes.
DeepSeek V4-Pro / V4-Flash 🇨🇳
MIT
Pro: 1,6 billones de parámetros (49.000 millones activos); Flash: 284.000 millones (13.000 millones activos). API muy económica, ejecutable con Ollama en su variante Flash.
Qwen 3.5 / 3.6 — Alibaba 🇨🇳
Apache 2.0
Familia de 0,5 a 397.000 millones de parámetros, con Qwen3-Coder para programación. Las versiones pequeñas corren en un portátil normal.
Llama 4 (Scout / Maverick) — Meta 🇺🇸
Open weights
Scout llega a 10 millones de tokens de contexto. El desarrollo de frontera de Meta pasó a un modelo cerrado (Muse Spark); Llama sigue siendo su cara abierta.
Gemma 3 — Google 🇺🇸
Open weights
Modelo ligero pensado para ejecución local, integrado en apps móviles y de escritorio.
Phi-4 / Phi-4 Mini — Microsoft 🇺🇸
MIT
Pequeño y eficiente, pensado para dispositivos con recursos limitados.
Mistral / Mixtral 🇫🇷
Apache 2.0 (mayoría)
Generalista y de código, con versiones ligeras muy eficientes para uso empresarial on-premise.
Falcon 180B — TII 🇦🇪
Licencia Falcon (permisiva)
Modelo de gran tamaño para despliegue en servidores propios.
Kimi K2 / K2 Thinking — Moonshot AI 🇨🇳
Modified MIT
Contexto muy largo (256K tokens) y modo de razonamiento profundo, orientado a agentes y análisis documental.
gpt-oss-120b / 20b — OpenAI 🇺🇸
Apache 2.0
La cara abierta de OpenAI, mientras su frontera real permanece cerrada. Pensado para razonamiento.
Voz e imagen
En imagen, la alemana Black Forest Labs (fundada por exempleados de Stability AI) se ha posicionado en cabeza con FLUX.2, aunque con una licencia que cambia según la variante que uses: las versiones rápidas son Apache 2.0, pero las de mayor calidad son de pago. Stable Diffusion 3.5, de la británica Stability AI, sigue siendo la opción con más comunidad y personalización (LoRAs). Alibaba compite con Qwen-Image, con buen soporte bilingüe chino-inglés. En voz, Whisper de OpenAI continúa siendo el estándar de facto para transcripción, bajo licencia MIT.
FLUX.2 — Black Forest Labs 🇩🇪
Licencia mixta según variante
Lanzado en noviembre de 2025, con la variante rápida «klein» añadida en enero de 2026. Muy buen renderizado de texto dentro de la imagen.
Stable Diffusion 3.5 / SDXL — Stability AI 🇬🇧
Stability Community License
El ecosistema de personalización (LoRAs) más grande del sector.
Qwen-Image / Z-Image — Alibaba 🇨🇳
Apache 2.0
Generación de imágenes con buen soporte de texto en chino e inglés.
Whisper — OpenAI 🇺🇸
MIT
Reconocimiento de voz a texto, integrado en innumerables apps de transcripción.
Modelos pequeños
Ollama y llama.cpp no son modelos propiamente dichos, sino los «motores» que hacen posible ejecutar todo lo anterior en un ordenador de usuario. Y en el otro extremo está Gemini Nano, de Google: un modelo pequeño que ya viene integrado en Android para resumir o sugerir respuestas, sin que el usuario lo descargue ni pueda modificarlo.
Ollama / llama.cpp 🇺🇸 (proyectos open source)
MIT
Motores de inferencia: cargan y ejecutan modelos localmente desde la línea de comandos o una API compatible con OpenAI.
Gemini Nano — Google 🇺🇸
Propietario
Integrado de forma nativa en Android para resumen y sugerencias de respuesta; no se descarga ni modifica por separado.
⚠️ Novedades frente a versiones anteriores: DeepSeek R2 nunca se publicó (la familia V4 cubrió el hueco); Meta no tiene «Llama 5», su frontera pasó a un modelo cerrado; GLM saltó de la versión 5 a la 5.2 en cuatro meses, con licencia MIT real.
3 · Potencia de hardware necesaria
No hace falta ningún superordenador para lanzarse a la piscina. La mayoría de la gente que prueba IA local se queda sorprendida de lo poco que exige un modelo pequeño: con un portátil de oficina (hola ThinkPad), de los últimos cuatro o cinco años, ya se puede tener una conversación fluida con un modelo de entre uno y cuatro mil millones de parámetros. El salto importante llega cuando se quieren utilizar modelos mas extenso o específicamente para generar código: ahí ya es necesaria una tarjeta gráfica dedicada (GPU con abundante memoria VRam) no solo la memoria compartida del procesador.
Los modelos más extensos (los que compiten directamente con las iA más conocidas) solo tienen sentido si disponemos de un Mac Studio (habilita memoria compartida de serie), una torre equipada con una GPU potente y de abundante VRam (Series RTX 2000 en adelante con 8 Gb), o directamente alquilando un servidor en la nube (prohibitivo en la mayoría de casos).
Pese a que todo el hardware mencionado está rondando unos precios sencillamente absurdos, disponemos de una variable que lo cambia -casi- todo: la cuantización. Un modelo de setenta mil millones de parámetros que puede necesitar unos 140 GB de memoria en su versión «completa», puede quedarse en «apenas» 40 GB si se comprime (cuantifica) a 4 bits. La diferencia entre suspirar o poder llegar a utilizar.
Aquí recomiendo encarecidamente varios Podcast de Relfon Daily donde desarrolla todo este tema de manera comprensiva y con ejemplos tanto de uso como de configuraciones.
🟢 Básico / edge
Modelos típicos
1–4 mil millones de parámetros
Ejemplos
Gemma 3 1B, Phi-4 Mini, Qwen 3.5 2B
RAM mínima
8 GB
RAM recomendada
16 GB o más
Disco
5–10 GB libres
Hardware ejemplo
Raspberry Pi 5, Mini PC básico, portátil medio
🔵 Intermedio
Modelos típicos
7–27 mil millones de parámetros
Ejemplos
Llama 4 Scout (Q4), Qwen 3.5 27B, Mistral 7B
VRAM mínima
6–8 GB (o 16 GB RAM)
VRAM recomendada
16–24 GB
Disco
15–30 GB
Hardware ejemplo
Mac Mini M-series, Mini PC RTX 4060/4070
🟠 Avanzado
Modelos típicos
32–120 mil millones de parámetros
Ejemplos
gpt-oss-120b, Qwen 3.5 122B, Llama 4 Maverick (Q4)
VRAM mínima
24 GB
VRAM recomendada
48 GB o más
Disco
40–90 GB
Hardware ejemplo
Mac Studio M4 Max/Ultra, RTX 4090/5090
🔴 Servidor / frontera
Modelos típicos
180 mil millones – 1,6 billones
Ejemplos
Falcon 180B, GLM-5.2, DeepSeek V4-Pro
VRAM mínima
80 GB o más
VRAM recomendada
Varias GPU de datacenter
Disco
150–900 GB NVMe
Hardware ejemplo
Servidores NVIDIA A100/H100, nube
En Apple Silicon la memoria es «unificada» (CPU y GPU la comparten), así que la RAM del Mac equivale aproximadamente a la VRAM disponible. Ojo con el contexto: una conversación muy larga también consume memoria adicional; los modelos de un millón de tokens, como GLM-5.2, son el caso extremo.
4 · Usando el terminal móvil
La forma más rápida de empezar con todo esto mediante la tienda de aplicaciones del móvil. PocketPal AI y MLC Chat son las puertas de entrada más sencillas: apps de código abierto que descargan un modelo pequeño (Phi-4 Mini, Gemma 3 1B, Qwen 3.5 2B) y lo ejecutan sin conexión, con resultados aceptables a partir de 4 GB de RAM. Si el teléfono es actual y/o de gama alta, aplicaciones «todo en uno» como Private LLM añaden voz e imágenes (análisis de fotos) al mismo paquete offline.
Quienes dispongan de un iPhone 15 Pro o superior ya cuenta con Apple Intelligence integrado en el sistema, y en Android de gama alta (Pixel, Galaxy S24 en adelante) sucede lo mismo con Gemini Nano: resúmenes en Chrome, sugerencias de respuesta en WhatsApp, transcripción local. Y si lo que se quiere es un modelo realmente grande, la solución no es forzar el teléfono, sino usarlo como interfaz con Ollama o LM Studio corriendo en un ordenador potente conectados mediante VPN o Tailscale.
PocketPal AI / MLC Chat
Mínimo
4 GB RAM
Bueno
8 GB+ RAM, chip de gama alta
Apple Intelligence / Gemini Nano
Mínimo
iPhone 15 Pro · Snapdragon 8 Gen 3
Bueno
iPhone 16/17 Pro · Pixel 9/10, Galaxy S25/S26
Límite práctico en 2026: la usabilidad en un móvil sigue siendo un modelo de 1.000 a 3.000 millones de parámetros. Carga rápido, no calienta el teléfono y deja RAM libre para el resto del sistema. Los de 7.000 millones o más ya son posibles en un tope de gama con 12.ó 16 GB de RAM, pero con una generación lenta y calentamiento notable.
Conclusiones
Si algo define el código abierto de iA en 2026 es el rápido cambio en los actores principales: hace apenas un año, Meta y OpenAI marcaban el ritmo; hoy son los desarrollos chinos quienes publican con más frecuencia y bajo licencias más peemisivas, mientras las compañías estadounidenses reservan sus modelos más potentes para sí mismas. Antes de fiarte de cualquier cifra concreta de este artículo (tamaños, precios, requisitos exactos), merece la pena comprobarla en Hugging Face o en la página oficial del desarrollo correspondiente:
En este campo, lo que hoy es cierto puede quedar desfasado en semanas.
