La IA en local ha dejado de ser una rareza reservada a quien monta una torre con varias tarjetas gráficas. Apple acaba de presentar el Mac mini con M6 y M5 Pro; NVIDIA ya vende DGX Spark; AMD ha empezado a enviar Ryzen AI Halo; y Xiaomi ha enseñado AI Cube, un prototipo con tres chips propios.
La lectura rápida sería que ya podemos tener un “ChatGPT privado” debajo del monitor.
La lectura útil es menos espectacular: la IA en local ya es viable para más casos, pero el equipo correcto depende del modelo, los datos, los usuarios y el proceso que quieras resolver.
No todas estas máquinas compiten en la misma categoría. Tampoco todas se pueden comprar. Y una cifra de TOPS o de parámetros no te dice por sí sola si el sistema va a trabajar bien.
Qué significa realmente ejecutar IA en local
Ejecutar IA en local significa que los pesos del modelo y el proceso de inferencia funcionan en un equipo bajo tu control, en lugar de enviar cada petición a una API externa.
Esto puede aportar cuatro ventajas claras:
- Privacidad y residencia de los datos: documentos, prompts y respuestas pueden quedarse dentro de tu infraestructura.
- Funcionamiento sin conexión: el modelo puede seguir disponible aunque no haya internet o falle un proveedor.
- Latencia estable: no dependes de una cola remota para obtener cada respuesta.
- Coste predecible con uso intensivo: compras capacidad por adelantado en lugar de pagar cada token generado, aunque hay que amortizar el equipo y sumar energía, mantenimiento y horas de administración.
Pero “local” no significa “privado” de forma automática.
La aplicación puede enviar telemetría, calcular embeddings en la nube o conectar un agente al correo y al CRM. Y alguien tiene que actualizar el software, controlar accesos, cifrar el almacenamiento, hacer copias y revisar resultados.
Desenchufar el cable de internet es una prueba útil. No es una política de seguridad.
Qué modelos puedes ejecutar en local según la memoria
En IA local, la memoria suele importar más que el nombre del chip.
Un modelo necesita espacio para sus pesos, pero también para el contexto, la caché de la conversación, el motor de inferencia y el sistema operativo. Con varios usuarios, la memoria y el cálculo también se reparten.
La cuantización reduce el tamaño de los pesos usando menos bits. Como regla aproximada, un modelo denso de 70.000 millones de parámetros parte de unos 35 GB a 4 bits, antes de sumar el resto.
Por eso “cabe” y “funciona con comodidad” no son lo mismo.
La letra B viene de billion: 7B equivale a unos 7.000 millones de parámetros. Los modelos de mezcla de expertos, o MoE, tienen muchos parámetros totales pero activan solo una parte en cada paso. OpenAI recomienda al menos 60 GB para ejecutar gpt-oss-120b; gpt-oss-20b puede funcionar con 16 GB.
Eso no convierte cualquier ordenador de 16 GB en una buena estación de IA.
Yo usaría esta orientación inicial:
- 16 GB: modelos pequeños y pruebas; 7B u 8B suelen ser una zona razonable. gpt-oss-20b puede entrar, pero deja poco margen.
- 24 o 32 GB: modelos de 20B y muchos modelos cuantizados de 30B o 32B, según contexto y motor.
- 48 o 64 GB: modelos de 30B con holgura y algunos 70B cuantizados; un 120B puede llegar a cargar en casos concretos, pero queda al límite.
- 128 GB: modelos de 70B con margen y modelos MoE de 120B; algunos fabricantes anuncian hasta 200B con cuantización y condiciones concretas.
No es una tabla de compatibilidad universal. Es una forma de evitar una compra mal planteada antes de probar el modelo real.
Comparación rápida: qué ofrece cada equipo
Precios de partida anunciados en Estados Unidos, antes de impuestos y sin igualar almacenamiento o soporte. Estado comprobado a 27 de agosto de 2026.
| Equipo | Estado y precio de partida | Memoria y ancho de banda | Ecosistema principal | Encaje razonable |
|---|---|---|---|---|
| Mac mini M6 | Reserva; disponible el 22 de septiembre. Desde 899 dólares | 16 a 32 GB; hasta 170 GB/s | Apple Silicon: MLX, Ollama y LM Studio | Uso personal, modelos pequeños o medios, automatizaciones locales y primera prueba |
| Mac mini M5 Pro | Reserva; disponible el 22 de septiembre. Desde 1.699 dólares | 24 a 64 GB; 307 GB/s | Apple Silicon: MLX, Ollama y LM Studio | Modelos de 20B a 32B con margen y 70B cuantizados en casos concretos |
| NVIDIA DGX Spark | A la venta en EE. UU.; stock regional variable. 4.699 dólares | 128 GB; 273 GB/s | NVIDIA: CUDA, TensorRT-LLM y NIM sobre Ubuntu/Arm64 | Desarrollo avanzado, ajuste de modelos y flujos que ya dependen de CUDA |
| AMD Ryzen AI Halo | Envíos iniciados en EE. UU. 3.999 dólares | 128 GB; 256 GB/s | AMD: ROCm sobre Windows o Linux | Modelos grandes, agentes locales y una estación x86 de uso mixto |
| Xiaomi AI Cube | Prototipo; sin precio ni fecha de venta | 80 GB anunciados; sin ficha completa | XRING; sistema operativo, modelos y SDK no detallados | Señal tecnológica; aún no es una recomendación de compra |
Esta tabla sirve para ubicarse. No sirve para declarar un ganador.
Mac mini M6: la memoria sigue marcando el límite
Apple presentó el nuevo Mac mini el 25 de agosto de 2026 con dos configuraciones que conviene separar.
El M6 parte de 16 GB de memoria unificada, llega a 32 GB y ofrece hasta 170 GB/s. El M5 Pro sube a 307 GB/s y 64 GB. Este último incorpora Thunderbolt 5: Apple propone agrupar varios Mac mini para ejecutar modelos mayores, siempre con software compatible y sin convertir sus memorias en una sola memoria unificada.
Apple afirma que el M6 ofrece hasta 4,8 veces más rendimiento en la métrica de tiempo hasta el primer token en LM Studio frente al M4, y el M5 Pro hasta cuatro veces frente al M4 Pro. Es una mejora importante, pero ojo: tiempo hasta el primer token no es lo mismo que velocidad sostenida de generación, y la comparación no aporta todos los datos necesarios para cruzarla con las pruebas de AMD o NVIDIA.
Para IA local, el matiz decisivo es otro: las configuraciones actuales mantienen los techos de 32 y 64 GB de los M4 y M4 Pro anteriores. Entran aproximadamente las mismas clases de modelos, aunque Apple muestre una respuesta inicial más rápida y el nuevo hardware aporte más ancho de banda.
Mi lectura práctica sería:
- El M6 de 16 GB sirve para probar IA local, no para modelos grandes. Si la IA forma parte de la compra, priorizaría 32 GB: los modelos pueden vivir en un SSD externo, pero la memoria no se amplía.
- El M5 Pro de 64 GB es más interesante para modelos de código, razonamiento o análisis de 30B y para experimentar con 70B cuantizados.
- No compraría al límite. Un modelo que ya pide unos 60 GB deja muy poco espacio para macOS, el contexto y el resto del flujo.
Apple Silicon combina silencio, memoria compartida y herramientas accesibles como MLX, Ollama o LM Studio. Para resumir documentos, clasificar información o mantener un asistente local, el Mac mini puede ofrecer poca fricción; no es un sustituto barato de una máquina de 128 GB.
NVIDIA DGX Spark: la memoria importa, pero CUDA pesa todavía más
DGX Spark es un equipo de 15 centímetros de lado construido alrededor del superchip Grace Blackwell GB10. Combina una CPU Arm de 20 núcleos, GPU Blackwell, 128 GB de memoria coherente, 273 GB/s de ancho de banda y un SSD de 4 TB.
NVIDIA anuncia hasta un petaflop de cálculo en FP4 con dispersión, inferencia de modelos de hasta 200B y ajuste de modelos de hasta 70B. El chip tiene un TDP de 140 W y el equipo utiliza una fuente de 240 W.
La cifra llamativa es el petaflop. La razón seria para comprarlo es CUDA.
Si un equipo de desarrollo ya trabaja con PyTorch, TensorRT-LLM, vLLM, NIM, contenedores NVIDIA o herramientas optimizadas para CUDA, DGX Spark puede reducir la adaptación, siempre que todas las dependencias tengan versión Arm64. También incluye red ConnectX de 200 Gb/s para unir varios equipos, algo relevante en laboratorios y prototipos que necesitan escalar.
Hay dos matices.
El primero es el precio: NVIDIA elevó el precio oficial de 3.999 a 4.699 dólares en febrero de 2026 sin cambiar el hardware. En España, la tienda oficial mostraba 4.800 euros y sin stock el 27 de agosto.
El segundo es la arquitectura Arm64. Muchas herramientas ya funcionan, pero una dependencia compilada solo para x86 o un programa que use instrucciones específicas puede requerir otra versión o una adaptación. No significa que DGX Spark sea incompatible; significa que conviene revisar el flujo completo antes de comprarlo.
Lo elegiría cuando el valor esté en desarrollar, ajustar o validar modelos dentro del ecosistema NVIDIA. Para instalar un chat privado para tres personas, probablemente es más equipo del necesario.
AMD Ryzen AI Halo: una alternativa a DGX Spark
Ryzen AI Halo Developer Platform es una plataforma con marca AMD, comercializada en Estados Unidos a través de Micro Center, que compite en el formato de DGX Spark con 128 GB de memoria unificada.
El modelo actual monta un Ryzen AI Max+ 395 con CPU x86 Zen 5 de 16 núcleos, gráficos Radeon 8060S, 256 GB/s, SSD de 2 TB y TDP de 120 W. Funciona con Windows o Linux y llega preparado para ROCm, PyTorch, vLLM, llama.cpp, Ollama, LM Studio o ComfyUI.
Por ahora se comercializa en Estados Unidos a través de Micro Center por 3.999 dólares. AMD ya ha anunciado una versión con Ryzen AI Max+ PRO 495 y 192 GB de memoria, pero sigue marcada como “próximamente” y no tiene precio final.
AMD publica pruebas propias, no independientes, de tokens por segundo en las que Halo supera entre un 4 % y un 14 % a DGX Spark en cuatro modelos concretos. En otro ensayo con 302 fuentes locales sintéticas, Spark fue más rápido generando con GPU, pero Halo terminó el flujo completo un 15 % antes gracias al bloque de preparación y orquestación con CPU. Son pruebas del fabricante, no un veredicto general.
La idea útil es que una aplicación de IA no es solo el momento en el que la GPU genera tokens. También hay que abrir archivos, buscar, llamar herramientas, validar y guardar resultados.
AMD puede encajar mejor cuando necesitas 128 GB, compatibilidad x86 y un mismo equipo para IA y software convencional de Windows o Linux. NVIDIA ofrece menos fricción si el proceso exige CUDA, TensorRT-LLM o NIM y las dependencias tienen versión Arm64; AMD es una alternativa si ROCm cubre todo el flujo.
Comparar el petaflop FP4 de NVIDIA con los 60 teraflops FP16 de AMD no aclara nada. Cambian la precisión, la dispersión y el tipo de operación. La prueba que importa es tu modelo, tu cuantización, tu contexto y tu flujo de principio a fin.
Xiaomi AI Cube: un prototipo, no una compra
Xiaomi presentó el AI Cube Prototype el 24 de agosto, un día antes del nuevo Mac mini.
El equipo reúne tres chips propios: XRING O3 como sistema principal, O100 como acelerador cercano a memoria y D100, concebido originalmente para conducción inteligente y cargas grandes.
Según una explicación posterior de Lei Jun reproducida por IT之家, el prototipo utiliza 80 GB de memoria unificada, admite una potencia sostenida de hasta 150 W y tenía desplegados modelos de 120B y 3B, con conmutación entre ambos sistemas.
Xiaomi también atribuye al O100 un ancho de banda interno cercano a 1,22 TB/s. Esa cifra corresponde a la interfaz de cálculo cercano a memoria del chip, no al ancho de banda efectivo de los 80 GB ni al sistema completo. No conviene colocarla al lado de los 170, 256 o 273 GB/s de otros equipos como si midieran exactamente lo mismo.
En los materiales públicos, Xiaomi no detalló precio, fecha de venta, sistema operativo, SDK, puertos, identidad, arquitectura o cuantización exactas de los modelos, ni un benchmark independiente. Prevé llevar O100 y D100 a aplicaciones comerciales en 2027, pero eso no confirma que vaya a vender esta máquina.
Tampoco sabemos cuánto contexto admite el modelo de 120B o a qué velocidad genera. Con 80 GB puede ser técnicamente posible. Falta saber si es práctico.
No recomendaría esperar para comprarlo. Sí prestaría atención a lo que representa: fabricantes de móviles, coches y dispositivos domésticos empiezan a diseñar juntos el chip, el modelo y el equipo local.
Qué equipo elegiría según el caso
Para aprender y probar un asistente local
Usaría primero el ordenador que ya tiene la empresa. Ollama y LM Studio permiten comprobar si un modelo pequeño resuelve la tarea antes de comprar. Si debe usar herramientas y completar varios pasos, definiría antes qué trabajo debe hacer realmente el agente. Un Mac mini M6 con 32 GB es una entrada razonable para una persona si esos modelos bastan.
Para documentos sensibles de un único departamento
Empezaría con 64 o 128 GB, según el modelo y el volumen. El M5 Pro encaja en macOS; Ryzen AI Halo aporta más memoria y flexibilidad en Windows o Linux. También definiría quién administra usuarios, actualizaciones, registros, copias y permisos.
Para desarrollar y ajustar modelos
DGX Spark tiene sentido si el flujo ya vive en CUDA o migrará a infraestructura NVIDIA. Ryzen AI Halo es una alternativa si ROCm cubre las dependencias y x86 o Windows aportan valor. Antes de decidir, ejecutaría una prueba representativa en ambos.
Para dar servicio a varias personas
Dejaría de pensar en “un ordenador potente” y diseñaría un servicio con autenticación, colas, límites y observabilidad. Una estación puede servir para el piloto; la producción quizá pida un servidor, varias máquinas o un enfoque híbrido.
Local, nube o híbrido: la decisión no es ideológica
La nube sigue siendo mejor cuando el uso es esporádico, necesitas el modelo más capaz disponible, no quieres mantener infraestructura o la demanda cambia mucho.
El local gana cuando los datos no deben salir, necesitas trabajar sin conexión, el uso es continuo, buscas latencia predecible o quieres controlar el modelo y sus actualizaciones.
En muchas empresas, la respuesta razonable será híbrida. La comparación entre modelos locales y servicios como ChatGPT Work no debería reducirse a cuál parece más inteligente:
- Un modelo local pequeño para clasificar, extraer, buscar y trabajar con documentación sensible.
- Un modelo en la nube para investigaciones complejas o tareas que necesitan más capacidad.
- Reglas claras sobre qué información puede salir y qué acciones requieren revisión.
No todo documento sensible necesita el modelo más grande. No toda pregunta difícil debería resolverse en un equipo local solo porque cabe.
Las preguntas que haría antes de comprar
Antes de elegir entre Apple, NVIDIA, AMD o esperar al siguiente anuncio, respondería esto:
- Qué trabajo concreto debe mejorar. “Tener IA privada” no es un caso de uso.
- Qué modelo lo resuelve de verdad. Hay que probar calidad, idioma, contexto y errores con ejemplos propios.
- Qué memoria necesita con margen. Pesos, contexto, sistema y usuarios simultáneos.
- Qué software exige. MLX, Metal, CUDA, ROCm, Windows, Linux o una dependencia concreta.
- Qué datos entran y salen. Incluidos embeddings, telemetría, copias, logs y herramientas conectadas.
- Quién mantiene el sistema. Modelos, parches, accesos, monitorización y recuperación.
- Cómo se medirá. Calidad, tokens por segundo, tiempo total del proceso, coste, consumo y horas de administración.
La IA generativa no sustituye el criterio: amplifica el proceso que ya tienes, para bien o para mal.
Mi conclusión
La compra correcta no empieza comparando TOPS. Empieza eligiendo un proceso, unos datos y un modelo que lo resuelva. Después se mide qué memoria necesita, cómo responde con varias personas y quién va a mantenerlo.
Si todavía no puedes responder a esas preguntas, no necesitas reservar una caja nueva. Necesitas ordenar el caso de uso. Ese es precisamente el punto de partida de un diagnóstico de IA aplicado a procesos reales.
Fuentes consultadas
- Apple: presentación del Mac mini con M6 y M5 Pro
- Apple: especificaciones técnicas del Mac mini
- Apple: rendimiento de IA y clústeres del Mac mini
- Apple: especificaciones del Mac mini M4 y M4 Pro
- Apple Machine Learning Research: MLX para Apple Silicon
- NVIDIA: DGX Spark, cargas de trabajo y especificaciones
- NVIDIA: precio oficial de DGX Spark
- NVIDIA: disponibilidad y precio de DGX Spark en España
- NVIDIA: anuncio del cambio de precio de DGX Spark
- NVIDIA: guía de portabilidad de aplicaciones a DGX Spark
- AMD: Ryzen AI Halo Developer Platform
- AMD: especificaciones del Ryzen AI Halo con Ryzen AI Max+ 395
- AMD: disponibilidad de Ryzen AI Halo
- AMD: prueba de un flujo agéntico completo en Ryzen AI Halo
- OpenAI: guía para ejecutar gpt-oss en local con Ollama
- Lei Jun: presentación del Xiaomi AI Cube Prototype, reproducida por Sina
- Lei Jun: explicación técnica posterior del Xiaomi AI Cube, reproducida por IT之家
- Lei Jun: anuncio de XRING O3, O100 y D100, reproducido por Sina