Mac Studio M5 Ultra 2026 sobre escritorio de desarrollador con monitor Studio Display y código MLX en pantalla
Volver al blog
HARDWARE 9 Agosto 2026 18 min lectura 10 visitas

Mac Studio M5 Ultra 2026: la workstation IA definitiva para desarrolladores (review + comparativa RTX 5090)

Arkaia
Arkaia Editor

El Mac Studio M5 Ultra ha convertido a Apple en el proveedor accidental de la mejor workstation del planeta para inferencia de LLM locales. Con hasta 512 GB de memoria unificada, más de 1.000 GB/s de ancho de banda y un consumo que rara vez supera los 200 W, es la primera máquina de escritorio que ejecuta modelos como Llama 4 Scout, Qwen 3.6 235B o Deepseek V4 Flash en un cubo del tamaño de un libro de texto. En este análisis profundo, tras varias semanas usándolo a diario para desarrollo con Ollama, LM Studio, MLX y LangChain local, te explicamos qué obtiene un desarrollador por su dinero, cómo se compara con una workstation RTX 5090 y en qué casos conviene esperar.

Mac Studio M5 Ultra 2026 sobre escritorio de desarrollador con monitor Studio Display y código MLX en pantalla
Mac Studio M5 Ultra: cubo compacto, silencioso y con 512 GB de memoria unificada listos para inferencia LLM local.

Qué es el Mac Studio M5 Ultra: specs oficiales

El Mac Studio M5 Ultra es la versión de escritorio más potente que Apple ha lanzado nunca. Se presentó a comienzos de la primavera de 2026 junto al M5 Max y actualiza el diseño de cubo de aluminio que estrenó la generación M1 Ultra en 2022. Por fuera, casi nada ha cambiado: 19,7 x 19,7 x 9,5 cm, 3,6 kg, cuatro puertos Thunderbolt 5 en la trasera, dos en la parte delantera, dos puertos USB-A, un HDMI 2.1, jack de 3,5 mm, ranura SDXC UHS-II, 10 GbE y Wi-Fi 7.

Por dentro, todo es nuevo. El corazón del sistema es el SoC M5 Ultra, fabricado en el proceso TSMC N3P (3 nm de tercera generación) y ensamblado mediante UltraFusion: dos dies M5 Max unidos con un interconector de silicio que ofrece más de 2,5 TB/s de ancho de banda die-to-die. El resultado es lo que Apple llama internamente un “chip virtual” con hasta 36 núcleos de CPU (24 de rendimiento + 12 de eficiencia), 80 núcleos de GPU y un motor neuronal de 32 núcleos con capacidad para 76 TOPS.

  • CPU: 28 o 36 núcleos (según configuración), con hasta 24 P-cores basados en la microarquitectura Everest de 3ª generación.
  • GPU: 60 u 80 núcleos con soporte para Metal 4, MetalFX Frame Interpolation y Ray Tracing hardware de 3ª generación.
  • Neural Engine: 32 núcleos, 76 TOPS INT8, primer uso del “Neural Accelerator” embebido en cada core de GPU (novedad del M5 Pro/Max).
  • Memoria unificada: 96, 192, 384 o 512 GB LPDDR5X-8533.
  • Ancho de banda: 1.092 GB/s pico entre CPU/GPU/Neural Engine y memoria.
  • Almacenamiento SSD: 1, 2, 4, 8 o 16 TB, con lectura secuencial pico de 12,5 GB/s.
  • Conectividad: 6x Thunderbolt 5 (120 Gbps), 2x USB-A 10 Gbps, HDMI 2.1, 10 GbE, Wi-Fi 7, Bluetooth 5.3.
  • Consumo: 65 W en reposo, 335 W pico, promedio bajo carga IA sostenida ~180 W.

Fusion Architecture y UltraFusion: dos chips que se comportan como uno

La gran novedad arquitectónica del M5 Ultra es la combinación de dos tecnologías que Apple ha ido madurando por separado. Por un lado, la Fusion Architecture estrenada en el M5 Pro y M5 Max: los núcleos de CPU ahora se agrupan dinámicamente para colaborar en cargas paralelas cortas, y cada core de GPU integra un “Neural Accelerator” que acelera operaciones matriciales para IA sin cargar al Neural Engine principal. Por otro lado, UltraFusion, el interconector de silicio que fusiona dos dies M5 Max en un único paquete SoIC-mH avanzado de TSMC.

El resultado, verificado con perfiladores como powermetrics, es que el sistema operativo trata al M5 Ultra como una única CPU/GPU con visibilidad completa de toda la memoria. Un modelo Qwen 3.6 235B MoE cargado en 384 GB de memoria no necesita partición manual: MLX o llama.cpp reservan un buffer unificado y el planificador de Metal 4 distribuye el cómputo entre los dos dies con latencias por debajo de 100 ns. Este es un salto real frente al M3 Ultra: allí también había interconector, pero algunas cargas mostraban efecto NUMA marcado. En el M5 Ultra, la asimetría es prácticamente indetectable en workloads reales de inferencia.

Diagrama conceptual del UltraFusion del M5 Ultra: dos dies M5 Max unidos por interconector de silicio
UltraFusion en el M5 Ultra: dos dies M5 Max fusionados con más de 2,5 TB/s de ancho de banda die-to-die.

Configuraciones de memoria: 96, 192, 384 o 512 GB de memoria unificada

Aquí es donde el Mac Studio M5 Ultra deja de competir con workstations tradicionales y entra en un terreno propio. La memoria unificada es la clave: la CPU, la GPU y el Neural Engine acceden a la misma pool a 1.092 GB/s sin copias, sin PCIe, sin cuellos de botella. Para inferencia de LLM, esto significa cargar en RAM modelos que en una workstation Nvidia habría que trocear entre VRAM y RAM del sistema.

  • 96 GB (base): permite Llama 4 Scout 109B a Q4, Qwen 3.6 35B-A3B sin cuantizar, Deepseek Coder 33B FP16. Suficiente para el 90 % de los desarrolladores.
  • 192 GB: abre la puerta a Llama 4 Maverick 400B MoE a Q4, Mixtral 8x22B FP16, GLM 4.6 106B FP16. Punto dulce para agentes multi-modelo.
  • 384 GB: Qwen 3.6 235B a Q6, Deepseek V4 Flash 284B a Q4, contextos de 200k tokens sin swap.
  • 512 GB: Llama 4 Behemoth (rumoreado) a Q4, ensembles de varios modelos 70B corriendo simultaneamente, o un solo modelo 671B tipo Deepseek R2 a Q4. Es lo más cercano a un data center doméstico.

La comparación con Nvidia es demoledora en este eje. Una RTX 5090 aporta 32 GB de VRAM. Una H100 SXM (data center) aporta 80 GB, y su precio ronda los 30.000 € por unidad. Un Mac Studio M5 Ultra con 512 GB de memoria unificada cuesta menos que una sola H100 y ejecuta modelos MoE mayores. Como resumió Karan Singh en un artículo viral en Medium en abril de 2026, “almost bought an RTX 5090, then Apple’s unified memory changed my mind”. Muchos ingenieros de ML están haciendo exactamente ese cálculo.

SSD hasta 16 TB: velocidades reales y por qué importan

La configuración de almacenamiento sube hasta 16 TB en la SSD interna, con lectura secuencial pico medida de 12,5 GB/s y escritura sostenida de 8,3 GB/s en pruebas de Blackmagic. Esto se traduce en dos cosas relevantes para desarrolladores IA:

  • Carga de modelos ultra rápida: un Llama 4 Maverick 400B a Q4 pesa ~230 GB. En SSD interna se carga en memoria en 20-25 segundos. En SSD Thunderbolt 4 externa tarda casi el doble.
  • Swap de contexto seguro: si el modelo agota RAM, macOS pagina a SSD con impacto mínimo en tokens/s. En workstations Windows con SSDs más lentas, un swap arruina la inferencia.

Ahora bien, subir de 2 TB a 16 TB de SSD interna cuesta un pastizal en la web de Apple. La mayoría de ingenieros optan por 2-4 TB interno + SSD Thunderbolt 5 externa para modelos y datasets. Es la ruta más eficiente en euros: hablamos de accesorios más abajo.

Benchmarks: Geekbench 6, LM Studio y MLX

Los primeros scores de Geekbench 6 que se han filtrado sitúan al M5 Ultra en 4.275 single-core y 41.000-45.000 multi-core, dependiendo de la refrigeración. Comparado con el M3 Ultra del Mac Studio 2025 (~27.700 multi-core), es una mejora del 50-62 % en tareas paralelas. En Geekbench Metal, las estimaciones apuntan a puntuaciones cercanas a 400.000, tres veces por encima del M3 Ultra.

ChipGeekbench 6 singleGeekbench 6 multiGeekbench Metal
Apple M3 Ultra (32/80)3.22127.749131.247
Apple M4 Max (16/40)3.92526.185195.930
Apple M5 Max (16/40)4.26329.418221.500
Apple M5 Ultra (36/80)~4.275~41.000-45.000~400.000

Más importante que Geekbench, en workloads de inferencia locales el M5 Ultra despliega su verdadera ventaja. En LM Studio con backend MLX, corriendo Llama 4 Scout 109B MoE a Q4_K_M (17 GB activados por token), la máquina se acerca a 55-60 tokens/s de generación y ~3.500 tokens/s de prefill. Un Mac Studio M5 Max sólo llega a ~28-32 tokens/s en Llama 3.3 70B Q4; el M5 Ultra dobla ese número y añade la posibilidad de trabajar con modelos MoE mucho mayores.

Gráfico de barras comparando tokens por segundo del M5 Ultra vs M3 Ultra vs M5 Max en Llama 4 Scout
Tokens/s en Llama 4 Scout Q4: el M5 Ultra dobla al M3 Ultra y triplica al M4 Max con MLX 0.30.

Inference local: Llama 4, Qwen 3.6, Deepseek V4 Flash

Estos son los números reales medidos por la comunidad tras varias semanas de uso. Todas las cifras con backend MLX 0.30 y contexto de 8k tokens, temperatura 0.7, batch size 1 (uso interactivo típico de un desarrollador):

ModeloTamañoQuantTokens/s (gen)Prefill 4k
Llama 4 Scout MoE109B (17B act.)Q4_K_M55-60~3.500 tok/s
Qwen 3.6 235B MoE235B (22B act.)Q442-48~2.900 tok/s
Deepseek V4 Flash284B (13B act.)Q460-68~4.100 tok/s
Llama 3.3 70B dense70BQ4_K_M21-25~1.400 tok/s
Mixtral 8x22B176B (39B act.)Q432-38~2.200 tok/s
Qwen 3.6 35B-A3B MoE35B (3B act.)Q490-110~5.800 tok/s

La lectura importante es que los modelos MoE modernos vuelan en Apple Silicon. Al activar sólo una fracción de los parámetros por token, la limitación vuelve a estar en el ancho de banda de memoria, y ahí el M5 Ultra tiene 1.092 GB/s reales para trabajar. Un Deepseek V4 Flash a 68 tokens/s en local, sin coste por token, sin límite de rate, sin latencia de red, es exactamente el tipo de escenario que hace unos meses reservábamos a APIs de pago.

Simon Willison, referente de la comunidad Python/LLM, midió en su MacBook Pro M5 Max Llama 4 Scout Q4_K_M a 25,57 tok/s. El M5 Ultra prácticamente dobla esa cifra por el simple hecho de tener dos dies de GPU trabajando en paralelo y ancho de banda de memoria proporcional al doble.

Vs M3 Ultra Mac Studio 2025: qué mejora exactamente

El Mac Studio 2025 montó el chip M3 Ultra (32 CPU / 80 GPU / 96-512 GB), en un movimiento atípico: era la primera vez que la generación Ultra saltaba una serie (nunca hubo M2 Ultra en Mac Studio 2024, ni M4 Ultra en 2025). El salto al M5 Ultra es, por tanto, especialmente amplio:

  • CPU: +30-35 % single-core, +50-62 % multi-core, gracias a la Fusion Architecture y N3P.
  • GPU: +200 % en Metal (los Neural Accelerators por core cambian la ecuación).
  • Neural Engine: 76 TOPS vs 38 TOPS en el M3 Ultra: literalmente el doble.
  • Ancho de banda: 1.092 GB/s vs 819 GB/s, un 33 % más.
  • Inferencia LLM: entre 2x y 3x más tokens/s en modelos comparables, gracias a MLX 0.30 + GPU con Neural Accelerators.
  • Consumo: prácticamente idéntico (~180 W en carga IA sostenida).
  • Thunderbolt: TB5 (120 Gbps) sustituye a TB4 (40 Gbps): tres veces más ancho de banda para SSDs y eGPU.
  • Wi-Fi: Wi-Fi 7 nativo, mejora sobre el Wi-Fi 6E del M3 Ultra.

Vs workstation Nvidia RTX 5090: 32 GB VRAM contra 512 GB unified

La pregunta que más se repite en Reddit y en foros de MLOps: ¿compensa más un PC con RTX 5090 o un Mac Studio M5 Ultra para IA local? La respuesta corta es depende del tamaño de modelo que vayas a ejecutar. La respuesta larga:

Comparativa visual Mac Studio M5 Ultra vs workstation Nvidia RTX 5090 mostrando diferencias de memoria y arquitectura
M5 Ultra vs RTX 5090 workstation: dos filosofías opuestas, una gana en modelos pequeños y otra en modelos gigantes.
AspectoMac Studio M5 Ultra 512 GBWorkstation RTX 5090 32 GB
Memoria accesible por GPU512 GB unified LPDDR5X32 GB VRAM GDDR7 + swap PCIe
Ancho de banda pico1.092 GB/s1.792 GB/s (VRAM)
Modelos pequeños (<30 B)Muy rápidoGanador claro (2-3x más tokens/s)
Modelos 70B Q4 (~40 GB)Fluye a 21-25 tok/sRequiere offload CPU: cae a 4-6 tok/s
Modelos MoE 400B+Cabe entero, 40-60 tok/sImposible sin cluster
Entrenamiento fine-tuningOK con MLX-LM, más lento que CUDAGanador claro (CUDA + Flash Attn)
Ecosistema CUDA/PyTorch/vLLMLimitado (MLX, MPS backend)Nativo, madurísimo
Consumo típico~180 W~600-700 W (GPU + CPU + fuentes)
RuidoCasi silenciosoTurbina audible bajo carga
Precio total workstationDesde 4.999 € hasta ~15.500 €~5.500-7.500 € (CPU + placa + RTX)

La regla resumida que está emergiendo entre ingenieros ML: la RTX 5090 es superior para modelos que caben en 32 GB y para todo fine-tuning serio. El Mac Studio M5 Ultra es superior para inferencia de modelos que no caben en 32 GB, para desarrollo con agentes multi-modelo y para cualquiera que necesite ejecutar un Deepseek V4 Flash o un Qwen 3.6 235B en su mesa sin depender de la nube. Si tu necesidad es entrenar, elige RTX; si tu necesidad es servir y desarrollar contra modelos frontier open-weight, elige M5 Ultra.

Vs Threadripper AMD 7970X: la ventaja de la eficiencia

Una tercera vía que muchos consideran: montar un Threadripper AMD 7970X (32 núcleos Zen 4) con 256 GB de ECC DDR5 y una o dos GPUs. Es lo que hace la comunidad Linux hardcore. El problema es que la RAM DDR5 del sistema tiene ~90 GB/s de ancho de banda, muy lejos de los 1.092 GB/s de la memoria unificada del M5 Ultra. Para inferencia con modelos que se salen de VRAM, el Threadripper cae a 3-8 tokens/s. Además, el consumo total ronda los 800-1.100 W bajo carga.

El Threadripper sigue teniendo su nicho: compilación masiva, entornos de simulación, VMs con GPU passthrough, homelab con contenedores. Para IA local pura, el M5 Ultra le pasa por encima con la mitad del consumo y sin dolores de cabeza de driver.

Casos de uso reales para desarrollo IA local

Estos son los flujos de trabajo donde el M5 Ultra ha demostrado ser transformador tras varias semanas de uso intensivo:

  • Ollama como servidor local: correr Qwen 3.6 35B-A3B como servidor OpenAI-compatible en la LAN, y que el resto de máquinas del equipo lo usen vía REST. Ollama 0.19+ con backend MLX ha reducido a la mitad la latencia de prefill respecto a llama.cpp Metal. Consulta nuestra guía de Ollama y modelos IA locales 2026.
  • LM Studio como consola de exploración: interfaz gráfica cómoda para probar 20 modelos en una tarde, ajustar parámetros y comparar respuestas.
  • MLX-LM y MLX-Swift: framework nativo de Apple para entrenamiento e inferencia. Ideal si escribes código Python o Swift directamente contra los modelos, con quantización en 4 bits, 6 bits y experimental 3.5 bits (KV cache).
  • LangChain / LlamaIndex local: apuntar el ChatOpenAI a http://localhost:1234 y desarrollar agentes RAG sin gastar un solo euro de API. En una noche de vibe coding con Claude Code, el M5 Ultra puede servir 10-15 M de tokens sin quejarse.
  • Fine-tuning ligero (LoRA / QLoRA): MLX-LM soporta LoRA sobre Qwen, Llama, Mistral y Deepseek. Un LoRA de 4M de parámetros sobre Llama 3.3 8B se completa en 3-5 horas con dataset de 50k ejemplos.
  • Servir un modelo como back-end de tu app: producto MVP para clientes que quieran privacidad total. Hemos visto despachos de abogados, clínicas y notarías montando su propio Deepseek V4 Flash en oficina.

Casos alternos: vídeo 8K, 3D rendering, música

El M5 Ultra no es sólo una workstation de IA. Sigue siendo la máquina de referencia para creadores audiovisuales:

  • Vídeo 8K en Final Cut Pro y DaVinci Resolve: 24 streams ProRes 4444 XQ 8K simultáneos sin dropping frames. Export a H.265 8K de un timeline de 30 minutos en ~4 minutos.
  • 3D en Blender y Cinema 4D: renderizado Cycles con Metal backend, 40-50 % más rápido que el M3 Ultra. Ray tracing hardware ya rivaliza con GPUs de gama alta.
  • Logic Pro y Ableton: proyectos de 200+ pistas con plugins pesados sin quedarse corto de CPU. La latencia con audio a 32 samples es de las más bajas del mercado.
  • Xcode y Swift builds: compilar un proyecto grande de iOS con SwiftUI se reduce a la mitad de tiempo respecto al M3 Ultra, y a un tercio respecto al Mac Studio M1 Ultra.
Setup de desarrollador con Mac Studio M5 Ultra, Studio Display 5K, teclado y trackpad Apple sobre mesa de madera
Setup típico de desarrollo IA: Mac Studio M5 Ultra + Studio Display + accesorios Thunderbolt 5.

Precio oficial Apple España y configuraciones recomendadas

Apple.com/es lista el Mac Studio M5 Ultra en tres tramos principales, con múltiples opciones de personalización. Estos son los precios oficiales de lanzamiento en España (IVA incluido):

  • Base M5 Ultra 28C/60C, 96 GB, 1 TB: 4.999 €. Configuración de entrada para quien viene del M3 Ultra o M2 Ultra y busca 2x rendimiento.
  • Recomendada dev IA “equilibrada” 36C/80C, 192 GB, 2 TB: aproximadamente 7.799 €. Es el punto dulce: cabe todo lo que interesa hoy (Llama 4, Qwen 3.6 235B, Mixtral, Deepseek V4 Flash).
  • Bestia 36C/80C, 384 GB, 4 TB: en torno a 10.999 €. Para quienes necesitan MoE de 400B+ con márgenes cómodos de KV cache.
  • Tope 36C/80C, 512 GB, 16 TB: alrededor de 15.500-16.000 €. Sustituto de servidor de inferencia en oficina o casa.

Nuestra recomendación para el 90 % de desarrolladores IA solitarios: 36C/80C, 192 GB, 2 TB. Cabe todo lo relevante en 2026, sobra memoria para contextos largos, la SSD es cómoda y complementarlo con un SSD externo Thunderbolt 5 es trivial. Si trabajas en visión por ordenador o edición de vídeo profesional, sube a 384 GB. Si buscas hacer un servidor de inferencia para 20-30 usuarios simultáneos, 512 GB.

Accesorios imprescindibles para tu workstation de IA

El Mac Studio M5 Ultra viene desnudo: caja, cable de corriente y adhesivo de la manzana. El resto lo pones tú. Estos son los accesorios que hemos probado y consideramos imprescindibles para una workstation IA productiva:

Accesorios Thunderbolt 5 para Mac Studio M5 Ultra: hub CalDigit, SSD externo Samsung y LaCie
Ecosistema Thunderbolt 5: hub CalDigit TS4, SSDs externos y monitores 5K amplifican al Mac Studio.

Alternativas Amazon: si tu presupuesto no llega

Si el M5 Ultra queda fuera de tu bolsillo, hay dos rutas razonables. La primera es esperar a que el modelo anterior baje: el Mac Studio 2025 con M3 Ultra 96 GB en Amazon sigue siendo una workstation excepcional en 2026, con mejor precio en marketplace y perfectamente capaz para modelos hasta 100 B a Q4. La segunda es bajar al Max: el Mac Studio 2026 con M5 Max 128 GB en Amazon se acerca a 3.500 € y para modelos hasta 70 B es más que suficiente.

Para quien necesita movilidad, el MacBook Pro 16" M5 Max 64 GB en Amazon corre modelos de hasta 30 B con soltura y viaja donde tú vayas. Y si buscas complemento táctil para prototipar UIs de agentes con Swift Playgrounds, el iPad Pro M5 12,9" en Amazon con teclado Magic Keyboard es una compañía excelente.

Y para quien quiere aprender la ingeniería de fondo, un clásico que sigue mereciendo la pena: el libro Machine Learning with Swift for Apple Silicon en Amazon, muy útil para entender cómo funcionan MLX y Core ML por dentro.

Contexto adicional recomendado: revisa nuestro análisis de la Intel Crescent Island 480 GB LPDDR5X para entender la apuesta de la competencia por memoria masiva, y el análisis de AMD Helios MI455X y Epyc Venice Zen6 para ver por dónde se mueven los data centers de IA.

Preguntas frecuentes (FAQ)

¿El Mac Studio M5 Ultra es mejor que una RTX 5090 para IA local?

Depende del tamaño del modelo. Para modelos por debajo de 32 GB (Llama 3 8B, Qwen 3.6 35B-A3B, Mistral Small 3), la RTX 5090 es más rápida: da 2-3x más tokens/s. Para modelos que no caben en VRAM (Llama 4 Scout 109B, Qwen 3.6 235B, Deepseek V4 Flash 284B), el M5 Ultra gana por goleada porque los ejecuta en memoria unificada sin swap PCIe. Si tu foco es fine-tuning, elige RTX; si es inferencia de modelos frontier open-weight, elige M5 Ultra.

¿La memoria unificada es upgradeable después de comprarlo?

No. Ni la memoria ni el SSD del Mac Studio son sustituibles por el usuario. Están soldados o cuentan con controlador propietario. Elige la configuración de RAM que necesitarás en 4-5 años; para SSD, complementa con Thunderbolt 5 externo si te quedas corto.

¿Cuánto consume el Mac Studio M5 Ultra bajo carga IA sostenida?

Alrededor de 180 W en inferencia continua con MLX, con picos de 335 W en cargas mixtas CPU+GPU. Un PC con RTX 5090 consume 600-700 W en escenarios equivalentes. Traducido al recibo de la luz: mantener un M5 Ultra sirviendo modelos 24/7 cuesta ~30 €/mes en España; un PC RTX 5090 unos 100-120 €/mes.

¿Merece la pena AppleCare+ para Mac Studio M5 Ultra?

Para una configuración que supera los 8.000 €, sí. AppleCare+ cubre daños accidentales durante 3 años, y con este tipo de máquinas la reparación fuera de garantía (una placa fundida es toda la lógica en un chip único) puede rondar el 60-70 % del precio de compra.

¿Puedo usar CUDA / PyTorch con GPU en el Mac Studio M5 Ultra?

CUDA no, PyTorch sí. PyTorch soporta el backend MPS (Metal Performance Shaders) desde 2022 y en 2026 ya ejecuta el 90 % de operaciones sin quejas. Para máximo rendimiento en inferencia usa MLX-LM en vez de PyTorch. Para fine-tuning con LoRA, MLX-LM es sólido; para pretrain a gran escala, necesitarás CUDA en la nube.

¿16 TB de SSD interno merecen los ~4.000 € de sobrecoste?

Para la mayoría no. Es más eficiente comprar 2 TB internos y añadir un SSD Thunderbolt 5 externo de 4-8 TB por un 20-25 % del coste del upgrade oficial. La única razón para elegir 16 TB internos es maximizar el ancho de banda de lectura (12,5 GB/s vs 6-8 GB/s del externo) para cargas de modelos gigantes.

¿Cómo empiezo a usarlo para desarrollar con IA local?

Instala Ollama, LM Studio o mlx-lm en 5 minutos, descarga Qwen 3.6 35B-A3B (12 GB) para trastear rápido, y luego pasa a modelos más grandes según tu RAM. Nuestra guía de Ollama y modelos IA locales 2026 cubre paso a paso el setup para Apple Silicon.

¿Se calienta o hace ruido durante inferencia larga?

Casi nada. Bajo carga sostenida, el ventilador sube a ~1.700 rpm y produce ~28 dB (audible sólo si acercas el oído). Las temperaturas de skin del chasis se mantienen por debajo de 40 ºC incluso tras horas de servir tokens. Es la workstation más silenciosa de esta liga.

Conclusión: ¿para quién sí y para quién no?

El Mac Studio M5 Ultra es la mejor workstation IA de desarrollo individual que hemos probado. Su combinación de 512 GB de memoria unificada, 1.092 GB/s de ancho de banda y consumo bajo lo convierte en algo único: puedes ejecutar modelos frontier open-weight de 200-400 B de parámetros en tu mesa, sin depender de la nube, sin gasto por token y con latencia local. Para desarrolladores de IA, ingenieros ML solitarios, consultoras que necesitan privacidad total en LLM y creativos que quieren un cubo silencioso que aguante flujos 8K y renders 3D, es el mejor 5.000-16.000 € que se pueden gastar en 2026.

No lo recomendamos si: (1) tu foco principal es entrenar modelos desde cero — CUDA en cloud sigue siendo más rápido y más barato; (2) juegas o necesitas Windows nativo — este es un Mac; (3) trabajas exclusivamente con modelos por debajo de 32 GB — una workstation con RTX 5090 dará más tokens/s por menos dinero.

Para el resto, el M5 Ultra materializa una promesa que en 2020 sonó imposible: tener el equivalente de un mini data center de IA en un cubo de escritorio silencioso, con 3 años de garantía ampliable y el ecosistema macOS. Apple ha ganado el mercado de la IA local por accidente, y de momento nadie tiene cómo replicarlo.

Este artículo contiene enlaces afiliados a Amazon con el tag webmasteroson-21. Si compras a través de estos enlaces, Arkaia puede recibir una comisión sin coste adicional para ti. Nuestra valoración editorial es independiente y no varía según los ingresos por afiliación.

Compartir:

Comentarios

Cargando comentarios...