Estación de trabajo generando fotogramas de vídeo con inteligencia artificial
Volver al blog
TUTORIALES 6 Septiembre 2026 16 min lectura 7 visitas

Generar vídeo con IA en local: tutorial completo de Wan 2.2 en ComfyUI

Chester
Chester Editor

Generar vídeo con inteligencia artificial en tu propio ordenador, sin cuota mensual y sin mandar nada a un servidor ajeno, ya es posible. Wan 2.2, el modelo de vídeo de Alibaba con licencia Apache 2.0, corre en ComfyUI desde tarjetas de 6 GB y da resultados que hace un año exigían suscripción.

Esta guía no es una traducción del README. Está escrita después de montarlo, romperlo y arreglarlo en una RTX 5060 Ti de 16 GB, así que incluye las tres cosas que ningún tutorial cuenta: por qué el modelo va en dos etapas, por qué el prompt negativo estándar te va a estropear las tomas y cómo evitar que la ropa de tu personaje cambie de color a mitad de plano.

Estación de trabajo generando fotogramas de vídeo con inteligencia artificial
Wan 2.2 genera vídeo en local con licencia Apache 2.0 y funciona desde tarjetas de 6 GB.

Qué es Wan 2.2 y por qué es el que hay que usar

Wan 2.2 lo desarrolla el equipo de investigación de Alibaba y se publica con licencia Apache 2.0. Eso último no es un detalle burocrático: significa que puedes usar lo que generes comercialmente sin pedir permiso ni pagar por fotograma, algo que no ocurre con la mayoría de servicios en la nube.

Viene en dos sabores que conviene no confundir:

VarianteTamañoPara qué sirveExigencia
TI2V-5B5.000 millonesTexto o imagen a vídeo, entradaFunciona desde 6 GB de VRAM
I2V A14B14.000 millones (dos etapas)Imagen a vídeo, calidad alta16 GB cómodo, 24 GB holgado
S2V 14B14.000 millonesVídeo a partir de audio y voz16 GB o más

Como referencia de tiempos: la variante de 5B genera un clip de 720p y 5 segundos a 24 fotogramas por segundo en una tarjeta de 24 GB en unos nueve minutos sin optimizar. Con los LoRA de aceleración que veremos, esa cifra baja muchísimo.

Lo esencial en 30 segundos

Instala ComfyUI, descarga los pesos de Wan 2.2, añade los LoRA Lightning para bajar de veinte pasos a cuatro, monta el flujo de dos etapas y encola todas tus tomas de una vez. Si tienes menos de 16 GB, usa la variante de 5B y no te compliques.

Lo que necesitas antes de empezar

Requisitos reales, no los del folleto:

  • GPU NVIDIA con 8 GB como mínimo para la variante de 5B; 16 GB para la de 14B. Con 6 GB funciona, pero con concesiones que se notan.
  • 32 GB de RAM del sistema. Este es el requisito que todo el mundo subestima: cuando el modelo no cabe entero en la gráfica, ComfyUI descarga capas a memoria principal, y con 16 GB el sistema empieza a tirar de disco.
  • Espacio en disco de sobra. Los dos pesos del modelo de 14B ocupan unos 14 GB cada uno, más el codificador de texto y el VAE.
  • ComfyUI instalado. Si partes de cero, nuestra guía completa de ComfyUI cubre la instalación paso a paso.

Sobre el hardware, sin rodeos: el cuello de botella es la VRAM, no la potencia bruta. Una tarjeta con 16 GB y menos núcleos rinde mejor en esto que una de 8 GB más rápida, porque el intercambio constante con la memoria del sistema destroza los tiempos. Si vas a comprar, una GPU con VRAM amplia es la decisión que más importa; tenemos el análisis completo en las mejores GPU para IA local.

El otro consejo es subir la RAM a 32 GB, que es lo que salva la generación cuando el modelo no cabe. Y un SSD rápido, porque cargar 14 GB de pesos en cada intercambio de etapa es una operación de lectura seria.

Paso 1: descargar los pesos y colocarlos

Los pesos se descargan de Hugging Face y van en carpetas concretas dentro de ComfyUI/models/. Para el flujo de 14B necesitas cinco piezas:

PiezaFicheroCarpeta
UNet etapa 1wan2.2_i2v_high_noise_14B_fp8_scaleddiffusion_models
UNet etapa 2wan2.2_i2v_low_noise_14B_fp8_scaleddiffusion_models
Codificador de textoumt5_xxl_fp8_e4m3fn_scaledtext_encoders
VAEwan_2.1_vaevae
LoRA de aceleraciónwan2.2_i2v_lightx2v_4steps_high y lowloras

Dos avisos. El codificador de texto se carga con el tipo wan, no con el que trae por defecto el nodo. Y el VAE es el de la versión 2.1, aunque el modelo sea 2.2: no es una errata, es así.

Bloques traslúcidos apilados representando los pesos de un modelo
Cinco piezas repartidas en cuatro carpetas: el codificador va con tipo wan y el VAE es el de la versión 2.1.

Paso 2: entender las dos etapas (esto es lo importante)

Aquí está la parte que casi ningún tutorial explica y que determina todo lo demás.

Wan 2.2 en su versión de 14B no es un modelo: son dos. Uno llamado high noise se encarga de los primeros pasos y establece la composición del movimiento: hacia dónde va la cámara, cómo se desplazan los elementos, la estructura del plano. Otro llamado low noise toma el relevo en los últimos pasos y afina el detalle.

La consecuencia práctica es dura: cada uno ocupa unos 14 GB, así que en una tarjeta de 16 GB solo cabe uno a la vez. ComfyUI los intercambia en mitad de cada generación, y ese intercambio cuesta tiempo.

De ahí sale el consejo más rentable de toda esta guía: encola todas tus tomas de una tirada en lugar de generar una, revisar, generar otra. Si haces diez clips de uno en uno, pagas veinte intercambios de modelo. Si los encolas juntos, ComfyUI puede organizarlos mucho mejor. En una sesión de trabajo real esa diferencia son horas.

Si tienes 24 GB o más, este problema desaparece y puedes trabajar de forma interactiva. Es, con diferencia, el argumento más fuerte para subir de gama en este caso concreto.

Paso 3: los LoRA Lightning, de 20 pasos a 4

Sin ayuda, Wan 2.2 necesita del orden de veinte pasos de muestreo por clip. Con los LoRA Lightning de 4 pasos —hay uno para cada etapa— baja a cuatro. Es una reducción de cinco veces en el tiempo de generación con una pérdida de calidad que en la mayoría de casos no justifica esperar el quíntuple.

Al usarlos hay que cambiar dos ajustes:

  • cfg a 1,0. Los modelos destilados no usan guía sin clasificador. Dejarlo en el valor por defecto produce imágenes quemadas y movimiento errático.
  • sampler euler. Es el que funciona de forma consistente con esta configuración.

Hay un tercer parámetro que casi nadie toca y que sí importa: el shift del nodo de muestreo. Reparte el ruido entre las dos etapas, es decir, decide cuánto trabajo hace el modelo de composición y cuánto el de afinado. Con los LoRA de 4 pasos, un valor en torno a 5,0 es un punto de partida sólido. Subirlo da más movimiento y menos estabilidad; bajarlo, lo contrario.

Paso 4: el prompt negativo, donde se pierden las tardes

Esta sección vale por el resto del artículo, porque es donde todo el mundo tropieza.

El prompt negativo canónico de Wan que circula por foros incluye términos chinos para «estático» e «inmóvil». Tiene sentido si buscas una toma con mucho movimiento. Pero si lo que quieres es un plano contenido —un retrato que respira, una escena tranquila— ponerlo es un tiro en el pie: le estás diciendo al modelo que evite la quietud, y el resultado es un personaje que gesticula sin parar como si le hubieran dado una mala noticia.

Estos son los negativos que de verdad hacen falta, agrupados por el problema que resuelven:

  • Cámara quieta: camera movement, camera pan, zoom, dolly, shaking. Sin esto, la cámara deriva sola.
  • Continuidad del plano: cut, scene change, morphing, warping. Evita que el clip cambie de escena a mitad.
  • Anatomía: distorted face, deformed hands, extra limbs, extra arms, fingers. Las manos siguen siendo el punto débil de todos estos modelos.
  • El que nadie pone y todos necesitan: clothes changing color, lighting change, exposure change, brightness change. Sin estos cuatro, la ropa se aclara sola a media toma. Una sudadera negra pasa a gris y el plano parece mal etalonado. Nos costó varias tomas descubrir que no era la iluminación de la imagen de partida sino el modelo derivando el color.
  • Calidad: blurry, low quality, jpeg artifacts, watermark, text, subtitles, flicker, strobing.
Comparación de dos fotogramas, uno con artefactos y otro limpio
El prompt negativo estándar de Wan incluye términos que sabotean las tomas de movimiento contenido.

Paso 5: el prompt positivo y qué pedirle

Al contrario que en imagen fija, aquí el prompt debe describir movimiento, no solo contenido. «Una mujer en un bosque» le deja al modelo decidir qué pasa, y decidirá mal. «Una mujer en un bosque, parpadea despacio, el pelo se mueve levemente con la brisa, cámara fija» le da un guion.

Tres reglas que nos han funcionado:

  1. En inglés. Los modelos rinden bastante mejor, igual que con generación de imagen.
  2. Un movimiento principal, no cinco. Pedir que gire la cabeza, sonría, levante la mano y se aparte el pelo en cinco segundos produce un revoltijo. Un movimiento claro sale limpio.
  3. Describe también lo que no cambia. «Fondo estático», «iluminación constante», «la misma ropa». Reforzar la estabilidad en positivo complementa al negativo.

Paso 6: resolución, duración y expectativas

La duración se controla con el número de fotogramas. A 24 fotogramas por segundo, cinco segundos son 120 fotogramas, y ese es el terreno donde estos modelos funcionan bien.

Conviene ser honesto con lo que se puede esperar. Wan 2.2 hace planos, no secuencias. Cinco segundos de un movimiento contenido salen muy bien. Veinte segundos con tres acciones encadenadas, no: la coherencia se degrada, los rasgos derivan y aparecen los cambios de plano fantasma.

La forma profesional de trabajar con esto es la del cine: generar tomas cortas y montarlas. Si necesitas treinta segundos, son seis tomas de cinco, no una de treinta.

Sobre resolución, 720p es el punto dulce. Subir a 1080p multiplica el tiempo y la memoria por un factor que rara vez compensa, sobre todo si el destino es una red social que va a recomprimirlo igual.

Cuándo NO usar Wan 2.2

Un tutorial honesto tiene que decir también cuándo su herramienta no es la adecuada.

Si necesitas un clip suelto y con prisa, montar todo esto no compensa: los servicios en la nube te lo dan en un minuto. Wan tiene sentido cuando vas a generar mucho, cuando el material es sensible y no puede salir de tu red, o cuando necesitas la licencia comercial sin letra pequeña.

Si buscas 4K nativo o duraciones largas con coherencia, hoy los servicios cerrados van por delante. Lo comparamos en nuestra guía de Kling 3 y en el tutorial de la API de FLUX 3.

Y si tu tarjeta tiene 8 GB o menos, empieza por la variante de 5B y asume que el flujo de dos etapas no es para ti todavía. Es preferible eso a pelearte tres tardes con errores de memoria.

El equipo que hace esto llevadero

Más allá de la gráfica, tres cosas cambian mucho el día a día cuando trabajas con esto:

Y si vas a montar equipo dedicado, ten presente que los precios de memoria siguen tensos: comprar la RAM y el SSD cuando aparezca una oferta razonable es mejor estrategia que esperar.

Rack de servidores con luces de estado procesando una cola de trabajos
Encolar las tomas en lote en vez de una a una evita decenas de intercambios de modelo y ahorra horas.

Paso 7: automatizar el flujo por API

Trabajar clicando en la interfaz está bien para aprender, pero en cuanto tengas el flujo afinado querrás lanzarlo desde un script. ComfyUI expone una API HTTP y es más sencilla de lo que parece.

El funcionamiento es directo: envías el grafo del flujo en formato JSON a /prompt y recibes un identificador. Después consultas /history con ese identificador hasta que aparezca, y de ahí sacas el nombre del fichero generado, que descargas desde /view. Nada de bibliotecas exóticas: con la biblioteca estándar de Python basta.

Lo que de verdad gana con esto no es la comodidad sino el encolado. Un script puede mandar diez tomas seguidas sin esperar a que termine cada una, y ahí es donde recuperas el tiempo perdido en intercambios de modelo del que hablábamos antes.

Dos avisos de operación. El primero: si el servidor de ComfyUI está en otra máquina y solo escucha en local, necesitas un túnel SSH para llegar a él. El segundo, más importante si compartes esa máquina con otras cosas: ComfyUI no suelta la memoria de la gráfica al terminar. Se queda con todo lo que ha cargado hasta que se lo pides explícitamente llamando a /free. Si en ese mismo equipo tienes un chatbot o cualquier otro servicio que necesite VRAM, se quedará sin ella y empezará a funcionar por CPU sin dar ningún error: solo irá absurdamente lento y te volverás loco buscando la causa.

Si vas a orquestar esto dentro de un flujo mayor, nuestro tutorial de n8n cubre cómo encadenar este tipo de llamadas con el resto de tu automatización.

Persona editando vídeo en una sala oscura con un monitor de referencia
Wan 2.2 hace planos, no secuencias: la forma profesional de trabajar es generar tomas cortas y montarlas.

Errores comunes y cómo salir de ellos

Los cinco fallos con los que nos hemos peleado, con su solución:

  • Error de memoria insuficiente a mitad de generación. Casi siempre ocurre en el cambio de etapa, no al principio. Cierra el navegador con la interfaz abierta (consume VRAM más de lo que parece), baja la resolución antes que los fotogramas y comprueba que no tienes otro proceso usando la gráfica.
  • El vídeo sale quemado o con colores saturados. Es cfg. Con los LoRA de 4 pasos tiene que estar en 1,0; cualquier valor superior produce exactamente ese efecto.
  • El movimiento es errático o hay cortes fantasma. Revisa el shift y baja un poco el valor. Y comprueba que el negativo incluye cut y scene change.
  • La cara cambia entre el principio y el final del clip. Es la deriva típica en clips largos. La solución no es un ajuste sino acortar la toma: por debajo de cinco segundos el problema casi desaparece.
  • Todo va lentísimo aunque la gráfica parezca ociosa. Falta RAM del sistema. El modelo está yendo y viniendo entre la gráfica, la memoria principal y el disco. Es el escenario que justifica los 32 GB.

Un consejo transversal: cuando algo falle, cambia un solo parámetro y vuelve a generar con la misma semilla. Es la única forma de saber qué hace cada ajuste. Cambiar tres cosas a la vez y ver que mejora no te enseña nada, y en un flujo con tantos mandos esa disciplina ahorra días.

Preguntas frecuentes

¿Cuánta VRAM necesito para Wan 2.2?

La variante TI2V-5B funciona desde 6 u 8 GB. La de 14B en dos etapas pide 16 GB para ir cómoda y 24 GB para trabajar sin intercambios de modelo. Lo que manda es la VRAM, no la potencia bruta de la tarjeta.

¿Wan 2.2 se puede usar comercialmente?

Sí. Se publica con licencia Apache 2.0, que permite uso comercial sin pagar por generación ni pedir permiso.

¿Por qué Wan 2.2 usa dos modelos?

Porque separa el trabajo en dos etapas: un modelo high noise establece la composición del movimiento en los primeros pasos y otro low noise afina el detalle en los últimos. Cada uno ocupa unos 14 GB, por lo que en tarjetas de 16 GB se intercambian durante la generación.

¿Para qué sirven los LoRA Lightning?

Reducen los pasos de muestreo de unos veinte a cuatro, con una mejora de velocidad de aproximadamente cinco veces. Al usarlos hay que poner cfg a 1,0 y sampler euler.

¿Por qué mi personaje gesticula sin parar?

Casi seguro por el prompt negativo. El negativo canónico de Wan incluye términos para estático e inmóvil, que le indican al modelo que evite la quietud. Si buscas movimiento contenido, hay que quitarlos.

¿Por qué cambia el color de la ropa a mitad del clip?

Es una deriva típica del modelo. Se corrige añadiendo al negativo términos como clothes changing color, lighting change, exposure change y brightness change.

¿Cuánto vídeo puedo generar de una vez?

Clips de unos cinco segundos a 24 fotogramas por segundo. Más allá, la coherencia se degrada. Para secuencias largas se generan varias tomas cortas y se montan después.

Veredicto Arkaia

Wan 2.2 es el modelo de vídeo abierto que hay que usar hoy si quieres generar en local. La licencia Apache 2.0 lo hace utilizable de verdad en trabajo comercial y la calidad en clips cortos está a un nivel que hace un año exigía suscripción mensual.

Nuestro consejo Arkaia

Si tienes 16 GB de VRAM o más, monta el flujo de 14B con los LoRA Lightning y encola las tomas en lotes: es donde está el salto de calidad y de productividad. Si tienes menos, quédate en la variante de 5B sin complejos. Y dedica la primera tarde al prompt negativo antes que a cualquier otro ajuste: ahí está el 80 % de la diferencia entre un clip que sirve y uno que se tira.

Lecturas relacionadas

Este artículo contiene enlaces afiliados a Amazon con el tag arkaiacorp-21. Si compras a través de estos enlaces, Arkaia puede recibir una comisión sin coste adicional para ti. Nuestra valoración editorial es independiente y no varía según los ingresos por afiliación.

Compartir:

Comentarios

Cargando comentarios...