Wan 3.0, el nuevo generador de video con inteligencia artificial de Alibaba, permite combinar hasta 20 referencias en un mismo proyecto: imágenes, videos, audios, documentos e incluso páginas web. La herramienta promete conservar con mayor precisión los detalles de esos materiales durante la generación.
Además, genera audio inmersivo con música y efectos de sonido de forma integrada, y produce clips de hasta 30 segundos. Su presentación suma otro competidor en la carrera por la creación de contenidos audiovisuales con IA, donde modelos como Sora, Veo y Seedance también compiten por mayor duración y calidad.
Anunciado el 6 de agosto de 2026 como public beta, Wan 3.0 unifica en un solo modelo capacidades que Wan 2.7 requería de cuatro modelos separados. Adicionalmente, es la primera vez que un modelo de video acepta documentos de oficina (PDF, DOC, XLS, PPT) como input nativo, permitiendo transformar presentaciones y reportes directamente en videos.
A diferencia de Wan 2.1 y 2.2 (open source bajo Apache 2.0), Wan 3.0 es API-only, sin pesos públicos. La resolución máxima confirmada es 1080p (los rumores de 4K se descartaron oficialmente), y el costo ronda los $0.05 a $0.20 por segundo, lo que implica aproximadamente $6 por un clip de 30 segundos. El acceso está limitado a cuentas invitadas en Alibaba Cloud Model Studio; la región de Beijing ofrece precios un 20% más económicos que Singapore.
Fuentes: