Última verificación: 4 de septiembre de 2026
Esta tabla recoge los modelos de IA de imagen y vídeo que hoy marcan el estado del arte, con su nombre coloquial, su nombre técnico y el enlace a la guía de prompting del fabricante. Solo enlazo guías oficiales. Cuando la compañía no publica ninguna, lo indico en vez de rellenar el hueco con un tutorial de terceros. Reviso la lista cada pocas semanas porque las versiones caducan rápido.
Imagen
| Compañía | Nombre coloquial | Nombre técnico | Guía oficial de prompting |
|---|---|---|---|
| OpenAI | GPT Image | gpt-image-2 («ChatGPT Images 2.0»), nº 1 en el arena de texto a imagen con 1.370 Elo; gpt-image-1.5 sigue en API | developers.openai.com |
| Microsoft | MAI-Image | MAI-Image-2.6 (10-ago-2026): en MAI Playground y preview privada en Foundry, sin API pública ni precios. La familia 2.5 (base, Flash y Pro) sigue siendo la disponible de forma general | Sin guía oficial |
| Nano Banana | Gemini 3 Pro Image (Nano Banana Pro), Gemini 3.1 Flash Image (Nano Banana 2), Gemini 2.5 Flash Image | cloud.google.com · deepmind.google | |
| Reve AI | Reve | Reve 2.1 (4K nativo, maquetación editable), nº 3 en texto a imagen y nº 3 en edición | Sin guía oficial |
| xAI (SpaceXAI) | Grok Imagine | grok-imagine-image-2.0 (Quality Mode desde el 7-ago-2026; edición por regiones, hasta 5 referencias, redimensionado inteligente). En app, web y API | docs.x.ai |
| Black Forest Labs | FLUX | FLUX.2 (klein / dev / flex / pro / max), familia recomendada por BFL para imagen; FLUX 3 Image sigue sin salir del acceso anticipado | docs.bfl.ml |
| Midjourney | Midjourney | V8.2 (por defecto desde el 24-jul-2026); V8.1 seleccionable; V8.0 retirado; Niji 7 para anime | docs.midjourney.com |
| Ideogram | Ideogram | Ideogram 4 (con pesos abiertos) y P-Image-Ideogram (30-jul-2026, con Pruna AI): cuatro modos de calidad, 1K y 2K nativos, desde 0,003 $ por imagen | docs.ideogram.ai |
| ByteDance | Seedream | Seedream 5.0 Pro y 5.0 Lite; 4.5 sigue disponible | docs.byteplus.com · guía de prompting |
| Alibaba | Qwen Image | Qwen-Image-3.0 Pro y Standard (general desde el 5-ago-2026; prompts de 4.500 tokens, texto legible a ~10 px, 12 idiomas) | alibabacloud.com |
| Recraft | Recraft | Recraft V4.1 (+ Pro, Utility y Vector) | recraft.ai |
| Meta | Muse Image | Muse Image (Meta Superintelligence Labs); en Meta AI, WhatsApp e Instagram, sin API pública | Sin guía oficial |
Vídeo
| Compañía | Nombre coloquial | Nombre técnico | Guía oficial de prompting |
|---|---|---|---|
| Gemini Omni | Gemini Omni 1.1 Flash (gemini-omni-1.1-flash), general desde el 27-ago-2026: extensión de escena con 10 s de contexto hasta 40 s acumulados, primer y último fotograma, referencias de vídeo de 3 s, borradores a 360p y subida a 4K. El endpoint de preview se retira el 30-sep-2026 |
deepmind.google | |
| Veo | Veo 3.1 (+ Fast y Lite). Google lo reserva ya para audio nativo de diálogo, flujos antiguos y casos que Omni no cubre | deepmind.google · cloud.google.com | |
| Alibaba | Wan | Wan 3.0 (wan3.0-video), general desde el 24-ago-2026: 30 s de una pasada a 30 fps, referencias doc/xls/ppt/pdf y páginas web, hasta 1080p. Nº 1 en texto a vídeo con audio (1.242 Elo) | alibabacloud.com |
| MiniMax | Hailuo | MiniMax H3 (alias Hailuo 3.0; 2K nativo, audio estéreo nativo, edición por instrucción). Pesos abiertos desde el 3-ago-2026; fal publica una variante post-entrenada, H3 Max | platform.minimax.io · GitHub |
| ByteDance | Seedance | Seedance 2.5 (API pública desde el 7-ago-2026; 30 s de una pasada, hasta 50 referencias, audio nativo, tope 720p); Seedance 2.0 mantiene 4K nativo y sigue líder en imagen a vídeo con audio | docs.byteplus.com |
| Kuaishou | Kling | Kling VIDEO 3.0 y VIDEO 3.0 Omni (+ Turbo); IMAGE 3.0 e IMAGE 3.0 Omni para imagen; 4K nativo desde abr-2026 y audio nativo en 5 idiomas | kling.ai |
| LTX (Lightricks) | LTX | LTX-2.5 (11-ago-2026): 22B con pesos abiertos en Hugging Face, multitoma nativa, 4K HDR y codificador de texto Gemma 4 12B; LTX-2.3 pasa a legacy | ltx.io |
| Black Forest Labs | FLUX 3 Video | FLUX 3 Video (desde el 4-ago-2026, en preview): hasta 20 s con audio nativo a 1920×1088 y 24 fps y modo Draft; la continuación de vídeo bajó a 15 s el 17-ago y el 20-ago se sumó FLUX Video Upscale hasta 4K | docs.bfl.ml |
| Alibaba (ATH / Taotian) | HappyHorse | HappyHorse-1.1 (T2V, I2V, edición y R2V); 1.0 sigue disponible | Sin guía oficial |
| Runway | Runway | Gen-4.5 (+ Gen-4 Turbo y Aleph 2.0, aleph2). El 30-jul-2026 la API retiró Gen-4 Aleph y Gen-3 Alpha Turbo |
help.runwayml.com |
| xAI (SpaceXAI) | Grok Imagine | grok-imagine-video-1.5 (480p/720p/1080p, hasta 15 s, extensión y edición de vídeo) | docs.x.ai |
| Luma | Ray | Ray3.2 y Ray3.2 Edit (HDR nativo 16 bits, export EXR, hasta 16 keyframes, 20 s a 1080p) | lumalabs.ai |
| OpenAI | Sora | Sora 2 (sora-2, sora-2-pro) — en retirada: la API se apaga el 24-sep-2026, sin sucesor anunciado | developers.openai.com |
Cambios desde la revisión del 1 de septiembre de 2026: Gemini Omni pasa a la versión 1.1 Flash y a disponibilidad general, con extensión de escena hasta 40 segundos, control de primer y último fotograma, referencias de vídeo y salida hasta 4K; el endpoint antiguo de preview se retira el 30 de septiembre. Sora 2 entra en su recta final: la API se apaga el 24 de septiembre. Sin altas ni bajas de fabricante. FLUX 3 Image, Kling 4.0 y Muse Video siguen fuera de la tabla por falta de acceso público. Los lanzamientos de esta semana de OpenAI, Meta y Google (GPT-6 Astra, Muse Spark 1.3 y Gemini 3.8 Flash) son modelos de lenguaje y quedan fuera del ámbito de esta lista.
