Lista de referencia de modelos de IA (IMAGEN y VÍDEO) y sus guías oficiales de prompting

Última verificación: 4 de septiembre de 2026

Esta tabla recoge los modelos de IA de imagen y vídeo que hoy marcan el estado del arte, con su nombre coloquial, su nombre técnico y el enlace a la guía de prompting del fabricante. Solo enlazo guías oficiales. Cuando la compañía no publica ninguna, lo indico en vez de rellenar el hueco con un tutorial de terceros. Reviso la lista cada pocas semanas porque las versiones caducan rápido.

Imagen

Compañía Nombre coloquial Nombre técnico Guía oficial de prompting
OpenAI GPT Image gpt-image-2 («ChatGPT Images 2.0»), nº 1 en el arena de texto a imagen con 1.370 Elo; gpt-image-1.5 sigue en API developers.openai.com
Microsoft MAI-Image MAI-Image-2.6 (10-ago-2026): en MAI Playground y preview privada en Foundry, sin API pública ni precios. La familia 2.5 (base, Flash y Pro) sigue siendo la disponible de forma general Sin guía oficial
Google Nano Banana Gemini 3 Pro Image (Nano Banana Pro), Gemini 3.1 Flash Image (Nano Banana 2), Gemini 2.5 Flash Image cloud.google.com · deepmind.google
Reve AI Reve Reve 2.1 (4K nativo, maquetación editable), nº 3 en texto a imagen y nº 3 en edición Sin guía oficial
xAI (SpaceXAI) Grok Imagine grok-imagine-image-2.0 (Quality Mode desde el 7-ago-2026; edición por regiones, hasta 5 referencias, redimensionado inteligente). En app, web y API docs.x.ai
Black Forest Labs FLUX FLUX.2 (klein / dev / flex / pro / max), familia recomendada por BFL para imagen; FLUX 3 Image sigue sin salir del acceso anticipado docs.bfl.ml
Midjourney Midjourney V8.2 (por defecto desde el 24-jul-2026); V8.1 seleccionable; V8.0 retirado; Niji 7 para anime docs.midjourney.com
Ideogram Ideogram Ideogram 4 (con pesos abiertos) y P-Image-Ideogram (30-jul-2026, con Pruna AI): cuatro modos de calidad, 1K y 2K nativos, desde 0,003 $ por imagen docs.ideogram.ai
ByteDance Seedream Seedream 5.0 Pro y 5.0 Lite; 4.5 sigue disponible docs.byteplus.com · guía de prompting
Alibaba Qwen Image Qwen-Image-3.0 Pro y Standard (general desde el 5-ago-2026; prompts de 4.500 tokens, texto legible a ~10 px, 12 idiomas) alibabacloud.com
Recraft Recraft Recraft V4.1 (+ Pro, Utility y Vector) recraft.ai
Meta Muse Image Muse Image (Meta Superintelligence Labs); en Meta AI, WhatsApp e Instagram, sin API pública Sin guía oficial

Vídeo

Compañía Nombre coloquial Nombre técnico Guía oficial de prompting
Google Gemini Omni Gemini Omni 1.1 Flash (gemini-omni-1.1-flash), general desde el 27-ago-2026: extensión de escena con 10 s de contexto hasta 40 s acumulados, primer y último fotograma, referencias de vídeo de 3 s, borradores a 360p y subida a 4K. El endpoint de preview se retira el 30-sep-2026 deepmind.google
Google Veo Veo 3.1 (+ Fast y Lite). Google lo reserva ya para audio nativo de diálogo, flujos antiguos y casos que Omni no cubre deepmind.google · cloud.google.com
Alibaba Wan Wan 3.0 (wan3.0-video), general desde el 24-ago-2026: 30 s de una pasada a 30 fps, referencias doc/xls/ppt/pdf y páginas web, hasta 1080p. Nº 1 en texto a vídeo con audio (1.242 Elo) alibabacloud.com
MiniMax Hailuo MiniMax H3 (alias Hailuo 3.0; 2K nativo, audio estéreo nativo, edición por instrucción). Pesos abiertos desde el 3-ago-2026; fal publica una variante post-entrenada, H3 Max platform.minimax.io · GitHub
ByteDance Seedance Seedance 2.5 (API pública desde el 7-ago-2026; 30 s de una pasada, hasta 50 referencias, audio nativo, tope 720p); Seedance 2.0 mantiene 4K nativo y sigue líder en imagen a vídeo con audio docs.byteplus.com
Kuaishou Kling Kling VIDEO 3.0 y VIDEO 3.0 Omni (+ Turbo); IMAGE 3.0 e IMAGE 3.0 Omni para imagen; 4K nativo desde abr-2026 y audio nativo en 5 idiomas kling.ai
LTX (Lightricks) LTX LTX-2.5 (11-ago-2026): 22B con pesos abiertos en Hugging Face, multitoma nativa, 4K HDR y codificador de texto Gemma 4 12B; LTX-2.3 pasa a legacy ltx.io
Black Forest Labs FLUX 3 Video FLUX 3 Video (desde el 4-ago-2026, en preview): hasta 20 s con audio nativo a 1920×1088 y 24 fps y modo Draft; la continuación de vídeo bajó a 15 s el 17-ago y el 20-ago se sumó FLUX Video Upscale hasta 4K docs.bfl.ml
Alibaba (ATH / Taotian) HappyHorse HappyHorse-1.1 (T2V, I2V, edición y R2V); 1.0 sigue disponible Sin guía oficial
Runway Runway Gen-4.5 (+ Gen-4 Turbo y Aleph 2.0, aleph2). El 30-jul-2026 la API retiró Gen-4 Aleph y Gen-3 Alpha Turbo help.runwayml.com
xAI (SpaceXAI) Grok Imagine grok-imagine-video-1.5 (480p/720p/1080p, hasta 15 s, extensión y edición de vídeo) docs.x.ai
Luma Ray Ray3.2 y Ray3.2 Edit (HDR nativo 16 bits, export EXR, hasta 16 keyframes, 20 s a 1080p) lumalabs.ai
OpenAI Sora Sora 2 (sora-2, sora-2-pro) — en retirada: la API se apaga el 24-sep-2026, sin sucesor anunciado developers.openai.com

Cambios desde la revisión del 1 de septiembre de 2026: Gemini Omni pasa a la versión 1.1 Flash y a disponibilidad general, con extensión de escena hasta 40 segundos, control de primer y último fotograma, referencias de vídeo y salida hasta 4K; el endpoint antiguo de preview se retira el 30 de septiembre. Sora 2 entra en su recta final: la API se apaga el 24 de septiembre. Sin altas ni bajas de fabricante. FLUX 3 Image, Kling 4.0 y Muse Video siguen fuera de la tabla por falta de acceso público. Los lanzamientos de esta semana de OpenAI, Meta y Google (GPT-6 Astra, Muse Spark 1.3 y Gemini 3.8 Flash) son modelos de lenguaje y quedan fuera del ámbito de esta lista.