El orden de reproducción funciona mejor que una nube de palabras clave
Si el modelo debe elegir entre cinco estilos visuales y tres movimientos de cámara, el plano suele perder claridad. Ordena las decisiones según lo que el público verá realmente.
Un buen prompt para MiniMax H3 es más que un moodboard. Define para cada plano un sujeto claro, un entorno comprensible, un movimiento controlado, la trayectoria de cámara, una intención sonora opcional y un final. Después, elimina todo lo que distraiga de la acción principal.
Ordena las decisiones según la secuencia de reproducción. Un movimiento dominante y una trayectoria de cámara clara suelen comunicar más que numerosas instrucciones contradictorias.
MiniMax H3 puede crear una escena completa, animar un fotograma fijo, unir imágenes de inicio y fin o seguir referencias omni. La forma más fiable de controlar estas posibilidades es una indicación de producción breve y ordenada según la reproducción: escena, sujeto, acción, cámara, intención sonora y final.
Si el modelo debe elegir entre cinco estilos visuales y tres movimientos de cámara, el plano suele perder claridad. Ordena las decisiones según lo que el público verá realmente.
Con solo texto, H3 crea el mundo completo. Con un primer fotograma, pone en movimiento un mundo ya definido. Con referencias, conserva características concretas. Escribe el prompt para la tarea elegida.
El contenido puede parecer similar, pero cada modo tiene una función distinta. Elige el modo antes de pulir el texto.
Úsala cuando MiniMax H3 deba crear a partir del texto el sujeto, el entorno y la composición inicial. El campo ratio es obligatorio en el modo de solo texto.
[Intención de duración y proporción]. [Sujeto y apariencia definitoria] en [escena específica y momento]. [Acción principal o cambio a lo largo del clip]. [Recorrido de cámara y evolución del encuadre]. [Iluminación, paleta, material, atmósfera]. [Diálogo opcional o intención de sonido]. Termina en [composición final o momento emocional].Úsala cuando el primer fotograma ya establece identidad, composición y estética inicial.
[Sujeto principal visible en la imagen] [realiza una acción clara]. [Entorno o elementos secundarios cambian]. [Recorrido de cámara] preservando la apariencia definitoria del sujeto y el estilo visual original. Sonido opcional: [indicación de voz/ambiente]. Termina con [pose final o encuadre].Describe cómo la primera imagen controlada evoluciona hacia la última, en lugar de redescribir ambos fotogramas por separado.
Desde el primer fotograma, [acción del sujeto y transición ambiental]. [Movimiento de cámara y timing]. Preserva [restricciones de identidad, objeto o estilo] mientras la composición evoluciona naturalmente hacia el fotograma final proporcionado.Asigna una función a cada referencia antes de añadir más adjetivos de estilo. No mezcles roles de referencia con los roles de primer/último fotograma.
Usa imagen(es) de referencia para [personaje / producto / estilo]. Usa vídeo de referencia para [movimiento / cámara / ritmo]. Usa audio de referencia para [timbre de voz / entonación] si se proporciona. Crea un plano de [duración] en [escena]. Acción del sujeto: [una acción legible]. Cámara: [recorrido]. Mantén la identidad referenciada consistente. Termina en [momento final].Añade detalles solo cuando mejoren el control. Cada adjetivo adicional compite por atención con el movimiento.
Nombra a la persona, producto, criatura o forma principal. Añade detalles de apariencia solo cuando afecten al reconocimiento.
Sitúa el sujeto en un entorno concreto: calle nocturna, estudio, límite del bosque, interior de puente, mundo estilizado.
Describe la acción y cómo evoluciona la escena. El vídeo necesita un cambio en el tiempo, no una lista de etiquetas visuales estáticas.
Elige encuadre y trayectoria: estático, travelling, acercamiento, alejamiento, elevación, panorámica, órbita, o una combinación contenida en secuencia.
Si importa el diálogo, el ambiente o la referencia de voz, indícalo. Empareja referencias de audio con medios visuales en modo r2va.
Indica cómo debe terminar el plano: con una expresión en primer plano, una revelación amplia, un giro completo o un fotograma estático del producto.
MiniMax H3 acepta valores enteros de 4 a 15 segundos. Una presentación de producto de cinco segundos y una escena de personaje de doce requieren distinta densidad de acción. No intentes condensar una historia de tres actos en un clip corto.
Las palabras pueden parecer similares, pero la tarea de MiniMax H3 cambia según los roles multimedia que incluyas.
Dedica los tokens a la apariencia, el entorno y la composición inicial. En la generación solo con texto, ratio no puede tener el valor adaptive.
No redescribas cada píxel. Dirige el movimiento, la cámara, el cambio de luz y lo que debe mantenerse consistente.
Escribe la lógica de transición: qué se mueve, qué se transforma, qué hace la cámara entre los extremos proporcionados.
Indica qué recurso controla el rostro, el vestuario, el movimiento, el lenguaje de cámara o la voz. No uses roles de primer/último fotograma en la misma solicitud.
Subir los materiales no basta. El prompt debe asignar una función concreta a cada referencia.
Dilo explícitamente cuando varias imágenes puedan competir.
Mantén los clips de referencia cortos y enfocados: los límites documentados son de 2–15s por clip.
El audio no puede usarse solo; combínalo con referencias de imagen o vídeo.
Si es así, divide el proceso en dos tareas. En la interfaz pública, esos modos son incompatibles.
Elimina primero los adjetivos prescindibles antes de descartar referencias.
Si no, el movimiento suele perder el rumbo en lugar de terminar de forma clara.
Las referencias temporales ayudan a MiniMax H3 a entender las prioridades. Úsalas para organizar el plano, no para controlar al detalle cada fotograma.
En el primer segundo, deja claro a quién vemos y dónde estamos. Evita empezar en pleno caos, salvo que el primer fotograma ya permita entender la escena.
Ventana central: el movimiento que justifica generar vídeo en lugar de una imagen fija.
Si necesitas dos ideas de cámara, secuéncialas: travelling y luego acercamiento, en lugar de apilarlas como prioridades iguales.
Termina, por ejemplo, con una expresión sostenida, un producto inmóvil, una revelación amplia o un gesto completo.
Estos ejemplos originales muestran distintas estructuras. Sustituye el sujeto y el escenario sin alterar la jerarquía de las indicaciones.
Una acción principal, una trayectoria de cámara y un cierre emocional.
Crea un plano cinematográfico nocturno de 8 segundos en 16:9. Un mensajero con chaleco reflectante circula por un cruce urbano iluminado por la lluvia. El agua salpica de los neumáticos mientras los reflejos de neón se estiran por la carretera. La cámara sigue junto a la bicicleta y luego cierra suavemente sobre la expresión concentrada del mensajero. Prácticas azul frío con acentos magenta contenidos, realismo de superficie mojada. Suave silbido de neumáticos y tráfico distante. Termina en un primer plano tres cuartos legible del rostro.Deja que el primer fotograma defina el diseño del producto mientras el prompt controla la luz y el movimiento de cámara.
El reloj permanece centrado mientras una banda estrecha de luz cálida recorre la caja de metal cepillado. Una fina niebla se mueve lentamente detrás del producto. La cámara desplaza ligeramente a la derecha preservando la geometría del reloj y la superficie de mármol oscuro. Sin rediseñar la esfera. Termina en un ángulo tres cuartos limpio del producto con la esfera completamente legible.Describe la evolución entre dos composiciones controladas.
Desde el primer fotograma, la modelo camina hacia adelante mientras las softboxes de estudio se disuelven en prácticas de calle lluviosa. El movimiento de la tela permanece natural y la identidad se mantiene consistente. La cámara se aleja lentamente mientras el entorno completa la transición hacia el fotograma final proporcionado. Termina exactamente en esa última composición con la postura asentada.Asigna una función a las referencias antes de añadir más adjetivos de estilo.
Usa imágenes de referencia para el rostro y el vestuario del personaje. Usa vídeo de referencia para el ritmo de caminar relajado. Usa audio de referencia para el timbre de voz cálido y medio. Crea un plano medio de 10 segundos en un paseo marítimo ventoso a la hora dorada. El personaje camina hacia cámara, sonríe una vez y dice una línea corta de espíritu libre. La cámara retrocede suavemente. Mantén la identidad y el vestuario consistentes. Termina en un plano medio cercano estable.La mayoría de los prompts poco eficaces para MiniMax H3 no necesitan más palabras, sino un sujeto, una acción, un modo o una prioridad de cámara más claros.
Reemplaza «cinematográfico, hermoso, 4K, dramático» por un sujeto realizando una acción visible dentro de una escena definida.
Si el primer fotograma ya existe, deja de reconstruir vestuario y fondo desde cero a menos que el cambio sea intencional.
Indica qué recurso controla el rostro, el movimiento o la voz. Las referencias sin una función asignada añaden ruido.
Elige un recorrido dominante. Si es necesario un segundo, colócalo después como secuencia.
Da al plano un único objetivo. Construye secuencias más largas a partir de varios clips generados.
Divide el proceso. En la interfaz pública de MiniMax-H3, esas familias de modos son incompatibles.
Lee el prompt una vez como director y otra como línea temporal.
Solo texto, primer fotograma, primer y último fotograma o referencia omni: elige un único modo.
Un espectador debería saber qué mirar antes de que la cámara empiece a moverse.
Nombra lugar, hora, clima o contexto de producción cuando cambie el resultado visual.
Describe una acción, transformación, expresión o evento ambiental a través del tiempo.
Secuencia movimientos secundarios; no apiles contradicciones.
Un final claro da un destino al movimiento y evita que pierda el rumbo.
Las indicaciones de cámara en lenguaje natural bastan para muchos planos de MiniMax H3. Cuando necesites precisión, usa pocos comandos y ordénalos de forma secuencial.
truck lefttruck rightMueve la cámara lateralmente sin cambiar la dirección de la mirada.
pan leftpan rightRota hacia la izquierda o derecha desde una posición relativamente fija.
push inpull outMuévete físicamente hacia o alejándote del sujeto.
riselowerEleva o baja la cámara sin forzar una inclinación.
tilt uptilt downRota la vista hacia arriba o hacia abajo.
tracking shotfollowMueve la cámara con el sujeto para que el entorno cambie sin perder la claridad del encuadre.
zoom inzoom outCambia la distancia focal aparente en lugar de desplazar la cámara por el espacio.
static shotlocked offMantén la cámara firme y deja que la interpretación lleve el clip.
subtle handheldrestrained shakeÚsalo con moderación para que el movimiento del sujeto permanezca legible.
La longitud no es un objetivo en sí misma. Describe con suficiente precisión el sujeto, el escenario, el movimiento, la trayectoria de cámara, la intención sonora opcional y el final. Después, elimina las instrucciones que compitan con la acción principal. El límite documentado es de 7.000 caracteres.
El primer fotograma ya establece sujeto, composición y estilo. Enfoca el prompt en el movimiento, el comportamiento de la cámara, el cambio ambiental y las características que deben mantenerse consistentes.
Asigna a cada referencia una función —rostro, vestuario, movimiento, ritmo de cámara o voz— antes de añadir adjetivos de estilo. Mantén el total de archivos dentro de los límites documentados y nunca mezcles roles de referencia con roles de primer/último fotograma.
Puedes indicar en el prompt cómo debe sonar la frase. El audio de referencia puede guiar el timbre cuando se combina con materiales visuales en el modo de referencia. Mantén el diálogo lo bastante breve para la duración elegida.
Consulta la guía de la API de MiniMax H3 de este sitio y la documentación oficial de MiniMax V2 para conocer los roles de content, duration, ratio y la gestión de estados.
Empieza con el modo, añade una decisión de cámara útil y compara el resultado antes de aumentar la complejidad.