L'ordre de lecture l'emporte sur les nuages de mots-clés
Si le modèle doit choisir entre cinq esthétiques et trois mouvements de caméra, le plan s'effondre généralement. Séquencez les décisions que le spectateur verra réellement.
Un prompt MiniMax H3 efficace va au-delà d'un mood board. Donnez à un plan un sujet clair, un décor lisible, un mouvement contrôlé, un parcours de caméra, une intention sonore optionnelle et une fin — puis supprimez tout ce qui concurrence l'action principale.
Rédigez les décisions dans l'ordre de lecture. Un mouvement dominant et un parcours de caméra clair communiquent généralement mieux qu'une pile d'instructions contradictoires.
MiniMax H3 peut inventer une scène complète, animer une image figée, relier deux images ou suivre des références omnimodales. La manière la plus sûre de guider ce mélange est un brief de production court dans l'ordre de lecture : décor, sujet, action, caméra, intention sonore, fin.
Si le modèle doit choisir entre cinq esthétiques et trois mouvements de caméra, le plan s'effondre généralement. Séquencez les décisions que le spectateur verra réellement.
Le texte seul demande à H3 d'inventer le monde. La première image lui demande d'animer un monde connu. Le mode référence lui demande d'hériter de signaux. Rédigez pour la tâche que vous avez sélectionnée.
Le contenu peut sembler similaire, mais la tâche est différente. Choisissez le mode avant de peaufiner le langage.
À utiliser quand MiniMax H3 doit inventer le sujet, l'environnement et la composition d'ouverture depuis le texte. Le ratio est requis en mode texte pur.
[Durée et intention de format]. [Sujet et apparence caractéristique] dans [scène spécifique et moment]. [Action principale ou évolution sur le clip]. [Parcours de caméra et évolution du cadrage]. [Éclairage, palette, matière, atmosphère]. [Dialogue optionnel ou intention sonore]. Se terminer sur [composition finale ou moment émotionnel].À utiliser quand la première image établit déjà l'identité, la composition et l'esthétique initiale.
Le [sujet principal visible dans l'image] [effectue une action claire]. [L'environnement ou les éléments secondaires évoluent]. [Parcours de caméra] tout en préservant l'apparence caractéristique du sujet et le style visuel original. Son optionnel : [indication voix/ambiance]. Se terminer avec [pose finale ou cadrage].Décrivez comment la première image contrôlée évolue vers la dernière plutôt que de redécrire les deux images isolément.
En partant de la première image, [action du sujet et transition environnementale]. [Mouvement de caméra et timing]. Préserver [contraintes d'identité, d'objet ou de style] tandis que la composition évolue naturellement vers la dernière image fournie.Mappez chaque référence avant de répéter les adjectifs de style. Ne mélangez pas les rôles de référence avec les rôles de première/dernière image.
Utiliser les images de référence pour [personnage / produit / style]. Utiliser la vidéo de référence pour [mouvement / caméra / rythme]. Utiliser l'audio de référence pour [timbre de voix / débit] si fourni. Créer un plan de [durée] dans [scène]. Action du sujet : [une action lisible]. Caméra : [parcours]. Maintenir l'identité référencée cohérente. Se terminer sur [moment final].Ajoutez du détail uniquement quand il rapporte du contrôle. Les adjectifs supplémentaires ne sont pas gratuits — ils concurrencent le mouvement.
Nommez la personne, le produit, la créature ou la forme principale. Ajoutez des détails d'apparence uniquement quand ils affectent la reconnaissance.
Placez le sujet dans un environnement concret : rue nocturne, studio, lisière de forêt, intérieur de pont, monde stylisé.
Décrivez l'action et comment la scène évolue. La vidéo a besoin d'un changement dans le temps, pas d'une liste de tags visuels statiques.
Choisissez le cadrage et le déplacement : statique, travelling, avancée, recul, élévation, panoramique, orbite, ou une combinaison maîtrisée en séquence.
Si le dialogue, l'ambiance ou la référence vocale comptent, énoncez-le. Associez les références audio aux médias visuels en mode r2va.
Indiquez où le plan doit se stabiliser : un gros plan expressif, une révélation large, un tour accompli, ou un plan produit figé.
MiniMax H3 accepte 4–15 secondes entières. Une révélation produit de cinq secondes et un moment personnage de douze secondes nécessitent des densités d'action différentes. Ne compressez pas une histoire en trois actes dans un seul court clip.
Les mots peuvent sembler similaires, mais la tâche de MiniMax H3 change selon les rôles média que vous attachez.
Dépensez les tokens sur l'apparence, l'environnement et la composition d'ouverture. Le ratio ne peut pas être laissé adaptatif en génération texte pur.
Ne redécrivez pas chaque pixel. Dirigez le mouvement, la caméra, le changement de lumière et ce qui doit rester cohérent.
Rédigez la logique de transition : ce qui bouge, ce qui se transforme, ce que fait la caméra entre les extrémités fournies.
Mappez quel contrôle le visage, la garde-robe, le mouvement, le langage caméra ou la voix. Évitez les rôles de première/dernière image dans la même requête.
Uploader des médias ne suffit pas. Le prompt doit assigner à chaque référence une tâche.
Dites-le explicitement quand plusieurs images pourraient concourir.
Gardez les clips de référence courts et ciblés — les limites documentées sont de 2–15s par clip.
L'audio ne peut pas voyager seul ; associez-le à des références image ou vidéo.
Si oui, séparez en deux tâches. Le contrat public traite ces modes comme mutuellement exclusifs.
Élaguiez les adjectifs à faible valeur avant d'élaguer la carte de référence.
Sinon, le mouvement dérive souvent au lieu de se résoudre.
Les mots temporels aident MiniMax H3 à comprendre la priorité. Utilisez-les pour mettre en scène le plan, pas pour micromanager chaque image.
Première seconde : qui nous regardons et où nous sommes. Évitez de commencer en plein chaos sauf si la première image tient déjà la lecture.
Fenêtre centrale : le mouvement qui justifie de générer de la vidéo plutôt qu'une image fixe.
Si vous avez besoin de deux idées de caméra, séquencez-les — travelling puis avancée — plutôt que de les empiler comme priorités égales.
Moment final : expression figée, produit immobile, révélation large, ou geste accompli.
Ce sont des exemples structurels nouvellement rédigés. Échangez le sujet et le décor tout en préservant la hiérarchie.
Une action de sujet, un parcours de caméra et un moment émotionnel final.
Créez un plan cinématographique nocturne de 8 secondes en 16:9. Un coursier en veste réfléchissante traverse une intersection urbaine sous la pluie. L'eau jaillit des pneus tandis que les reflets néon s'étirent sur la route. La caméra suit à hauteur du vélo, puis se rapproche doucement de l'expression concentrée du coursier. Éclairages pratiques bleus froids avec accents magenta maîtrisés, réalisme de surface mouillée. Bruissement doux des pneus et trafic lointain. Se terminer sur un gros plan trois-quarts lisible du visage.Laissez la première image détenir le design du produit tandis que le prompt dirige la lumière et le mouvement de caméra.
La montre reste centrée tandis qu'une bande étroite de lumière chaude traverse le boîtier en métal brossé. Une brume fine se déplace lentement derrière le produit. La caméra travaille légèrement vers la droite tout en préservant la géométrie de la montre et la surface de marbre sombre. Pas de redesign du cadran. Se terminer sur un angle trois-quarts produit propre avec le cadran pleinement lisible.Décrivez l'évolution entre deux compositions contrôlées.
En partant de la première image, le mannequin avance tandis que les softbox studio se dissolvent en éclairages pratiques de rue pluvieuse. Le mouvement du tissu reste naturel et l'identité reste cohérente. La caméra recule lentement tandis que l'environnement achève la transition vers la dernière image fournie. Se terminer exactement sur cette dernière composition avec une posture figée.Mappez les références avant de répéter les adjectifs de style.
Utiliser les images de référence pour le visage et la garde-robe du personnage. Utiliser la vidéo de référence pour un rythme de marche décontracté. Utiliser l'audio de référence pour un timbre de voix chaud et médium. Créer un plan moyen de 10 secondes sur une promenade côtière venteuse à l'heure dorée. Le personnage marche vers la caméra, sourit une fois et dit une courte ligne espiègle. La caméra recule en douceur. Maintenir l'identité et la garde-robe cohérentes. Se terminer sur un plan moyen serré stable.La plupart des prompts MiniMax H3 faibles n'ont pas besoin de plus de mots. Ils ont besoin d'un sujet, d'une action, d'un mode ou d'une priorité caméra plus clairs.
Remplacez « cinématographique, magnifique, 4K, dramatique » par un sujet effectuant une action visible dans une scène définie.
Si la première image existe déjà, cessez de reconstruire la garde-robe et l'arrière-plan à partir de zéro sauf si le changement est intentionnel.
Mappez quel contrôle le visage, le mouvement ou la voix. Les références non mappées deviennent du bruit.
Choisissez un parcours dominant. Si un second est nécessaire, placez-le plus tard comme séquence.
Donnez au plan une seule tâche. Construisez des séquences plus longues à partir de plusieurs clips générés.
Séparez le travail. Le contrat public MiniMax-H3 traite ces familles de modes comme mutuellement exclusives.
Lisez le prompt une fois comme réalisateur et une fois comme ligne temporelle.
Texte seul, première image, première+dernière, ou référence omnimodale — choisissez un contrat.
Un spectateur devrait savoir quoi regarder avant que la caméra ne commence à bouger.
Nommez le lieu, l'heure, la météo ou le contexte de production quand cela change le résultat visuel.
Décrivez une action, une transformation, une expression ou un événement environnemental à travers le temps.
Séquencez les mouvements secondaires ; n'empilez pas les contradictions.
Un dernier moment clair aide le mouvement à se résoudre au lieu de dériver.
La direction caméra en langage naturel suffit pour de nombreux plans MiniMax H3. Quand la précision compte, gardez les commandes épurées et séquentielles.
truck lefttruck rightDéplacez la caméra latéralement tout en préservant la direction de regard.
pan leftpan rightTournez vers la gauche ou la droite depuis une position relativement fixe.
push inpull outDéplacez-vous physiquement vers ou à l'écart du sujet.
riselowerÉlevez ou abaissez la caméra sans forcer une inclinaison.
tilt uptilt downTournez la vue vers le haut ou vers le bas.
tracking shotfollowDéplacez-vous avec le sujet pour que l'environnement change tandis que le cadrage reste lisible.
zoom inzoom outChangez la focale apparente plutôt que de traverser l'espace.
static shotlocked offTenez la caméra stable et laissez l'interprétation porter le clip.
subtle handheldrestrained shakeUtilisez avec parcimonie pour que le mouvement du sujet reste lisible.
La longueur n'est pas l'objectif. Utilisez assez de détails pour identifier le sujet, le décor, le mouvement, le parcours de caméra, l'intention sonore optionnelle et la fin — puis supprimez les instructions qui concurrencent l'action principale. La limite documentée est de 7 000 caractères.
La première image établit déjà le sujet, la composition et le style. Concentrez le prompt sur le mouvement, le comportement de la caméra, le changement environnemental et les caractéristiques qui doivent rester cohérentes.
Mappez chaque référence à une tâche — visage, garde-robe, mouvement, rythme caméra ou voix — avant d'ajouter des adjectifs de style. Gardez les médias totaux dans les limites documentées et ne mélangez jamais les rôles de référence avec les rôles de première/dernière image.
Vous pouvez énoncer l'intention parlée dans le prompt, et l'audio de référence peut guider le timbre quand associé à des médias visuels en mode référence. Gardez la parole assez courte pour la durée choisie.
Utilisez le guide API MiniMax H3 sur ce site et la documentation officielle V2 de MiniMax pour les rôles de contenu, la durée, le ratio et la gestion du statut.
Commencez par le mode, ajoutez une décision caméra utile, et comparez le résultat avant d'augmenter la complexité.