- Type
- IA générative
- Année
- 2026
- Rôle
- Conception du pipeline, direction globale
- Outils
- ComfyUI, Flux.2 Klein, LTX 2.3, Qwen, Gemma 3, ElevenLabs, Suno, DaVinci Resolve
Le projet
Réalisation d’une bande-annonce cinématographique grâce à un pipeline entièrement automatisé sous ComfyUI. L’objectif : un système capable de générer des centaines de séquences cohérentes, de la pré-production au rendu final.
Points clés
- ScalabilitéL’automatisation permet de produire un volume massif de plans.
- Fidélité techniqueUn workflow aux standards de l’industrie cinématographique (ACEScg).
- Direction globaleSupervision de chaque étape, du prompt engineering à l’assemblage final.
Du prompt au master EXR
Génération automatique des prompts
Pour produire en masse, il faut supprimer la saisie manuelle tout en gardant une cohérence narrative et visuelle entre des centaines de plans. J’ai conçu un système d’agents LLM interconnectés dans ComfyUI.
- Gemma 3, le scénariste : il reçoit les instructions globales (script, ambiance, enjeux) et décline les séquences en actions logiques.
- Qwen 2.5 VL, l’expert visuel : il traduit les intentions narratives en descriptions techniques optimisées pour les modèles d’images, en intégrant les références du personnage.

Boucle de génération
Le système puise dans une base de character sheets générées au préalable et reçoit une variable de situation : un personnage qui court dans une forêt la nuit, par exemple. Il produit alors un bloc structuré : sujet et attributs fixes, action, environnement, lumière et caméra.

Cohérence du personnage et caméra virtuelle
Une instruction de fixation est injectée automatiquement dans chaque prompt, pour forcer l’encodeur à privilégier les traits physiques des images de référence.
Le Radiance Cinematic Encoder joue ensuite le rôle d’un directeur de la photographie virtuel : il verrouille l’angle de caméra, la focale, le style visuel et l’éclairage.
Format et génération de l’image
Le format retenu est l’anamorphique 2.39:1 plutôt que le 16:9. Le nœud de résolution calcule la taille optimale (2048 × 856, par exemple) pour exploiter au mieux le modèle.
Flux.2 Klein reçoit les prompts, une double référence du personnage et le Normalized Attention Guidance, qui affine les visages, les mains et les textures.

Gestion de la couleur
Un pipeline OCIO complet dans ComfyUI : décodage VAE 32-bit en tuiles pour préserver les basses et les hautes lumières, travail en ACEScg, et un Display Transform (Rec.709 ou sRGB) pour juger l’image pendant la génération.
L’export en EXR 32-bit conserve toute la latitude d’étalonnage dans DaVinci Resolve.

De l’image à la vidéo
Qwen analyse l’image générée, en déduit une action pertinente et rédige le prompt vidéo : dynamique des fluides et des particules, micro-mouvements, travelling ou zoom lent.
LTX 2.3 anime ensuite le plan en image-to-video, en 2048 × 832 et à 24 images par seconde, avec la first frame comme ancrage.

Export master et proxy
Chaque plan sort en deux versions : un master en séquence EXR 32-bit float, verrouillé en ACEScg, et un proxy MP4 H.264 pour valider le mouvement et le rythme, puis servir de référence au montage.

Détails des nœuds



