Ce workflow vous apprend à guider Stable Diffusion 3.5 avec une carte de profondeur afin que vos générations respectent la structure et la perspective d’une image de référence. Il charge le checkpoint SD 3.5 Large (sd3.5_large_fp8_scaled.safetensors) avec CheckpointLoaderSimple et un VAE de haute qualité (vae-ft-mse-840000-ema-pruned.safetensors). Votre prompt textuel est encodé par CLIPTextEncode, et KSampler gère la diffusion sur une toile latente définie par EmptySD3LatentImage, ce qui permet de définir une taille de sortie précise. VAEDecode, PreviewImage et SaveImage complètent la boucle pour inspecter et exporter les résultats.
Le guidage par profondeur est assuré via ControlNet. ControlNetLoader charge sd3.5_large_controlnet_depth.safetensors et ControlNetApplyAdvanced attache la condition de profondeur à votre prompt avec une force et des pourcentages de début/fin ajustables. L’image de référence est importée via LoadImage, éventuellement redimensionnée avec ImageScaleToTotalPixels, puis convertie en carte de profondeur par le nœud préprocesseur de profondeur inclus (nœud custom identifié par 6b0ed7ac-f476-44c9-9dad-b3f23ef985f8) utilisant le modèle lotus-depth-d-v1-1.safetensors. Pour les variantes image-vers-image, VAEEncode peut amorcer KSampler avec les latents de l’image de référence ; pour du texte-vers-image pur avec guidage profondeur, utilisez EmptySD3LatentImage. ConditioningZeroOut est disponible si vous souhaitez un prompt négatif vide. Cette combinaison permet de préserver la disposition de la scène tout en changeant librement le style, l’éclairage et les détails via votre prompt.
FAQ
















