Este fluxo ensina como guiar o Stable Diffusion 3.5 com um mapa de profundidade para que suas gerações respeitem a estrutura e perspectiva de uma imagem de referência. Ele carrega o checkpoint SD 3.5 Large (sd3.5_large_fp8_scaled.safetensors) com CheckpointLoaderSimple e um VAE de alta qualidade (vae-ft-mse-840000-ema-pruned.safetensors). Seu prompt de texto é codificado por CLIPTextEncode, e KSampler faz a difusão usando uma tela latente definida por EmptySD3LatentImage, permitindo definir um tamanho de saída exato. VAEDecode, PreviewImage e SaveImage completam o ciclo para que você possa inspecionar e exportar os resultados.
A orientação de profundidade é fornecida via ControlNet. ControlNetLoader carrega sd3.5_large_controlnet_depth.safetensors e ControlNetApplyAdvanced conecta o condicionamento de profundidade ao seu prompt com força e porcentagem de início/fim ajustáveis. A imagem de referência entra via LoadImage, pode ser redimensionada com ImageScaleToTotalPixels, e então convertida em mapa de profundidade pelo nó pre-processador de profundidade incluso (nó customizado identificado por 6b0ed7ac-f476-44c9-9dad-b3f23ef985f8) usando o modelo lotus-depth-d-v1-1.safetensors. Para variantes imagem-para-imagem, VAEEncode pode semear o KSampler com os latentes da imagem de referência; para texto-para-imagem puro com orientação de profundidade, use EmptySD3LatentImage. ConditioningZeroOut está disponível caso queira um prompt negativo vazio. Essa combinação facilita preservar o layout da cena enquanto muda livremente estilo, iluminação e detalhes com seu prompt.
FAQ
















