
이 워크플로는 ComfyUI에서 Qwen-VL을 사용해 어떤 이미지든 설명적이고 지시를 따르는 텍스트로 변환합니다. 구성은 단순하고 안정적입니다. LoadImage가 소스 프레임 또는 사진을 그래프에 가져오고, AILab_QwenVL이 Qwen-VL 비전-언어 모델을 실행해 사용자의 지시에 따라 캡션 또는 답변을 생성하며, PreviewAny가 결과 텍스트를 UI에서 바로 표시합니다. AILab_QwenVL은 이미지와 프롬프트를 모두 받기 때문에, 간결한 대체 텍스트, 상세한 장면 분석, 태그, 또는 OCR 스타일 전사 등 원하는 형태로 출력을 유도할 수 있습니다.
기술적으로 AILab_QwenVL은 시각 콘텐츠를 인코딩하고 사용자의 지시(예: "이 장면을 한 문장으로 설명" 또는 "오브젝트를 개수와 함께 나열")에 조건화된 텍스트를 디코딩합니다. 노드 빌드에서 노출된다면 온도(temperature)나 최대 출력 길이 같은 생성 동작을 조정해 창의성과 정확도의 균형을 맞출 수 있습니다. 최소 노드 그래프는 빠르고 교육용으로도 이해하기 쉬워, 추가 후처리 노드 없이도 일관된 캡션, 제작 노트, 메타데이터를 만들기에 적합합니다. PreviewAny는 문자열 출력을 렌더링해 ComfyUI에서 바로 복사할 수 있게 합니다.
API
코드에서 이 워크플로우 사용하기
모든 Comfy 워크플로우는 JSON 그래프입니다. 아래 페이로드는 이 워크플로우 그 자체로, ComfyUI에서 실행되는 것과 동일합니다 — URL에서 가져오거나, 버전 관리에 보관하거나, ComfyUI에서 불러와 노드별로 실행할 수 있습니다.
Comfy SDK로 TypeScript 또는 Python에서 실행하세요. 동일한 코드는 Comfy Cloud 또는 직접 호스팅하는 ComfyUI 모두에 적용됩니다 — 기본 URL만 다릅니다.
// Install (beta)
npm i @comfyorg/sdk
// Run this workflow (TypeScript)
import { Comfy } from "@comfyorg/sdk";
const client = new Comfy({ apiKey: "comfyui-..." });
const wf = await client.workflows.fromFile("workflow_api.json");
const job = await client.run(wf);
await job.getOutputs("<output-node-id>")[0].toFile("output.png");SDK는 API 형식의 워크플로우를 사용합니다: 이 워크플로우를 ComfyUI에서 열고 파일 → 워크플로우 내보내기(API)를 사용하세요.
FAQ













