
このワークフローは、Qwen-VLをComfyUI内で利用し、任意の画像を説明的かつ指示に従ったテキストへ変換します。構成はシンプルで信頼性が高く、LoadImageで画像をグラフに取り込み、AILab_QwenVLで指示に基づくキャプションや回答を生成し、PreviewAnyで結果テキストをUIに直接表示します。AILab_QwenVLは画像とプロンプトの両方を受け付けるため、簡潔なaltテキストや詳細なシーン分解、タグ付け、OCR風の書き起こしなど、出力を自在に誘導できます。
技術的には、AILab_QwenVLが視覚情報をエンコードし、指示に基づいてテキストをデコードします(例:「このシーンを一文で説明」「物体と個数をリストアップ」など)。ノードのビルドによっては、温度や最大出力長など生成挙動を調整でき、創造性と精度のバランスを取れます。ノード数が少なく高速で学習しやすいため、キャプションや制作ノート、メタデータ作成に最適です。PreviewAnyで出力テキストをそのままコピーできます。
API
このワークフローをコードから利用
すべてのComfyワークフローはJSONグラフです。以下のペイロードは、このワークフローそのものであり、ComfyUIが実行する内容と同じです — このURLから取得し、バージョン管理に保存したり、ComfyUIで読み込んでノードごとに実行できます。
Comfy SDKを使ってTypeScriptまたはPythonから実行できます。同じコードでComfy Cloudや自身でホストしたComfyUIのどちらにも対応 — ベースURLだけが異なります。
// Install (beta)
npm i @comfyorg/sdk
// Run this workflow (TypeScript)
import { Comfy } from "@comfyorg/sdk";
const client = new Comfy({ apiKey: "comfyui-..." });
const wf = await client.workflows.fromFile("workflow_api.json");
const job = await client.run(wf);
await job.getOutputs("<output-node-id>")[0].toFile("output.png");SDKはAPI形式のワークフローを受け取ります:このワークフローをComfyUIで開き、「ファイル → ワークフローをエクスポート(API)」を使用してください。
FAQ













