
此 ComfyUI 工作流程運用 Google Gemini 模型,展示多模態 AI 產生連貫且語境相關文字的能力。流程包含 GeminiNode(核心處理單元)與 LoadImage 節點,讓使用者輸入圖片供 Gemini 模型分析與解讀。整合這些元件後,能將 Gemini 的進階推理應用於圖像與文字輸入,實現根據視覺內容產生文字的體驗。PreviewAny 與 BatchImagesNode 節點則方便多輸出管理與預覽,讓內容產出與檢查更有效率。
API
從程式碼使用此工作流
每個 Comfy 工作流都是一個 JSON 圖。下方的 payload 就是此工作流,與 ComfyUI 執行時完全相同 — 你可以從此 URL 取得、放入版本控制,或在 ComfyUI 載入並逐節點執行。
使用 Comfy SDK 以 TypeScript 或 Python 執行。相同程式碼可用於 Comfy Cloud 或你自架的 ComfyUI — 只需更改 base URL。
// Install (beta)
npm i @comfyorg/sdk
// Run "Google Gemini" (TypeScript)
import { Comfy } from "@comfyorg/sdk";
const client = new Comfy({ apiKey: "comfyui-..." });
// This workflow, exported in API format (see note below)
const wf = await client.workflows.fromFile("api_google_gemini_api.json");
const asset = client.assets.fromFile("input.png");
wf.setInput("2", "image", asset); // LoadImage
const job = await client.run(wf);
await job.getOutputs("20")[0].toFile("output.png"); // SaveTextSDK 需使用 API 格式的工作流:請在 ComfyUI 開啟此工作流,並使用 檔案 → 匯出工作流(API)。
常見問題
常見問題
Showing 30 of 30 templates













