
这个 ComfyUI 工作流使用 Google 的 Gemini 模型,用于展示多模态 AI 在生成连贯且与上下文相关文本方面的能力。工作流包含多个节点,其中 GeminiNode 作为核心处理单元,LoadImage 节点允许你输入图像供 Gemini 模型分析与理解。通过整合这些组件,工作流演示了如何将 Gemini 的推理能力同时应用于文本与图像输入,从而实现基于视觉内容生成文本的连贯流程。此外,PreviewAny 与 BatchImagesNode 节点便于可视化与管理多份输出,让你更容易处理与审核已生成内容。
API
通过代码使用此工作流
每个 Comfy 工作流都是一个 JSON 图。下面的内容就是此工作流的完整数据,ComfyUI 运行时也是如此——你可以从该 URL 获取、放入版本控制,或在 ComfyUI 中加载并逐节点运行。
使用 Comfy SDK 从 TypeScript 或 Python 运行。相同代码可用于 Comfy Cloud 或你自托管的 ComfyUI——只需更改基础 URL。
// Install (beta)
npm i @comfyorg/sdk
// Run "Google Gemini" (TypeScript)
import { Comfy } from "@comfyorg/sdk";
const client = new Comfy({ apiKey: "comfyui-..." });
// This workflow, exported in API format (see note below)
const wf = await client.workflows.fromFile("api_google_gemini_api.json");
const asset = client.assets.fromFile("input.png");
wf.setInput("2", "image", asset); // LoadImage
const job = await client.run(wf);
await job.getOutputs("20")[0].toFile("output.png"); // SaveTextSDK 需要 API 格式的工作流:在 ComfyUI 中打开此工作流,使用 文件 → 导出工作流(API)。
常见问题
常见问题
Showing 30 of 30 templates













