
Этот рабочий процесс ComfyUI использует модель Gemini от Google, чтобы продемонстрировать возможности мультимодального AI в генерации связного и контекстно релевантного текста. Рабочий процесс использует несколько нод, включая GeminiNode в роли основного блока обработки и LoadImage, который позволяет подавать изображения для анализа и интерпретации моделью Gemini. Интеграция этих компонентов показывает, как продвинутые возможности рассуждения Gemini можно применять к текстовым и визуальным входам, чтобы получать текст на основе содержимого изображения. Дополнительно ноды PreviewAny и BatchImagesNode помогают визуализировать и управлять несколькими выходами, упрощая просмотр и проверку сгенерированного содержимого.
API
Использовать этот рабочий процесс из кода
Каждый рабочий процесс Comfy — это JSON-граф. Ниже представлен payload этого процесса, точно так же, как его запускает ComfyUI: получите его по ссылке, храните в системе контроля версий или загрузите в ComfyUI и выполняйте по узлам.
Запустите его на TypeScript или Python с помощью Comfy SDK. Один и тот же код работает с Comfy Cloud или вашим собственным ComfyUI — меняется только базовый URL.
// Install (beta)
npm i @comfyorg/sdk
// Run "Google Gemini" (TypeScript)
import { Comfy } from "@comfyorg/sdk";
const client = new Comfy({ apiKey: "comfyui-..." });
// This workflow, exported in API format (see note below)
const wf = await client.workflows.fromFile("api_google_gemini_api.json");
const asset = client.assets.fromFile("input.png");
wf.setInput("2", "image", asset); // LoadImage
const job = await client.run(wf);
await job.getOutputs("20")[0].toFile("output.png"); // SaveTextSDK принимает рабочий процесс в API-формате: откройте этот процесс в ComfyUI и используйте Файл → Экспортировать рабочий процесс (API).
Доступ к API Comfy Cloud требует плана с API-ключом.
FAQ













