Seed Audio 1.0:文本 + 图像生成音频

这个工作流将单张角色图像与一段文本提示词转换为已混音的音频片段,包含语音、环境氛围、背景音乐与音效。其核心是 ByteDanceSeedAudio 节点(Seed Audio 1.0):它接收来自 LoadImage 的图像作为视觉参考,用于推导匹配的声线身份,然后合成提示词中描述的台词与配套声部。输出通过 SaveAudioAdvanced 保存,因此你可以直接从 ComfyUI 得到可分享的成品音频文件。

从技术上看,图像用于约束声音特征(音色、风格线索),而提示词同时承担台词脚本与声音设计方向(氛围、音乐、音效)。工作流包含 MarkdownNote 节点,用于在画面内写操作说明或提示词备注。由于整体是简单链路——LoadImage → ByteDanceSeedAudio → SaveAudioAdvanced——你可以快速迭代:更换图像来改变角色观感,细化提示词来调整表演与声音设计,然后重新运行对比不同版本。这使其适用于快速声音方案探索、场景氛围搭建与音频样片制作,无需离开 ComfyUI。

API

通过代码使用此工作流

每个 Comfy 工作流都是一个 JSON 图。下面的内容就是此工作流的完整数据,ComfyUI 运行时也是如此——你可以从该 URL 获取、放入版本控制,或在 ComfyUI 中加载并逐节点运行。

9974666c3acb.json
正在获取工作流 JSON…

使用 Comfy SDK 从 TypeScript 或 Python 运行。相同代码可用于 Comfy Cloud 或你自托管的 ComfyUI——只需更改基础 URL。

// Install (beta)
npm i @comfyorg/sdk

// Run this workflow (TypeScript)
import { Comfy } from "@comfyorg/sdk";

const client = new Comfy({ apiKey: "comfyui-..." });
const wf = await client.workflows.fromFile("workflow_api.json");
const job = await client.run(wf);
await job.getOutputs("<output-node-id>")[0].toFile("output.png");

SDK 需要 API 格式的工作流:在 ComfyUI 中打开此工作流,使用 文件 → 导出工作流(API)。

Comfy Cloud API 访问需要包含 API 密钥的套餐。

常见问题

常见问题

查看所有工作流
Showing 30 of 30 templates