
elevenlabs-music-generation
通过 `runcomfy` CLI 在 RunComfy 上使用 ElevenLabs Music 生成完整歌曲和纯器乐轨道。ElevenLabs Music 将风格描述加上结构化歌词转化为工作室品质的 44.1 kHz 立体声音频——时长 5 秒到 5 分钟——支持段落级控制(前奏/主歌/副歌/桥段)、多语言演唱和商用输出。可生成背景音乐、完整演唱歌曲、广告歌、播客开场曲、游戏循环或器乐背景。调用 `runcomfy run elevenlabs/elevenlabs/music-generation` 通过本地 RunComfy CLI 执行。触发词包括“生成音乐”、“制作歌曲”、“AI 音乐”、“背景音乐”、“器乐轨道”、“ElevenLabs Music”、“配乐”、“广告歌”、“主题音乐”、“免版税音乐”、“作曲”或任何明确要求从文本描述生成音乐或歌曲的请求。
通过 `runcomfy` CLI 在 RunComfy 上使用 ElevenLabs Music 生成完整歌曲和纯器乐轨道。ElevenLabs Music 将风格描述加上结构化歌词转化为工作室品质的 44.1 kHz 立体声音频——时长 5 秒到 5 分钟——支持段落级控制(前奏/主歌/副歌/桥段)、多语言演唱和商用输出。可生成背景音乐、完整演唱歌曲、广告歌、播客开场曲、游戏循环或器乐背景。调用 `runcomfy run elevenlabs/elevenlabs/music-generation` 通过本地 RunComfy CLI 执行。触发词包括“生成音乐”、“制作歌曲”、“AI 音乐”、“背景音乐”、“器乐轨道”、“ElevenLabs Music”、“配乐”、“广告歌”、“主题音乐”、“免版税音乐”、“作曲”或任何明确要求从文本描述生成音乐或歌曲的请求。
ElevenLabs AI 音乐生成 — RunComfy 专业版
从文本描述生成完整歌曲和器乐轨道——工作室品质的 44.1 kHz 立体声,时长 5 秒到 5 分钟,支持段落级结构控制。通过 runcomfy CLI 调用 RunComfy 模型 API 上的 ElevenLabs Music。
runcomfy.com · ElevenLabs Music 模型 · CLI 文档
安装此技能
npx skills add agentspace-so/runcomfy-agent-skills --skill elevenlabs-music-generation -g
由 RunComfy CLI 驱动
# 1. 安装(任选其一——详见 runcomfy-cli 技能)
npm i -g @runcomfy/cli # 全局安装
npx -y @runcomfy/cli --version # 零安装
# 2. 登录
runcomfy login # 或在 CI 中:export RUNCOMFY_TOKEN=<token>
# 3. 生成音乐
runcomfy run elevenlabs/elevenlabs/music-generation \
--input '{"prompt": "..."}' \
--output-dir ./out
CLI 深入:runcomfy-cli 技能。
何时使用 ElevenLabs Music
ElevenLabs Music 的优势在于带有真实人声的结构化歌曲——它接受风格简介和带段落标记的歌词,返回连贯的混音轨道。适用于:
- 完整演唱歌曲——主歌/副歌结构、多语言歌词、一致的节拍
- 器乐背景——设置
force_instrumental: true用于背景音乐、播客开场曲、游戏循环 - 短品牌素材——广告歌、短曲、主题音乐(5–30 秒)
- 长格式轨道——单次调用最长 5 分钟
- 商业作品——输出可用于商业用途
如果用户只需要环境音或一次性音效(雷声、脚步声),那是音效任务,而非音乐——ElevenLabs Music 用于歌曲和轨道。
端点 + 输入模式
模型:elevenlabs/elevenlabs/music-generation
| 字段 | 类型 | 必填 | 默认值 | 说明 |
|---|---|---|---|---|
prompt |
string | 是 | — | 风格描述和带段落标记的歌词。参见提示技巧 |
music_length_ms |
int | 否 | 40000 |
输出时长(毫秒)。5000–300000(5 秒 – 5 分钟) |
force_instrumental |
bool | 否 | false |
true = 仅器乐,无演唱 |
output_format |
string | 否 | mp3_standard |
mp3_standard(默认)或 WAV——参见模型页面 API 选项卡获取完整格式列表 |
输出:44.1 kHz 立体声音频。结果 JSON 包含生成的音频 URL——CLI 将其下载到 --output-dir。
定价:约 $0.0083/秒生成音频(30 秒 ≈ $0.25,60 秒 ≈ $0.50,5 分钟 ≈ $2.49)。成本随 music_length_ms 增加,因此先短草稿再最终长版。
如何调用
带结构的完整演唱歌曲:
runcomfy run elevenlabs/elevenlabs/music-generation \
--input '{
"prompt": "Upbeat indie-pop anthem, bright electric guitars, driving drums, 120 BPM, female lead vocal. [Intro 8 bars] instrumental build. [Verse] Chalk on the palms, laces double-knotted, morning on the ridge. [Chorus] We rise, we strike, we never fade out. [Bridge] soft breakdown, just piano and voice. [Outro] full band, fade.",
"music_length_ms": 60000
}' \
--output-dir ./out
器乐背景音乐:
runcomfy run elevenlabs/elevenlabs/music-generation \
--input '{
"prompt": "Calm lo-fi hip-hop instrumental for a study playlist. Warm Rhodes piano, soft vinyl crackle, mellow boom-bap drums, 75 BPM. No vocals. Consistent loop-friendly groove throughout.",
"music_length_ms": 90000,
"force_instrumental": true
}' \
--output-dir ./out
短品牌广告歌:
runcomfy run elevenlabs/elevenlabs/music-generation \
--input '{
"prompt": "5-second cheerful brand stinger, bright marimba and a single uplifting chord resolve, no vocals.",
"music_length_ms": 5000,
"force_instrumental": true
}' \
--output-dir ./out
提示技巧
ElevenLabs Music 读取一个 prompt 字段,同时包含风格简介和歌词。合理组织:
- 以风格简介开头:流派、情绪、速度(BPM)、关键乐器、演唱类型。
"Upbeat indie-pop anthem, bright electric guitars, 120 BPM, female lead vocal." - 然后是带段落标记的歌词:
[Intro]、[Verse]、[Chorus]、[Bridge]、[Outro]。添加大致时长或小节数——[Intro 8 bars]、[Verse 16 bars]。 - 保持歌词节拍一致——每行音节数均匀,押韵清晰。模型遵循节拍;不规则的节拍会导致别扭的措辞。
- 指明主奏乐器和混音优先级——
"electric guitar carries the chorus, drums sit back in the verse." - 对于器乐,设置
force_instrumental: true并在提示中说“no vocals”——双重保险。 - 多语言:用目标语言写歌词;如有需要,内联标注口音/语言(
[Verse] (sung in Brazilian Portuguese) ...)。 - 避免矛盾的风格指令——一个提示中同时出现“aggressive metal”和“soft lullaby”会混淆模型。每次调用保持一个连贯的方向。
- 先短草稿,再最终长版:在支付 5 分钟渲染之前,先用 30–45 秒草稿(
music_length_ms: 35000)验证方向。
常见模式
视频主题曲
- 完整简介 + 歌词 +
[Intro]/[Verse]/[Chorus]结构,music_length_ms匹配视频长度
播客开场/结尾
force_instrumental: true,10–20 秒,“loop-friendly, clean ending”
游戏背景循环
force_instrumental: true,描述“seamless loop”,60–120 秒,一致的律动
多语言发布(同一首歌,多种语言)
- 每种语言一次调用,风格简介相同,仅替换歌词行
迭代后定稿
- 在
music_length_ms: 35000下草稿以锁定流派/速度/结构 → 最终以全长渲染
限制
- 一个
prompt字段承载所有内容(风格 + 歌词)。没有单独的“lyrics”参数。 - 每次调用 5 秒 – 5 分钟(
music_length_ms5000–300000)。对于更长的作品,分段生成并在外部拼接。 - 成本随时长增加——5 分钟渲染大约是 30 秒的 10 倍。
force_instrumental是唯一的演唱开关——无法通过此端点请求特定声音身份或克隆歌手。- 此技能专门针对 ElevenLabs Music。对于音效、文本转语音或声音克隆,那是不同的 ElevenLabs 功能,不通过此端点提供。
退出码
| 代码 | 含义 |
|---|---|
| 0 | 成功 |
| 64 | CLI 参数错误 |
| 65 | 输入 JSON 错误 / 模式不匹配 |
| 69 | 上游 5xx 错误 |
| 75 | 可重试:超时 / 429 |
| 77 | 未登录或令牌被拒绝 |
完整参考:docs.runcomfy.com/cli/troubleshooting。
工作原理
技能调用 runcomfy run elevenlabs/elevenlabs/music-generation 并附带 JSON 体。CLI 向 RunComfy 模型 API 发送 POST 请求,轮询请求状态,获取结果,并将生成的音频文件下载到 --output-dir。Ctrl-C 在退出前取消远程请求。
安全与隐私
- 仅通过已验证的包管理器安装。 使用
npm i -g @runcomfy/cli或npx -y @runcomfy/cli。代理不得代表用户将任意远程安装脚本通过管道传入 shell——如果操作员希望使用docs.runcomfy.com/cli/install中记录的 curl-pipe 方式,应先审查脚本。 - 令牌存储:
runcomfy login将 API 令牌写入~/.config/runcomfy/token.json,权限为 0600。在 CI/容器中设置RUNCOMFY_TOKEN环境变量以绕过文件。切勿将令牌回显到提示中、记录或提交到版本控制。 - 输入边界(shell 注入):提示通过
--input作为 JSON 字符串传递。CLI 不会对提示内容进行 shell 扩展;它直接将 JSON 体通过 HTTPS 传输到模型 API。提示内容不存在 shell 注入风险,即使包含反引号、引号或$(...)模式。 - 歌词来源:如果用户提供歌词,请确认他们拥有相关权利。围绕受版权保护的歌词生成音乐是操作员的责任——技能不进行检查。
- 出站端点(白名单):仅
model-api.runcomfy.net(请求提交)和*.runcomfy.net/*.runcomfy.com(生成音频下载白名单)。无遥测,无回调。 - 生成文件大小上限:CLI 会中止任何超过 2 GiB 的单个下载。
- Bash 使用范围:技能仅调用
runcomfy <subcommand>——npm/npx行是一次性操作员设置,不是技能每次执行时运行的命令。
另请参阅
runcomfy-cli— 底层 CLI、模式发现、轮询模式、脚本编写- ElevenLabs Music 模型页面 — 包含最新模式的完整 API 选项卡
- 所有 RunComfy 模型 — 图像、视频和音频端点
ai-video-generation— 将生成的轨道与生成的视频配对ai-avatar-video— 说话头像视频(不同的音频路径——语音,而非音乐)





