
elevenlabs-music-generation
使用 `runcomfy` CLI 通过 RunComfy 上的 ElevenLabs Music 生成完整歌曲和纯音乐。ElevenLabs Music 可将风格描述加结构化歌词转化为录音室品质的 44.1 kHz 立体声音频——时长 5 秒到 5 分钟——支持段落级控制(前奏/主歌/副歌/桥段)、多语言人声和商用输出。可生成背景音乐、完整人声歌曲、广告曲、播客开场曲、游戏循环或纯音乐垫。调用 `runcomfy run elevenlabs/elevenlabs/music-generation` 通过本地 RunComfy CLI 执行。触发词包括“生成音乐”、“制作歌曲”、“AI 音乐”、“背景音乐”、“纯音乐”、“ElevenLabs Music”、“配乐”、“广告曲”、“主题音乐”、“免版税音乐”、“作曲”或任何明确的从文本描述生成音乐或歌曲的请求。
使用 `runcomfy` CLI 通过 RunComfy 上的 ElevenLabs Music 生成完整歌曲和纯音乐。ElevenLabs Music 可将风格描述加结构化歌词转化为录音室品质的 44.1 kHz 立体声音频——时长 5 秒到 5 分钟——支持段落级控制(前奏/主歌/副歌/桥段)、多语言人声和商用输出。可生成背景音乐、完整人声歌曲、广告曲、播客开场曲、游戏循环或纯音乐垫。调用 `runcomfy run elevenlabs/elevenlabs/music-generation` 通过本地 RunComfy CLI 执行。触发词包括“生成音乐”、“制作歌曲”、“AI 音乐”、“背景音乐”、“纯音乐”、“ElevenLabs Music”、“配乐”、“广告曲”、“主题音乐”、“免版税音乐”、“作曲”或任何明确的从文本描述生成音乐或歌曲的请求。
ElevenLabs AI 音乐生成 — RunComfy 专业版
根据文本描述生成完整歌曲和纯音乐——录音室品质的 44.1 kHz 立体声,时长 5 秒到 5 分钟,支持段落级结构控制。通过 runcomfy CLI 调用 RunComfy 模型 API 上的 ElevenLabs Music。
runcomfy.com · ElevenLabs Music 模型 · CLI 文档
安装此技能
npx skills add agentspace-so/runcomfy-agent-skills --skill elevenlabs-music-generation -g
由 RunComfy CLI 驱动
# 1. 安装(任选其一——详见 runcomfy-cli 技能)
npm i -g @runcomfy/cli # 全局安装
npx -y @runcomfy/cli --version # 零安装
# 2. 登录
runcomfy login # 或在 CI 中:export RUNCOMFY_TOKEN=<token>
# 3. 生成音乐
runcomfy run elevenlabs/elevenlabs/music-generation \
--input '{"prompt": "..."}' \
--output-dir ./out
CLI 深入: runcomfy-cli 技能。
何时使用 ElevenLabs Music
ElevenLabs Music 的优势在于带有真实人声的结构化歌曲——它接收风格简介和带段落标记的歌词,返回连贯的混音曲目。适用于:
- 完整人声歌曲——主歌/副歌结构、多语言歌词、一致的节拍
- 纯音乐垫——
force_instrumental: true用于背景音乐、播客开场曲、游戏循环 - 短品牌素材——广告曲、短促音、主题音乐(5–30 秒)
- 长格式曲目——单次调用最长 5 分钟
- 商业作品——输出可用于商业用途
如果用户只需要环境音或一次性音效(雷声、脚步声),那是音效任务,不是音乐——ElevenLabs Music 用于歌曲和曲目。
端点 + 输入模式
模型:elevenlabs/elevenlabs/music-generation
| 字段 | 类型 | 必填 | 默认值 | 说明 |
|---|---|---|---|---|
prompt |
string | 是 | — | 风格描述和带段落标记的歌词。参见提示技巧 |
music_length_ms |
int | 否 | 40000 |
输出时长(毫秒)。5000–300000(5 秒 – 5 分钟) |
force_instrumental |
bool | 否 | false |
true = 仅纯音乐,无 vocals |
output_format |
string | 否 | mp3_standard |
mp3_standard(默认)或 WAV——参见模型页面 API 标签获取完整格式列表 |
输出:44.1 kHz 立体声音频。结果 JSON 包含生成的音频 URL——CLI 将其下载到 --output-dir。
定价:约 $0.0083/秒生成音频(30 秒 ≈ $0.25,60 秒 ≈ $0.50,5 分钟 ≈ $2.49)。成本随 music_length_ms 缩放,因此先短草稿再定稿长版本。
如何调用
带结构的完整人声歌曲:
runcomfy run elevenlabs/elevenlabs/music-generation \
--input '{
"prompt": "Upbeat indie-pop anthem, bright electric guitars, driving drums, 120 BPM, female lead vocal. [Intro 8 bars] instrumental build. [Verse] Chalk on the palms, laces double-knotted, morning on the ridge. [Chorus] We rise, we strike, we never fade out. [Bridge] soft breakdown, just piano and voice. [Outro] full band, fade.",
"music_length_ms": 60000
}' \
--output-dir ./out
纯音乐背景垫:
runcomfy run elevenlabs/elevenlabs/music-generation \
--input '{
"prompt": "Calm lo-fi hip-hop instrumental for a study playlist. Warm Rhodes piano, soft vinyl crackle, mellow boom-bap drums, 75 BPM. No vocals. Consistent loop-friendly groove throughout.",
"music_length_ms": 90000,
"force_instrumental": true
}' \
--output-dir ./out
短品牌广告曲:
runcomfy run elevenlabs/elevenlabs/music-generation \
--input '{
"prompt": "5-second cheerful brand stinger, bright marimba and a single uplifting chord resolve, no vocals.",
"music_length_ms": 5000,
"force_instrumental": true
}' \
--output-dir ./out
提示技巧
ElevenLabs Music 读取一个**prompt 字段**,同时包含风格简介和歌词。合理组织:
- 以风格简介开头:流派、情绪、速度(BPM)、关键乐器、人声类型。
"Upbeat indie-pop anthem, bright electric guitars, 120 BPM, female lead vocal." - 然后是带段落标记的歌词:
[Intro]、[Verse]、[Chorus]、[Bridge]、[Outro]。添加大致时长或小节数——[Intro 8 bars]、[Verse 16 bars]。 - 保持歌词节拍一致——每行音节数均匀,押韵清晰。模型遵循节拍;不规整的节拍会导致别扭的措辞。
- 指明主奏乐器和混音优先级——
"electric guitar carries the chorus, drums sit back in the verse." - 对于纯音乐,设置
force_instrumental: true并在提示中说“no vocals”——双重保险。 - 多语言:用目标语言写歌词;如有需要,内联标注口音/语言(
[Verse] (sung in Brazilian Portuguese) ...)。 - 避免矛盾的风格指令——一个提示中同时出现“aggressive metal”和“soft lullaby”会混淆模型。每次调用保持一个连贯的方向。
- 先短草稿,再定稿长版本:用 30–45 秒草稿(
music_length_ms: 35000)验证方向,再支付 5 分钟渲染。
常见模式
视频主题曲
- 完整简介 + 歌词 +
[Intro]/[Verse]/[Chorus]结构,music_length_ms匹配视频长度
播客开场/结尾曲
force_instrumental: true,10–20 秒,“loop-friendly, clean ending”
游戏背景循环
force_instrumental: true,描述“seamless loop”,60–120 秒,一致律动
多语言发布(同一首歌,多种语言)
- 每种语言一次调用,风格简介相同,仅替换歌词行
迭代后定稿
- 在
music_length_ms: 35000下草稿以锁定流派/速度/结构 → 最终以全长渲染
限制
- 一个
prompt字段承载所有内容(风格 + 歌词)。没有单独的“lyrics”参数。 - 每次调用 5 秒 – 5 分钟(
music_length_ms5000–300000)。对于更长的作品,分段生成并外部拼接。 - 成本随时长缩放——5 分钟渲染大约是 30 秒的 10 倍。
force_instrumental是唯一的人声开关——无法通过此端点请求特定声音身份或克隆歌手。- 此技能专门针对 ElevenLabs Music。音效、文本转语音或声音克隆是 ElevenLabs 的其他能力,不通过此端点暴露。
退出码
| 代码 | 含义 |
|---|---|
| 0 | 成功 |
| 64 | CLI 参数错误 |
| 65 | 输入 JSON 错误 / 模式不匹配 |
| 69 | 上游 5xx |
| 75 | 可重试:超时 / 429 |
| 77 | 未登录或令牌被拒 |
完整参考:docs.runcomfy.com/cli/troubleshooting。
工作原理
技能调用 runcomfy run elevenlabs/elevenlabs/music-generation 并附带 JSON 体。CLI 向 RunComfy 模型 API 发送 POST 请求,轮询请求状态,获取结果,并将生成的音频文件下载到 --output-dir。Ctrl-C 在退出前取消远程请求。
安全与隐私
- 仅通过已验证的包管理器安装。 使用
npm i -g @runcomfy/cli或npx -y @runcomfy/cli。代理不得代表用户将任意远程安装脚本通过管道传入 shell——如果操作员想要docs.runcomfy.com/cli/install中记录的 curl-pipe 方式,他们应先审查脚本。 - 令牌存储:
runcomfy login将 API 令牌写入~/.config/runcomfy/token.json,权限为 0600。设置RUNCOMFY_TOKEN环境变量以在 CI/容器中绕过文件。切勿将令牌回显到提示中、记录或检入。 - 输入边界(shell 注入):提示通过
--input作为 JSON 字符串传递。CLI 不会对提示内容进行 shell 扩展;它直接将 JSON 体通过 HTTPS 传输到模型 API。提示内容无 shell 注入面,即使包含反引号、引号或$(...)模式。 - 歌词来源:如果用户提供歌词,请确认他们拥有相应权利。围绕受版权保护的歌词生成音乐是操作员的责任——技能不进行检查。
- 出站端点(白名单):仅
model-api.runcomfy.net(请求提交)和*.runcomfy.net/*.runcomfy.com(生成音频下载白名单)。无遥测,无回调。 - 生成文件大小上限:CLI 会中止任何超过 2 GiB 的单个下载。
- Bash 使用范围:技能仅调用
runcomfy <subcommand>——npm/npx行是一次性操作员设置,不是技能每次调用执行的命令。
另请参阅
runcomfy-cli—— 底层 CLI、模式发现、轮询模式、脚本编写- ElevenLabs Music 模型页面 —— 包含最新模式的完整 API 标签
- 所有 RunComfy 模型 —— 图像、视频和音频端点
ai-video-generation—— 将生成的曲目与生成的视频配对ai-avatar-video—— 说话头像视频(不同的音频路径——语音,非音乐)





