elevenlabs-music-generation

elevenlabs-music-generation

使用 `runcomfy` CLI 通过 RunComfy 上的 ElevenLabs Music 生成完整歌曲和纯音乐。ElevenLabs Music 可将风格描述加结构化歌词转化为录音室品质的 44.1 kHz 立体声音频——时长 5 秒到 5 分钟——支持段落级控制(前奏/主歌/副歌/桥段)、多语言人声和商用输出。可生成背景音乐、完整人声歌曲、广告曲、播客开场曲、游戏循环或纯音乐垫。调用 `runcomfy run elevenlabs/elevenlabs/music-generation` 通过本地 RunComfy CLI 执行。触发词包括“生成音乐”、“制作歌曲”、“AI 音乐”、“背景音乐”、“纯音乐”、“ElevenLabs Music”、“配乐”、“广告曲”、“主题音乐”、“免版税音乐”、“作曲”或任何明确的从文本描述生成音乐或歌曲的请求。

2Star
1Fork
更新于 2026/6/18
SKILL.md
readonly只读
name
elevenlabs-music-generation
description

使用 `runcomfy` CLI 通过 RunComfy 上的 ElevenLabs Music 生成完整歌曲和纯音乐。ElevenLabs Music 可将风格描述加结构化歌词转化为录音室品质的 44.1 kHz 立体声音频——时长 5 秒到 5 分钟——支持段落级控制(前奏/主歌/副歌/桥段)、多语言人声和商用输出。可生成背景音乐、完整人声歌曲、广告曲、播客开场曲、游戏循环或纯音乐垫。调用 `runcomfy run elevenlabs/elevenlabs/music-generation` 通过本地 RunComfy CLI 执行。触发词包括“生成音乐”、“制作歌曲”、“AI 音乐”、“背景音乐”、“纯音乐”、“ElevenLabs Music”、“配乐”、“广告曲”、“主题音乐”、“免版税音乐”、“作曲”或任何明确的从文本描述生成音乐或歌曲的请求。

ElevenLabs AI 音乐生成 — RunComfy 专业版

根据文本描述生成完整歌曲和纯音乐——录音室品质的 44.1 kHz 立体声,时长 5 秒到 5 分钟,支持段落级结构控制。通过 runcomfy CLI 调用 RunComfy 模型 API 上的 ElevenLabs Music。

runcomfy.com · ElevenLabs Music 模型 · CLI 文档

安装此技能

npx skills add agentspace-so/runcomfy-agent-skills --skill elevenlabs-music-generation -g

由 RunComfy CLI 驱动

# 1. 安装(任选其一——详见 runcomfy-cli 技能)
npm i -g @runcomfy/cli                              # 全局安装
npx -y @runcomfy/cli --version                      # 零安装

# 2. 登录
runcomfy login                                      # 或在 CI 中:export RUNCOMFY_TOKEN=<token>

# 3. 生成音乐
runcomfy run elevenlabs/elevenlabs/music-generation \
  --input '{"prompt": "..."}' \
  --output-dir ./out

CLI 深入: runcomfy-cli 技能。

何时使用 ElevenLabs Music

ElevenLabs Music 的优势在于带有真实人声的结构化歌曲——它接收风格简介和带段落标记的歌词,返回连贯的混音曲目。适用于:

  • 完整人声歌曲——主歌/副歌结构、多语言歌词、一致的节拍
  • 纯音乐垫——force_instrumental: true 用于背景音乐、播客开场曲、游戏循环
  • 短品牌素材——广告曲、短促音、主题音乐(5–30 秒)
  • 长格式曲目——单次调用最长 5 分钟
  • 商业作品——输出可用于商业用途

如果用户只需要环境音或一次性音效(雷声、脚步声),那是音效任务,不是音乐——ElevenLabs Music 用于歌曲和曲目

端点 + 输入模式

模型elevenlabs/elevenlabs/music-generation

字段 类型 必填 默认值 说明
prompt string 风格描述带段落标记的歌词。参见提示技巧
music_length_ms int 40000 输出时长(毫秒)。5000–300000(5 秒 – 5 分钟)
force_instrumental bool false true = 仅纯音乐,无 vocals
output_format string mp3_standard mp3_standard(默认)或 WAV——参见模型页面 API 标签获取完整格式列表

输出:44.1 kHz 立体声音频。结果 JSON 包含生成的音频 URL——CLI 将其下载到 --output-dir

定价:约 $0.0083/秒生成音频(30 秒 ≈ $0.25,60 秒 ≈ $0.50,5 分钟 ≈ $2.49)。成本随 music_length_ms 缩放,因此先短草稿再定稿长版本。

如何调用

带结构的完整人声歌曲:

runcomfy run elevenlabs/elevenlabs/music-generation \
  --input '{
    "prompt": "Upbeat indie-pop anthem, bright electric guitars, driving drums, 120 BPM, female lead vocal. [Intro 8 bars] instrumental build. [Verse] Chalk on the palms, laces double-knotted, morning on the ridge. [Chorus] We rise, we strike, we never fade out. [Bridge] soft breakdown, just piano and voice. [Outro] full band, fade.",
    "music_length_ms": 60000
  }' \
  --output-dir ./out

纯音乐背景垫:

runcomfy run elevenlabs/elevenlabs/music-generation \
  --input '{
    "prompt": "Calm lo-fi hip-hop instrumental for a study playlist. Warm Rhodes piano, soft vinyl crackle, mellow boom-bap drums, 75 BPM. No vocals. Consistent loop-friendly groove throughout.",
    "music_length_ms": 90000,
    "force_instrumental": true
  }' \
  --output-dir ./out

短品牌广告曲:

runcomfy run elevenlabs/elevenlabs/music-generation \
  --input '{
    "prompt": "5-second cheerful brand stinger, bright marimba and a single uplifting chord resolve, no vocals.",
    "music_length_ms": 5000,
    "force_instrumental": true
  }' \
  --output-dir ./out

提示技巧

ElevenLabs Music 读取一个**prompt 字段**,同时包含风格简介和歌词。合理组织:

  • 以风格简介开头:流派、情绪、速度(BPM)、关键乐器、人声类型。"Upbeat indie-pop anthem, bright electric guitars, 120 BPM, female lead vocal."
  • 然后是带段落标记的歌词[Intro][Verse][Chorus][Bridge][Outro]。添加大致时长或小节数——[Intro 8 bars][Verse 16 bars]
  • 保持歌词节拍一致——每行音节数均匀,押韵清晰。模型遵循节拍;不规整的节拍会导致别扭的措辞。
  • 指明主奏乐器和混音优先级——"electric guitar carries the chorus, drums sit back in the verse."
  • 对于纯音乐,设置 force_instrumental: true 并在提示中说“no vocals”——双重保险。
  • 多语言:用目标语言写歌词;如有需要,内联标注口音/语言([Verse] (sung in Brazilian Portuguese) ...)。
  • 避免矛盾的风格指令——一个提示中同时出现“aggressive metal”和“soft lullaby”会混淆模型。每次调用保持一个连贯的方向。
  • 先短草稿,再定稿长版本:用 30–45 秒草稿(music_length_ms: 35000)验证方向,再支付 5 分钟渲染。

常见模式

视频主题曲

  • 完整简介 + 歌词 + [Intro]/[Verse]/[Chorus] 结构,music_length_ms 匹配视频长度

播客开场/结尾曲

  • force_instrumental: true,10–20 秒,“loop-friendly, clean ending”

游戏背景循环

  • force_instrumental: true,描述“seamless loop”,60–120 秒,一致律动

多语言发布(同一首歌,多种语言)

  • 每种语言一次调用,风格简介相同,仅替换歌词行

迭代后定稿

  • music_length_ms: 35000 下草稿以锁定流派/速度/结构 → 最终以全长渲染

限制

  • 一个 prompt 字段承载所有内容(风格 + 歌词)。没有单独的“lyrics”参数。
  • 每次调用 5 秒 – 5 分钟music_length_ms 5000–300000)。对于更长的作品,分段生成并外部拼接。
  • 成本随时长缩放——5 分钟渲染大约是 30 秒的 10 倍。
  • force_instrumental 是唯一的人声开关——无法通过此端点请求特定声音身份或克隆歌手。
  • 此技能专门针对 ElevenLabs Music。音效、文本转语音或声音克隆是 ElevenLabs 的其他能力,不通过此端点暴露。

退出码

代码 含义
0 成功
64 CLI 参数错误
65 输入 JSON 错误 / 模式不匹配
69 上游 5xx
75 可重试:超时 / 429
77 未登录或令牌被拒

完整参考:docs.runcomfy.com/cli/troubleshooting

工作原理

技能调用 runcomfy run elevenlabs/elevenlabs/music-generation 并附带 JSON 体。CLI 向 RunComfy 模型 API 发送 POST 请求,轮询请求状态,获取结果,并将生成的音频文件下载到 --output-dirCtrl-C 在退出前取消远程请求。

安全与隐私

  • 仅通过已验证的包管理器安装。 使用 npm i -g @runcomfy/clinpx -y @runcomfy/cli代理不得代表用户将任意远程安装脚本通过管道传入 shell——如果操作员想要 docs.runcomfy.com/cli/install 中记录的 curl-pipe 方式,他们应先审查脚本。
  • 令牌存储runcomfy login 将 API 令牌写入 ~/.config/runcomfy/token.json,权限为 0600。设置 RUNCOMFY_TOKEN 环境变量以在 CI/容器中绕过文件。切勿将令牌回显到提示中、记录或检入。
  • 输入边界(shell 注入):提示通过 --input 作为 JSON 字符串传递。CLI 不会对提示内容进行 shell 扩展;它直接将 JSON 体通过 HTTPS 传输到模型 API。提示内容无 shell 注入面,即使包含反引号、引号或 $(...) 模式。
  • 歌词来源:如果用户提供歌词,请确认他们拥有相应权利。围绕受版权保护的歌词生成音乐是操作员的责任——技能不进行检查。
  • 出站端点(白名单):仅 model-api.runcomfy.net(请求提交)和 *.runcomfy.net / *.runcomfy.com(生成音频下载白名单)。无遥测,无回调。
  • 生成文件大小上限:CLI 会中止任何超过 2 GiB 的单个下载。
  • Bash 使用范围:技能仅调用 runcomfy <subcommand>——npm / npx 行是一次性操作员设置,不是技能每次调用执行的命令。

另请参阅