videoagent-audio-studio

videoagent-audio-studio

热门

厌倦了管理多个音频API?此技能让你通过一条命令即可访问TTS、音乐生成、音效和语音克隆。当你想要生成任何音频而无需管理多个API密钥时使用。

751Star
35Fork
更新于 2026/7/20
SKILL.md
readonly只读
name
videoagent-audio-studio
description

厌倦了管理多个音频API?此技能让你通过一条命令即可访问TTS、音乐生成、音效和语音克隆。当你想要生成任何音频而无需管理多个API密钥时使用。

version
3.0.0

🎙️ VideoAgent音频工作室

使用时机: 用户要求生成语音、朗读文本、创建配音、创作音乐或制作音效时。

VideoAgent音频工作室是一个智能音频调度器。它分析你的请求并将其路由到最佳可用模型——ElevenLabs用于语音和音乐,fal.ai用于快速音效——并返回一个可直接使用的音频URL。


快速参考

请求类型 最佳模型 延迟
朗读文本/配音 elevenlabs-tts-v3 ~3秒
低延迟TTS(实时) elevenlabs-tts-turbo <1秒
背景音乐 cassetteai-music ~15秒
音效 elevenlabs-sfx ~5秒
从音频克隆声音 elevenlabs-voice-clone ~10秒

如何使用

1. 启动AudioMind服务器(每个会话一次)

bash {baseDir}/tools/start_server.sh

这将在端口8124上启动ElevenLabs MCP服务器。该技能使用它进行所有音频生成。

2. 路由请求

分析用户的请求并通过MCP服务器调用适当的工具:

文本转语音(TTS)

当用户要求“朗读”、“读出来”、“说”或“创建配音”时:

使用MCP工具:text_to_speech
  text: "<要朗读的文本>"
  voice_id: "JBFqnCBsd6RMkjVDRZzb"   # 默认:“George”(专业、中性)
  model_id: "eleven_multilingual_v2"   # 低延迟使用“eleven_turbo_v2_5”

音乐生成

当用户要求“创作”、“创建背景音乐”或“制作配乐”时:

使用MCP工具:text_to_sound_effects(通过fal.ai上的cassetteai-music)
  prompt: "<音乐描述,例如'欢快的lo-fi嘻哈,90秒'>"
  duration_seconds: <时长>

音效(SFX)

当用户要求特定声音(例如“门吱吱作响”、“雨打窗户”)时:

使用MCP工具:text_to_sound_effects
  text: "<声音描述>"
  duration_seconds: <1-22>

语音克隆

当用户提供音频样本并希望克隆声音时:

使用MCP工具:voice_add
  name: "<声音名称>"
  files: ["<音频文件URL>"]

示例对话

用户:“为我朗读这段文字:欢迎来到我们的产品发布会”

→ 路由到:text_to_speech
  text: "欢迎来到我们的产品发布会"
  voice_id: "JBFqnCBsd6RMkjVDRZzb"
  model_id: "eleven_multilingual_v2"

🎙️ 配音完成!在此收听


用户:“为播客生成60秒的放松背景音乐”

→ 路由到:cassetteai-music(fal.ai)
  prompt: "relaxing lo-fi background music for a podcast, gentle piano and soft beats, 60 seconds"
  duration_seconds: 60

🎵 背景音乐已就绪!在此收听


用户:“生成一个科幻风格的门打开音效”

→ 路由到:text_to_sound_effects
  text: "a futuristic sci-fi door sliding open with a hydraulic hiss"
  duration_seconds: 3

设置

必需

~/.openclaw/openclaw.json中设置ELEVENLABS_API_KEY

{
  "skills": {
    "entries": {
      "videoagent-audio-studio": {
        "enabled": true,
        "env": {
          "ELEVENLABS_API_KEY": "your_elevenlabs_key_here"
        }
      }
    }
  }
}

elevenlabs.io/app/settings/api-keys获取你的密钥。

可选(用于fal.ai音乐和音效模型)

"FAL_KEY": "your_fal_key_here"

fal.ai/dashboard/keys获取你的密钥。


自托管代理

cli.js默认连接到托管代理。如果你想要完全控制——或者需要为vercel.app被屏蔽地区的用户提供服务——你可以从proxy/目录部署自己的实例。

快速部署(Vercel)

cd proxy
npm install
vercel --prod

环境变量

在Vercel项目中设置这些(仪表盘→设置→环境变量):

变量 必需用于 获取位置
ELEVENLABS_API_KEY TTS、音效、语音克隆 elevenlabs.io/app/settings/api-keys
FAL_KEY 音乐生成 fal.ai/dashboard/keys
VALID_PRO_KEYS (可选)限制访问 允许的客户端密钥逗号分隔列表

将cli.js指向你的代理

export AUDIOMIND_PROXY_URL="https://your-domain.com/api/audio"

或者在~/.openclaw/openclaw.json中设置:

{
  "skills": {
    "entries": {
      "videoagent-audio-studio": {
        "env": {
          "AUDIOMIND_PROXY_URL": "https://your-domain.com/api/audio"
        }
      }
    }
  }
}

自定义域名(推荐)

如果你的用户在中国大陆,请在Vercel仪表盘→设置→域名中绑定自定义域名,以避免vercel.app的DNS问题。


模型参考

模型ID 类型 提供商 备注
eleven_multilingual_v2 TTS ElevenLabs 最佳质量,支持29种语言
eleven_turbo_v2_5 TTS ElevenLabs 超低延迟,适合实时
eleven_monolingual_v1 TTS ElevenLabs 仅英语,最快
cassetteai-music 音乐 fal.ai 可靠、快速的音乐生成
elevenlabs-sfx 音效 ElevenLabs 高质量音效(最长22秒)
elevenlabs-voice-clone 克隆 ElevenLabs 从短音频样本克隆任何声音

更新日志

v3.0.0

  • 简化路由表:从主要参考中移除了不稳定/离线的模型。该技能现在只展示可靠工作的模型。
  • 更清晰的使用触发条件:添加了“使用时机”部分,以便代理在正确时刻激活此技能。
  • 统一设置:只需一个ELEVENLABS_API_KEY即可开始。FAL_KEY现在是可选的。
  • 移除轮询复杂性:音乐生成现在默认使用cassetteai-music,同步完成。

v2.1.0

  • 为长时间运行的音乐生成任务添加了异步工作流。
  • 添加了cassetteai-music作为音乐生成的稳定替代方案。

v2.0.0

  • 迁移到ElevenLabs MCP服务器架构。
  • 添加了语音克隆支持。

v1.0.0

  • 初始版本,包含TTS、音乐和音效路由。