厌倦了管理多个音频API?此技能让你通过一条命令即可访问TTS、音乐生成、音效和语音克隆。当你想要生成任何音频而无需管理多个API密钥时使用。
🎙️ VideoAgent音频工作室
使用时机: 用户要求生成语音、朗读文本、创建配音、创作音乐或制作音效时。
VideoAgent音频工作室是一个智能音频调度器。它分析你的请求并将其路由到最佳可用模型——ElevenLabs用于语音和音乐,fal.ai用于快速音效——并返回一个可直接使用的音频URL。
快速参考
| 请求类型 | 最佳模型 | 延迟 |
|---|---|---|
| 朗读文本/配音 | elevenlabs-tts-v3 |
~3秒 |
| 低延迟TTS(实时) | elevenlabs-tts-turbo |
<1秒 |
| 背景音乐 | cassetteai-music |
~15秒 |
| 音效 | elevenlabs-sfx |
~5秒 |
| 从音频克隆声音 | elevenlabs-voice-clone |
~10秒 |
如何使用
1. 启动AudioMind服务器(每个会话一次)
bash {baseDir}/tools/start_server.sh
这将在端口8124上启动ElevenLabs MCP服务器。该技能使用它进行所有音频生成。
2. 路由请求
分析用户的请求并通过MCP服务器调用适当的工具:
文本转语音(TTS)
当用户要求“朗读”、“读出来”、“说”或“创建配音”时:
使用MCP工具:text_to_speech
text: "<要朗读的文本>"
voice_id: "JBFqnCBsd6RMkjVDRZzb" # 默认:“George”(专业、中性)
model_id: "eleven_multilingual_v2" # 低延迟使用“eleven_turbo_v2_5”
音乐生成
当用户要求“创作”、“创建背景音乐”或“制作配乐”时:
使用MCP工具:text_to_sound_effects(通过fal.ai上的cassetteai-music)
prompt: "<音乐描述,例如'欢快的lo-fi嘻哈,90秒'>"
duration_seconds: <时长>
音效(SFX)
当用户要求特定声音(例如“门吱吱作响”、“雨打窗户”)时:
使用MCP工具:text_to_sound_effects
text: "<声音描述>"
duration_seconds: <1-22>
语音克隆
当用户提供音频样本并希望克隆声音时:
使用MCP工具:voice_add
name: "<声音名称>"
files: ["<音频文件URL>"]
示例对话
用户:“为我朗读这段文字:欢迎来到我们的产品发布会”
→ 路由到:text_to_speech
text: "欢迎来到我们的产品发布会"
voice_id: "JBFqnCBsd6RMkjVDRZzb"
model_id: "eleven_multilingual_v2"
🎙️ 配音完成!在此收听
用户:“为播客生成60秒的放松背景音乐”
→ 路由到:cassetteai-music(fal.ai)
prompt: "relaxing lo-fi background music for a podcast, gentle piano and soft beats, 60 seconds"
duration_seconds: 60
🎵 背景音乐已就绪!在此收听
用户:“生成一个科幻风格的门打开音效”
→ 路由到:text_to_sound_effects
text: "a futuristic sci-fi door sliding open with a hydraulic hiss"
duration_seconds: 3
设置
必需
在~/.openclaw/openclaw.json中设置ELEVENLABS_API_KEY:
{
"skills": {
"entries": {
"videoagent-audio-studio": {
"enabled": true,
"env": {
"ELEVENLABS_API_KEY": "your_elevenlabs_key_here"
}
}
}
}
}
在elevenlabs.io/app/settings/api-keys获取你的密钥。
可选(用于fal.ai音乐和音效模型)
"FAL_KEY": "your_fal_key_here"
在fal.ai/dashboard/keys获取你的密钥。
自托管代理
cli.js默认连接到托管代理。如果你想要完全控制——或者需要为vercel.app被屏蔽地区的用户提供服务——你可以从proxy/目录部署自己的实例。
快速部署(Vercel)
cd proxy
npm install
vercel --prod
环境变量
在Vercel项目中设置这些(仪表盘→设置→环境变量):
| 变量 | 必需用于 | 获取位置 |
|---|---|---|
ELEVENLABS_API_KEY |
TTS、音效、语音克隆 | elevenlabs.io/app/settings/api-keys |
FAL_KEY |
音乐生成 | fal.ai/dashboard/keys |
VALID_PRO_KEYS |
(可选)限制访问 | 允许的客户端密钥逗号分隔列表 |
将cli.js指向你的代理
export AUDIOMIND_PROXY_URL="https://your-domain.com/api/audio"
或者在~/.openclaw/openclaw.json中设置:
{
"skills": {
"entries": {
"videoagent-audio-studio": {
"env": {
"AUDIOMIND_PROXY_URL": "https://your-domain.com/api/audio"
}
}
}
}
}
自定义域名(推荐)
如果你的用户在中国大陆,请在Vercel仪表盘→设置→域名中绑定自定义域名,以避免vercel.app的DNS问题。
模型参考
| 模型ID | 类型 | 提供商 | 备注 |
|---|---|---|---|
eleven_multilingual_v2 |
TTS | ElevenLabs | 最佳质量,支持29种语言 |
eleven_turbo_v2_5 |
TTS | ElevenLabs | 超低延迟,适合实时 |
eleven_monolingual_v1 |
TTS | ElevenLabs | 仅英语,最快 |
cassetteai-music |
音乐 | fal.ai | 可靠、快速的音乐生成 |
elevenlabs-sfx |
音效 | ElevenLabs | 高质量音效(最长22秒) |
elevenlabs-voice-clone |
克隆 | ElevenLabs | 从短音频样本克隆任何声音 |
更新日志
v3.0.0
- 简化路由表:从主要参考中移除了不稳定/离线的模型。该技能现在只展示可靠工作的模型。
- 更清晰的使用触发条件:添加了“使用时机”部分,以便代理在正确时刻激活此技能。
- 统一设置:只需一个
ELEVENLABS_API_KEY即可开始。FAL_KEY现在是可选的。 - 移除轮询复杂性:音乐生成现在默认使用
cassetteai-music,同步完成。
v2.1.0
- 为长时间运行的音乐生成任务添加了异步工作流。
- 添加了
cassetteai-music作为音乐生成的稳定替代方案。
v2.0.0
- 迁移到ElevenLabs MCP服务器架构。
- 添加了语音克隆支持。
v1.0.0
- 初始版本,包含TTS、音乐和音效路由。






