厭倦了同時管理多個音訊 API 嗎?這個技能讓你用一個指令就能使用 TTS、音樂生成、音效和語音克隆。當你想生成任何音訊卻不想管理多組 API 金鑰時,就用這個技能。
🎙️ VideoAgent Audio Studio
使用時機: 使用者要求生成語音、朗讀文字、製作旁白、創作音樂或產生音效。
VideoAgent Audio Studio 是一個智慧音訊調度器。它會分析你的請求,並將其路由到最佳可用模型——ElevenLabs 負責語音和音樂,fal.ai 負責快速音效——然後回傳一個可直接使用的音訊網址。
快速參考
| 請求類型 | 最佳模型 | 延遲 |
|---|---|---|
| 朗讀文字 / 旁白 | elevenlabs-tts-v3 |
~3 秒 |
| 低延遲 TTS(即時) | elevenlabs-tts-turbo |
<1 秒 |
| 背景音樂 | cassetteai-music |
~15 秒 |
| 音效 | elevenlabs-sfx |
~5 秒 |
| 從音訊克隆語音 | elevenlabs-voice-clone |
~10 秒 |
如何使用
1. 啟動 AudioMind 伺服器(每次工作階段一次)
bash {baseDir}/tools/start_server.sh
這會在連接埠 8124 啟動 ElevenLabs MCP 伺服器。技能會透過它進行所有音訊生成。
2. 路由請求
分析使用者的請求,並透過 MCP 伺服器呼叫適當的工具:
文字轉語音(TTS)
當使用者要求「朗讀」、「唸出來」、「說」或「製作旁白」時:
使用 MCP 工具:text_to_speech
text: "<要朗讀的文字>"
voice_id: "JBFqnCBsd6RMkjVDRZzb" # 預設:「George」(專業、中性)
model_id: "eleven_multilingual_v2" # 低延遲請用 "eleven_turbo_v2_5"
音樂生成
當使用者要求「作曲」、「創作背景音樂」或「製作配樂」時:
使用 MCP 工具:text_to_sound_effects (透過 fal.ai 上的 cassetteai-music)
prompt: "<音樂描述,例如 'upbeat lo-fi hip hop, 90 seconds'>"
duration_seconds: <持續時間>
音效(SFX)
當使用者要求特定聲音(例如「門吱呀作響」、「雨打窗戶」)時:
使用 MCP 工具:text_to_sound_effects
text: "<聲音描述>"
duration_seconds: <1-22>
語音克隆
當使用者提供音訊樣本並想克隆該語音時:
使用 MCP 工具:voice_add
name: "<語音名稱>"
files: ["<音訊檔案網址>"]
對話範例
使用者:「幫我朗讀這段文字:歡迎來到我們的產品發表會」
→ 路由到:text_to_speech
text: "Welcome to our product launch"
voice_id: "JBFqnCBsd6RMkjVDRZzb"
model_id: "eleven_multilingual_v2"
🎙️ 旁白完成!點此收聽
使用者:「為 podcast 生成 60 秒的放鬆背景音樂」
→ 路由到:cassetteai-music (fal.ai)
prompt: "relaxing lo-fi background music for a podcast, gentle piano and soft beats, 60 seconds"
duration_seconds: 60
🎵 背景音樂準備好了!點此收聽
使用者:「生成一個科幻風格的開門音效」
→ 路由到:text_to_sound_effects
text: "a futuristic sci-fi door sliding open with a hydraulic hiss"
duration_seconds: 3
設定
必要設定
在 ~/.openclaw/openclaw.json 中設定 ELEVENLABS_API_KEY:
{
"skills": {
"entries": {
"videoagent-audio-studio": {
"enabled": true,
"env": {
"ELEVENLABS_API_KEY": "your_elevenlabs_key_here"
}
}
}
}
}
在 elevenlabs.io/app/settings/api-keys 取得你的金鑰。
選用設定(用於 fal.ai 音樂與音效模型)
"FAL_KEY": "your_fal_key_here"
在 fal.ai/dashboard/keys 取得你的金鑰。
自行託管代理
cli.js 預設連接到託管代理。如果你想完全掌控——或者需要服務於 vercel.app 被封鎖的地區的使用者——你可以從 proxy/ 目錄部署自己的實例。
快速部署(Vercel)
cd proxy
npm install
vercel --prod
環境變數
在 Vercel 專案中設定這些變數(儀表板 → 設定 → 環境變數):
| 變數 | 用途 | 取得方式 |
|---|---|---|
ELEVENLABS_API_KEY |
TTS、SFX、語音克隆 | elevenlabs.io/app/settings/api-keys |
FAL_KEY |
音樂生成 | fal.ai/dashboard/keys |
VALID_PRO_KEYS |
(選用)限制存取 | 允許的客戶端金鑰,以逗號分隔 |
將 cli.js 指向你的代理
export AUDIOMIND_PROXY_URL="https://your-domain.com/api/audio"
或者在 ~/.openclaw/openclaw.json 中設定:
{
"skills": {
"entries": {
"videoagent-audio-studio": {
"env": {
"AUDIOMIND_PROXY_URL": "https://your-domain.com/api/audio"
}
}
}
}
}
自訂網域(建議)
如果你的使用者在中國大陸,請在 Vercel 儀表板 → 設定 → 網域中綁定自訂網域,以避免 vercel.app 的 DNS 問題。
模型參考
| 模型 ID | 類型 | 提供者 | 備註 |
|---|---|---|---|
eleven_multilingual_v2 |
TTS | ElevenLabs | 最佳品質,支援 29 種語言 |
eleven_turbo_v2_5 |
TTS | ElevenLabs | 超低延遲,適合即時應用 |
eleven_monolingual_v1 |
TTS | ElevenLabs | 僅英文,速度最快 |
cassetteai-music |
音樂 | fal.ai | 可靠、快速的音樂生成 |
elevenlabs-sfx |
音效 | ElevenLabs | 高品質音效(最長 22 秒) |
elevenlabs-voice-clone |
克隆 | ElevenLabs | 從短音訊樣本克隆任何語音 |
更新日誌
v3.0.0
- 簡化路由表:從主要參考中移除不穩定/離線模型。技能現在只顯示穩定運作的模型。
- 更明確的使用時機:新增「使用時機」區塊,讓代理能在正確時機啟用此技能。
- 統一設定:只需一個
ELEVENLABS_API_KEY即可開始使用。FAL_KEY現在為選用。 - 移除輪詢複雜性:音樂生成現在預設使用
cassetteai-music,同步完成。
v2.1.0
- 為長時間運行的音樂生成任務新增非同步工作流程。
- 新增
cassetteai-music作為音樂生成的穩定替代方案。
v2.0.0
- 遷移至 ElevenLabs MCP 伺服器架構。
- 新增語音克隆支援。
v1.0.0
- 初始版本,提供 TTS、音樂和音效路由。






