videoagent-audio-studio

videoagent-audio-studio

熱門

厭倦了同時管理多個音訊 API 嗎?這個技能讓你用一個指令就能使用 TTS、音樂生成、音效和語音克隆。當你想生成任何音訊卻不想管理多組 API 金鑰時,就用這個技能。

751星標
35分支
更新於 2026/7/20
SKILL.md
readonlyread-only
name
videoagent-audio-studio
description

厭倦了同時管理多個音訊 API 嗎?這個技能讓你用一個指令就能使用 TTS、音樂生成、音效和語音克隆。當你想生成任何音訊卻不想管理多組 API 金鑰時,就用這個技能。

version
3.0.0

🎙️ VideoAgent Audio Studio

使用時機: 使用者要求生成語音、朗讀文字、製作旁白、創作音樂或產生音效。

VideoAgent Audio Studio 是一個智慧音訊調度器。它會分析你的請求,並將其路由到最佳可用模型——ElevenLabs 負責語音和音樂,fal.ai 負責快速音效——然後回傳一個可直接使用的音訊網址。


快速參考

請求類型 最佳模型 延遲
朗讀文字 / 旁白 elevenlabs-tts-v3 ~3 秒
低延遲 TTS(即時) elevenlabs-tts-turbo <1 秒
背景音樂 cassetteai-music ~15 秒
音效 elevenlabs-sfx ~5 秒
從音訊克隆語音 elevenlabs-voice-clone ~10 秒

如何使用

1. 啟動 AudioMind 伺服器(每次工作階段一次)

bash {baseDir}/tools/start_server.sh

這會在連接埠 8124 啟動 ElevenLabs MCP 伺服器。技能會透過它進行所有音訊生成。

2. 路由請求

分析使用者的請求,並透過 MCP 伺服器呼叫適當的工具:

文字轉語音(TTS)

當使用者要求「朗讀」、「唸出來」、「說」或「製作旁白」時:

使用 MCP 工具:text_to_speech
  text: "<要朗讀的文字>"
  voice_id: "JBFqnCBsd6RMkjVDRZzb"   # 預設:「George」(專業、中性)
  model_id: "eleven_multilingual_v2"   # 低延遲請用 "eleven_turbo_v2_5"

音樂生成

當使用者要求「作曲」、「創作背景音樂」或「製作配樂」時:

使用 MCP 工具:text_to_sound_effects  (透過 fal.ai 上的 cassetteai-music)
  prompt: "<音樂描述,例如 'upbeat lo-fi hip hop, 90 seconds'>"
  duration_seconds: <持續時間>

音效(SFX)

當使用者要求特定聲音(例如「門吱呀作響」、「雨打窗戶」)時:

使用 MCP 工具:text_to_sound_effects
  text: "<聲音描述>"
  duration_seconds: <1-22>

語音克隆

當使用者提供音訊樣本並想克隆該語音時:

使用 MCP 工具:voice_add
  name: "<語音名稱>"
  files: ["<音訊檔案網址>"]

對話範例

使用者:「幫我朗讀這段文字:歡迎來到我們的產品發表會」

→ 路由到:text_to_speech
  text: "Welcome to our product launch"
  voice_id: "JBFqnCBsd6RMkjVDRZzb"
  model_id: "eleven_multilingual_v2"

🎙️ 旁白完成!點此收聽


使用者:「為 podcast 生成 60 秒的放鬆背景音樂」

→ 路由到:cassetteai-music (fal.ai)
  prompt: "relaxing lo-fi background music for a podcast, gentle piano and soft beats, 60 seconds"
  duration_seconds: 60

🎵 背景音樂準備好了!點此收聽


使用者:「生成一個科幻風格的開門音效」

→ 路由到:text_to_sound_effects
  text: "a futuristic sci-fi door sliding open with a hydraulic hiss"
  duration_seconds: 3

設定

必要設定

~/.openclaw/openclaw.json 中設定 ELEVENLABS_API_KEY

{
  "skills": {
    "entries": {
      "videoagent-audio-studio": {
        "enabled": true,
        "env": {
          "ELEVENLABS_API_KEY": "your_elevenlabs_key_here"
        }
      }
    }
  }
}

elevenlabs.io/app/settings/api-keys 取得你的金鑰。

選用設定(用於 fal.ai 音樂與音效模型)

"FAL_KEY": "your_fal_key_here"

fal.ai/dashboard/keys 取得你的金鑰。


自行託管代理

cli.js 預設連接到託管代理。如果你想完全掌控——或者需要服務於 vercel.app 被封鎖的地區的使用者——你可以從 proxy/ 目錄部署自己的實例。

快速部署(Vercel)

cd proxy
npm install
vercel --prod

環境變數

在 Vercel 專案中設定這些變數(儀表板 → 設定 → 環境變數):

變數 用途 取得方式
ELEVENLABS_API_KEY TTS、SFX、語音克隆 elevenlabs.io/app/settings/api-keys
FAL_KEY 音樂生成 fal.ai/dashboard/keys
VALID_PRO_KEYS (選用)限制存取 允許的客戶端金鑰,以逗號分隔

將 cli.js 指向你的代理

export AUDIOMIND_PROXY_URL="https://your-domain.com/api/audio"

或者在 ~/.openclaw/openclaw.json 中設定:

{
  "skills": {
    "entries": {
      "videoagent-audio-studio": {
        "env": {
          "AUDIOMIND_PROXY_URL": "https://your-domain.com/api/audio"
        }
      }
    }
  }
}

自訂網域(建議)

如果你的使用者在中國大陸,請在 Vercel 儀表板 → 設定 → 網域中綁定自訂網域,以避免 vercel.app 的 DNS 問題。


模型參考

模型 ID 類型 提供者 備註
eleven_multilingual_v2 TTS ElevenLabs 最佳品質,支援 29 種語言
eleven_turbo_v2_5 TTS ElevenLabs 超低延遲,適合即時應用
eleven_monolingual_v1 TTS ElevenLabs 僅英文,速度最快
cassetteai-music 音樂 fal.ai 可靠、快速的音樂生成
elevenlabs-sfx 音效 ElevenLabs 高品質音效(最長 22 秒)
elevenlabs-voice-clone 克隆 ElevenLabs 從短音訊樣本克隆任何語音

更新日誌

v3.0.0

  • 簡化路由表:從主要參考中移除不穩定/離線模型。技能現在只顯示穩定運作的模型。
  • 更明確的使用時機:新增「使用時機」區塊,讓代理能在正確時機啟用此技能。
  • 統一設定:只需一個 ELEVENLABS_API_KEY 即可開始使用。FAL_KEY 現在為選用。
  • 移除輪詢複雜性:音樂生成現在預設使用 cassetteai-music,同步完成。

v2.1.0

  • 為長時間運行的音樂生成任務新增非同步工作流程。
  • 新增 cassetteai-music 作為音樂生成的穩定替代方案。

v2.0.0

  • 遷移至 ElevenLabs MCP 伺服器架構。
  • 新增語音克隆支援。

v1.0.0

  • 初始版本,提供 TTS、音樂和音效路由。