SKILL.md
readonlyread-only
name
fal-ai-media
description
Unified media generation via fal.ai MCP — image, video, and audio. Covers text-to-image (Nano Banana), text/image-to-video (Seedance, Kling, Veo 3), text-to-speech (CSM-1B), and video-to-audio (ThinkSound). Use when the user wants to generate images, videos, or audio with AI.
fal.ai 媒體生成
容易過時的功能。 fal.ai 的模型 ID、價格、輸入參數和 MCP 工具名稱
變動很快。在承諾特定模型、參數、輸出格式或成本之前,請先搜尋或取得最新的模型資訊。
透過 MCP 使用 fal.ai 模型生成圖片、影片和音訊。
使用時機
- 使用者想要從文字提示生成圖片
- 從文字或圖片建立影片
- 生成語音、音樂或音效
- 任何媒體生成任務
- 使用者說「生成圖片」、「建立影片」、「文字轉語音」、「製作縮圖」或類似內容
MCP 需求
必須設定 fal.ai MCP 伺服器。請在 ~/.claude.json 中加入:
"fal-ai": {
"command": "npx",
"args": ["-y", "fal-ai-mcp-server"],
"env": { "FAL_KEY": "YOUR_FAL_KEY_HERE" }
}
在 fal.ai 取得 API 金鑰。
MCP 工具
fal.ai MCP 提供以下工具:
search— 依關鍵字搜尋可用模型find— 取得模型詳細資訊和參數generate— 使用參數執行模型result— 檢查非同步生成狀態status— 檢查任務狀態cancel— 取消執行中的任務estimate_cost— 估算生成成本models— 列出熱門模型upload— 上傳檔案作為輸入使用
圖片生成
Nano Banana 2(快速)
適用於:快速迭代、草稿、文字轉圖片、圖片編輯。
generate(
app_id: "fal-ai/nano-banana-2",
input_data: {
"prompt": "a futuristic cityscape at sunset, cyberpunk style",
"image_size": "landscape_16_9",
"num_images": 1,
"seed": 42
}
)
Nano Banana Pro(高品質)
適用於:正式圖片、寫實風格、文字排版、詳細提示。
generate(
app_id: "fal-ai/nano-banana-pro",
input_data: {
"prompt": "professional product photo of wireless headphones on marble surface, studio lighting",
"image_size": "square",
"num_images": 1,
"guidance_scale": 7.5
}
)
常見圖片參數
| 參數 | 型別 | 選項 | 說明 |
|---|---|---|---|
prompt |
string | 必填 | 描述你想要的內容 |
image_size |
string | square, portrait_4_3, landscape_16_9, portrait_16_9, landscape_4_3 |
長寬比 |
num_images |
number | 1-4 | 生成數量 |
seed |
number | 任意整數 | 可重現性 |
guidance_scale |
number | 1-20 | 提示遵循程度(越高越忠於提示) |
圖片編輯
使用 Nano Banana 2 搭配輸入圖片進行內補、外擴或風格轉換:
# 先上傳來源圖片
upload(file_path: "/path/to/image.png")
# 然後使用圖片輸入生成
generate(
app_id: "fal-ai/nano-banana-2",
input_data: {
"prompt": "same scene but in watercolor style",
"image_url": "<uploaded_url>",
"image_size": "landscape_16_9"
}
)
影片生成
Seedance 1.0 Pro(字節跳動)
適用於:文字轉影片、圖片轉影片,動作品質高。
generate(
app_id: "fal-ai/seedance-1-0-pro",
input_data: {
"prompt": "a drone flyover of a mountain lake at golden hour, cinematic",
"duration": "5s",
"aspect_ratio": "16:9",
"seed": 42
}
)
Kling Video v3 Pro
適用於:文字/圖片轉影片,支援原生音訊生成。
generate(
app_id: "fal-ai/kling-video/v3/pro",
input_data: {
"prompt": "ocean waves crashing on a rocky coast, dramatic clouds",
"duration": "5s",
"aspect_ratio": "16:9"
}
)
Veo 3(Google DeepMind)
適用於:影片附帶生成音效,視覺品質高。
generate(
app_id: "fal-ai/veo-3",
input_data: {
"prompt": "a bustling Tokyo street market at night, neon signs, crowd noise",
"aspect_ratio": "16:9"
}
)
圖片轉影片
從現有圖片開始:
generate(
app_id: "fal-ai/seedance-1-0-pro",
input_data: {
"prompt": "camera slowly zooms out, gentle wind moves the trees",
"image_url": "<uploaded_image_url>",
"duration": "5s"
}
)
影片參數
| 參數 | 型別 | 選項 | 說明 |
|---|---|---|---|
prompt |
string | 必填 | 描述影片內容 |
duration |
string | "5s", "10s" |
影片長度 |
aspect_ratio |
string | "16:9", "9:16", "1:1" |
畫面比例 |
seed |
number | 任意整數 | 可重現性 |
image_url |
string | URL | 圖片轉影片的來源圖片 |
音訊生成
CSM-1B(對話語音)
文字轉語音,自然且具對話品質。
generate(
app_id: "fal-ai/csm-1b",
input_data: {
"text": "Hello, welcome to the demo. Let me show you how this works.",
"speaker_id": 0
}
)
ThinkSound(影片轉音訊)
從影片內容生成匹配的音訊。
generate(
app_id: "fal-ai/thinksound",
input_data: {
"video_url": "<video_url>",
"prompt": "ambient forest sounds with birds chirping"
}
)
ElevenLabs(透過 API,無 MCP)
如需專業語音合成,可直接使用 ElevenLabs:
import os
import requests
resp = requests.post(
"https://api.elevenlabs.io/v1/text-to-speech/<voice_id>",
headers={
"xi-api-key": os.environ["ELEVENLABS_API_KEY"],
"Content-Type": "application/json"
},
json={
"text": "Your text here",
"model_id": "eleven_turbo_v2_5",
"voice_settings": {"stability": 0.5, "similarity_boost": 0.75}
}
)
with open("output.mp3", "wb") as f:
f.write(resp.content)
VideoDB 生成式音訊
如果已設定 VideoDB,可使用其生成式音訊:
# 語音生成
audio = coll.generate_voice(text="Your narration here", voice="alloy")
# 音樂生成
music = coll.generate_music(prompt="upbeat electronic background music", duration=30)
# 音效
sfx = coll.generate_sound_effect(prompt="thunder crack followed by rain")
成本估算
在生成之前,先檢查預估成本:
estimate_cost(
estimate_type: "unit_price",
endpoints: {
"fal-ai/nano-banana-pro": {
"unit_quantity": 1
}
}
)
模型探索
尋找特定任務的模型:
search(query: "text to video")
find(endpoint_ids: ["fal-ai/seedance-1-0-pro"])
models()
小技巧
- 在迭代提示時使用
seed以獲得可重現的結果 - 先使用低成本模型(Nano Banana 2)進行提示迭代,再切換到 Pro 製作最終成品
- 對於影片,提示要保持描述性但簡潔 — 專注於動作和場景
- 圖片轉影片比純文字轉影片更能產出可控的結果
- 在執行昂貴的影片生成前,先使用
estimate_cost檢查成本
相關技能
videodb— 影片處理、編輯和串流video-editing— AI 驅動的影片編輯工作流程content-engine— 社群平台內容創作






