fal-ai-media

fal-ai-media

熱門

透過 fal.ai MCP 統一生成媒體 — 圖片、影片和音訊。涵蓋文字轉圖片(Nano Banana)、文字/圖片轉影片(Seedance、Kling、Veo 3)、文字轉語音(CSM-1B)以及影片轉音訊(ThinkSound)。當使用者想要用 AI 生成圖片、影片或音訊時使用。

23萬星標
3.5萬分支
更新於 2026/7/17
SKILL.md
readonlyread-only
name
fal-ai-media
description

Unified media generation via fal.ai MCP — image, video, and audio. Covers text-to-image (Nano Banana), text/image-to-video (Seedance, Kling, Veo 3), text-to-speech (CSM-1B), and video-to-audio (ThinkSound). Use when the user wants to generate images, videos, or audio with AI.

fal.ai 媒體生成

容易過時的功能。 fal.ai 的模型 ID、價格、輸入參數和 MCP 工具名稱
變動很快。在承諾特定模型、參數、輸出格式或成本之前,請先搜尋或取得最新的模型資訊。

透過 MCP 使用 fal.ai 模型生成圖片、影片和音訊。

使用時機

  • 使用者想要從文字提示生成圖片
  • 從文字或圖片建立影片
  • 生成語音、音樂或音效
  • 任何媒體生成任務
  • 使用者說「生成圖片」、「建立影片」、「文字轉語音」、「製作縮圖」或類似內容

MCP 需求

必須設定 fal.ai MCP 伺服器。請在 ~/.claude.json 中加入:

"fal-ai": {
  "command": "npx",
  "args": ["-y", "fal-ai-mcp-server"],
  "env": { "FAL_KEY": "YOUR_FAL_KEY_HERE" }
}

fal.ai 取得 API 金鑰。

MCP 工具

fal.ai MCP 提供以下工具:

  • search — 依關鍵字搜尋可用模型
  • find — 取得模型詳細資訊和參數
  • generate — 使用參數執行模型
  • result — 檢查非同步生成狀態
  • status — 檢查任務狀態
  • cancel — 取消執行中的任務
  • estimate_cost — 估算生成成本
  • models — 列出熱門模型
  • upload — 上傳檔案作為輸入使用

圖片生成

Nano Banana 2(快速)

適用於:快速迭代、草稿、文字轉圖片、圖片編輯。

generate(
  app_id: "fal-ai/nano-banana-2",
  input_data: {
    "prompt": "a futuristic cityscape at sunset, cyberpunk style",
    "image_size": "landscape_16_9",
    "num_images": 1,
    "seed": 42
  }
)

Nano Banana Pro(高品質)

適用於:正式圖片、寫實風格、文字排版、詳細提示。

generate(
  app_id: "fal-ai/nano-banana-pro",
  input_data: {
    "prompt": "professional product photo of wireless headphones on marble surface, studio lighting",
    "image_size": "square",
    "num_images": 1,
    "guidance_scale": 7.5
  }
)

常見圖片參數

參數 型別 選項 說明
prompt string 必填 描述你想要的內容
image_size string square, portrait_4_3, landscape_16_9, portrait_16_9, landscape_4_3 長寬比
num_images number 1-4 生成數量
seed number 任意整數 可重現性
guidance_scale number 1-20 提示遵循程度(越高越忠於提示)

圖片編輯

使用 Nano Banana 2 搭配輸入圖片進行內補、外擴或風格轉換:

# 先上傳來源圖片
upload(file_path: "/path/to/image.png")

# 然後使用圖片輸入生成
generate(
  app_id: "fal-ai/nano-banana-2",
  input_data: {
    "prompt": "same scene but in watercolor style",
    "image_url": "<uploaded_url>",
    "image_size": "landscape_16_9"
  }
)

影片生成

Seedance 1.0 Pro(字節跳動)

適用於:文字轉影片、圖片轉影片,動作品質高。

generate(
  app_id: "fal-ai/seedance-1-0-pro",
  input_data: {
    "prompt": "a drone flyover of a mountain lake at golden hour, cinematic",
    "duration": "5s",
    "aspect_ratio": "16:9",
    "seed": 42
  }
)

Kling Video v3 Pro

適用於:文字/圖片轉影片,支援原生音訊生成。

generate(
  app_id: "fal-ai/kling-video/v3/pro",
  input_data: {
    "prompt": "ocean waves crashing on a rocky coast, dramatic clouds",
    "duration": "5s",
    "aspect_ratio": "16:9"
  }
)

Veo 3(Google DeepMind)

適用於:影片附帶生成音效,視覺品質高。

generate(
  app_id: "fal-ai/veo-3",
  input_data: {
    "prompt": "a bustling Tokyo street market at night, neon signs, crowd noise",
    "aspect_ratio": "16:9"
  }
)

圖片轉影片

從現有圖片開始:

generate(
  app_id: "fal-ai/seedance-1-0-pro",
  input_data: {
    "prompt": "camera slowly zooms out, gentle wind moves the trees",
    "image_url": "<uploaded_image_url>",
    "duration": "5s"
  }
)

影片參數

參數 型別 選項 說明
prompt string 必填 描述影片內容
duration string "5s", "10s" 影片長度
aspect_ratio string "16:9", "9:16", "1:1" 畫面比例
seed number 任意整數 可重現性
image_url string URL 圖片轉影片的來源圖片

音訊生成

CSM-1B(對話語音)

文字轉語音,自然且具對話品質。

generate(
  app_id: "fal-ai/csm-1b",
  input_data: {
    "text": "Hello, welcome to the demo. Let me show you how this works.",
    "speaker_id": 0
  }
)

ThinkSound(影片轉音訊)

從影片內容生成匹配的音訊。

generate(
  app_id: "fal-ai/thinksound",
  input_data: {
    "video_url": "<video_url>",
    "prompt": "ambient forest sounds with birds chirping"
  }
)

ElevenLabs(透過 API,無 MCP)

如需專業語音合成,可直接使用 ElevenLabs:

import os
import requests

resp = requests.post(
    "https://api.elevenlabs.io/v1/text-to-speech/<voice_id>",
    headers={
        "xi-api-key": os.environ["ELEVENLABS_API_KEY"],
        "Content-Type": "application/json"
    },
    json={
        "text": "Your text here",
        "model_id": "eleven_turbo_v2_5",
        "voice_settings": {"stability": 0.5, "similarity_boost": 0.75}
    }
)
with open("output.mp3", "wb") as f:
    f.write(resp.content)

VideoDB 生成式音訊

如果已設定 VideoDB,可使用其生成式音訊:

# 語音生成
audio = coll.generate_voice(text="Your narration here", voice="alloy")

# 音樂生成
music = coll.generate_music(prompt="upbeat electronic background music", duration=30)

# 音效
sfx = coll.generate_sound_effect(prompt="thunder crack followed by rain")

成本估算

在生成之前,先檢查預估成本:

estimate_cost(
  estimate_type: "unit_price",
  endpoints: {
    "fal-ai/nano-banana-pro": {
      "unit_quantity": 1
    }
  }
)

模型探索

尋找特定任務的模型:

search(query: "text to video")
find(endpoint_ids: ["fal-ai/seedance-1-0-pro"])
models()

小技巧

  • 在迭代提示時使用 seed 以獲得可重現的結果
  • 先使用低成本模型(Nano Banana 2)進行提示迭代,再切換到 Pro 製作最終成品
  • 對於影片,提示要保持描述性但簡潔 — 專注於動作和場景
  • 圖片轉影片比純文字轉影片更能產出可控的結果
  • 在執行昂貴的影片生成前,先使用 estimate_cost 檢查成本

相關技能

  • videodb — 影片處理、編輯和串流
  • video-editing — AI 驅動的影片編輯工作流程
  • content-engine — 社群平台內容創作