fal-ai-media

fal-ai-media

热门

通过 fal.ai MCP 统一生成媒体内容——图像、视频和音频。涵盖文生图(Nano Banana)、文/图生视频(Seedance、Kling、Veo 3)、文本转语音(CSM-1B)以及视频转音频(ThinkSound)。当用户希望使用 AI 生成图像、视频或音频时使用。

23万Star
3.5万Fork
更新于 2026/7/17
SKILL.md
readonly只读
name
fal-ai-media
description

通过 fal.ai MCP 统一生成媒体内容——图像、视频和音频。涵盖文生图(Nano Banana)、文/图生视频(Seedance、Kling、Veo 3)、文本转语音(CSM-1B)以及视频转音频(ThinkSound)。当用户希望使用 AI 生成图像、视频或音频时使用。

fal.ai 媒体生成

易过时技能。 fal.ai 的模型 ID、定价、输入参数和 MCP 工具名称
变化很快。在承诺特定模型、参数、输出格式或成本之前,请先搜索或获取当前模型元数据。

通过 MCP 使用 fal.ai 模型生成图像、视频和音频。

何时激活

  • 用户希望根据文本提示生成图像
  • 从文本或图像创建视频
  • 生成语音、音乐或音效
  • 任何媒体生成任务
  • 用户说“生成图像”、“创建视频”、“文本转语音”、“制作缩略图”或类似内容

MCP 要求

必须配置 fal.ai MCP 服务器。添加到 ~/.claude.json

"fal-ai": {
  "command": "npx",
  "args": ["-y", "fal-ai-mcp-server"],
  "env": { "FAL_KEY": "YOUR_FAL_KEY_HERE" }
}

fal.ai 获取 API 密钥。

MCP 工具

fal.ai MCP 提供以下工具:

  • search — 按关键词搜索可用模型
  • find — 获取模型详情和参数
  • generate — 使用参数运行模型
  • result — 检查异步生成状态
  • status — 检查任务状态
  • cancel — 取消正在运行的任务
  • estimate_cost — 估算生成成本
  • models — 列出热门模型
  • upload — 上传文件作为输入

图像生成

Nano Banana 2(快速)

最适合:快速迭代、草稿、文生图、图像编辑。

generate(
  app_id: "fal-ai/nano-banana-2",
  input_data: {
    "prompt": "日落时分的未来城市景观,赛博朋克风格",
    "image_size": "landscape_16_9",
    "num_images": 1,
    "seed": 42
  }
)

Nano Banana Pro(高保真)

最适合:成品图像、写实、排版、详细提示。

generate(
  app_id: "fal-ai/nano-banana-pro",
  input_data: {
    "prompt": "专业产品照片,无线耳机放在大理石表面上,影棚灯光",
    "image_size": "square",
    "num_images": 1,
    "guidance_scale": 7.5
  }
)

通用图像参数

参数 类型 选项 说明
prompt string 必填 描述你想要的内容
image_size string square, portrait_4_3, landscape_16_9, portrait_16_9, landscape_4_3 宽高比
num_images number 1-4 生成数量
seed number 任意整数 可复现性
guidance_scale number 1-20 遵循提示的程度(越高越严格)

图像编辑

使用 Nano Banana 2 并输入图像进行内补、外补或风格迁移:

# 首先上传源图像
upload(file_path: "/path/to/image.png")

# 然后使用图像输入生成
generate(
  app_id: "fal-ai/nano-banana-2",
  input_data: {
    "prompt": "相同场景但水彩风格",
    "image_url": "<uploaded_url>",
    "image_size": "landscape_16_9"
  }
)

视频生成

Seedance 1.0 Pro(字节跳动)

最适合:文生视频、图生视频,运动质量高。

generate(
  app_id: "fal-ai/seedance-1-0-pro",
  input_data: {
    "prompt": "黄金时段无人机飞越山间湖泊,电影感",
    "duration": "5s",
    "aspect_ratio": "16:9",
    "seed": 42
  }
)

Kling Video v3 Pro

最适合:文/图生视频,支持原生音频生成。

generate(
  app_id: "fal-ai/kling-video/v3/pro",
  input_data: {
    "prompt": "海浪拍打岩石海岸,戏剧性的云层",
    "duration": "5s",
    "aspect_ratio": "16:9"
  }
)

Veo 3(Google DeepMind)

最适合:带生成声音的视频,视觉质量高。

generate(
  app_id: "fal-ai/veo-3",
  input_data: {
    "prompt": "夜晚繁忙的东京街头市场,霓虹灯,人群嘈杂",
    "aspect_ratio": "16:9"
  }
)

图生视频

从现有图像开始:

generate(
  app_id: "fal-ai/seedance-1-0-pro",
  input_data: {
    "prompt": "镜头缓慢拉远,微风拂动树木",
    "image_url": "<uploaded_image_url>",
    "duration": "5s"
  }
)

视频参数

参数 类型 选项 说明
prompt string 必填 描述视频内容
duration string "5s", "10s" 视频长度
aspect_ratio string "16:9", "9:16", "1:1" 画面比例
seed number 任意整数 可复现性
image_url string URL 图生视频的源图像

音频生成

CSM-1B(对话式语音)

文本转语音,自然对话质量。

generate(
  app_id: "fal-ai/csm-1b",
  input_data: {
    "text": "你好,欢迎来到演示。让我向你展示这是如何工作的。",
    "speaker_id": 0
  }
)

ThinkSound(视频转音频)

从视频内容生成匹配的音频。

generate(
  app_id: "fal-ai/thinksound",
  input_data: {
    "video_url": "<video_url>",
    "prompt": "森林环境音,伴有鸟鸣"
  }
)

ElevenLabs(通过 API,无 MCP)

对于专业语音合成,直接使用 ElevenLabs:

import os
import requests

resp = requests.post(
    "https://api.elevenlabs.io/v1/text-to-speech/<voice_id>",
    headers={
        "xi-api-key": os.environ["ELEVENLABS_API_KEY"],
        "Content-Type": "application/json"
    },
    json={
        "text": "你的文本在这里",
        "model_id": "eleven_turbo_v2_5",
        "voice_settings": {"stability": 0.5, "similarity_boost": 0.75}
    }
)
with open("output.mp3", "wb") as f:
    f.write(resp.content)

VideoDB 生成式音频

如果配置了 VideoDB,使用其生成式音频:

# 语音生成
audio = coll.generate_voice(text="你的旁白在这里", voice="alloy")

# 音乐生成
music = coll.generate_music(prompt="欢快的电子背景音乐", duration=30)

# 音效
sfx = coll.generate_sound_effect(prompt="雷声炸裂后下雨")

成本估算

在生成之前,检查估算成本:

estimate_cost(
  estimate_type: "unit_price",
  endpoints: {
    "fal-ai/nano-banana-pro": {
      "unit_quantity": 1
    }
  }
)

模型发现

查找特定任务的模型:

search(query: "text to video")
find(endpoint_ids: ["fal-ai/seedance-1-0-pro"])
models()

提示

  • 使用 seed 在迭代提示时获得可复现的结果
  • 从低成本模型(Nano Banana 2)开始进行提示迭代,然后切换到 Pro 用于最终成品
  • 对于视频,保持提示描述性但简洁——专注于运动和场景
  • 图生视频比纯文生视频产生更可控的结果
  • 在运行昂贵的视频生成之前检查 estimate_cost

相关技能

  • videodb — 视频处理、编辑和流媒体
  • video-editing — AI 驱动的视频编辑工作流
  • content-engine — 社交媒体平台的内容创作