kling-3-0

kling-3-0

在 RunComfy 上使用 Kling 3.0 生成视频。Kling 3.0(也称 Kling V3.0)是快手科技的第三代多镜头视频模型,支持原生同步音频和跨镜头一致的角色身份。此技能涵盖所有六个 Kling 3.0 端点,跨越三个渲染层级(标准、专业、4K)和两种模式(文生视频、图生视频)。通过本地 RunComfy CLI 调用 runcomfy run kling/kling-3.0/<tier>/<mode>。触发词包括“kling”、“kling 3.0”、“kling v3”、“kling pro”、“kling 4k”、“kling text to video”、“kling image to video”,或任何明确要求使用 Kling 3.0 生成或动画的请求。

2Star
2Fork
更新于 2026/6/18
SKILL.md
readonly只读
name
kling-3-0
description

在 RunComfy 上使用 Kling 3.0 生成视频。Kling 3.0(也称 Kling V3.0)是快手科技的第三代多镜头视频模型,支持原生同步音频和跨镜头一致的角色身份。此技能涵盖所有六个 Kling 3.0 端点,跨越三个渲染层级(标准、专业、4K)和 两种模式(文生视频、图生视频)。通过本地 RunComfy CLI 调用 runcomfy run kling/kling-3.0/<tier>/<mode>。触发词包括 "kling", "kling 3.0", "kling v3", "kling pro", "kling 4k", "kling text to video", "kling image to video",或任何明确要求使用 Kling 3.0 生成或动画的请求。

Kling 3.0 - RunComfy 专业包

runcomfy.com · 文档 · GitHub

Kling 3.0 是快手科技的第三代电影级视频模型。此技能涵盖 RunComfy 上所有六个 Kling 3.0 渲染端点:三个质量层级(标准、专业、4K)和两种模式(文生视频和图生视频)。

Kling 3.0 是什么

Kling 3.0 是 Kling 视频模型的 V3 代。它生成多镜头电影级视频,具有同步原生音频、跨镜头一致的角色身份以及符合物理规律的运动。与 Kling 2.x 相比,Kling 3.0 支持更长的片段(最长 15 秒)、4K 层级的原生 4K 输出,以及统一的多提示片段系统,允许一次 Kling 3.0 生成包含多个不同场景并控制过渡。

Kling 3.0 在 RunComfy 上提供三个渲染层级,每个层级均可作为文生视频或图生视频使用:

  • 标准 - 最便宜的层级,最高 1080p 输出。使用 Kling 3.0 标准版进行快速迭代、预览、A/B 变体和社交媒体短片。
  • 专业 - 1080p 下最高保真度。在运动真实感和身份保留最为重要的场景下,使用 Kling V3.0 专业版生成高质量 1080p 片段。
  • 4K - 原生 3840x2160 输出。使用 Kling V3.0 4K 版生成高分辨率品牌影片、大屏幕电影级序列以及原生分辨率的成品母版。

所有三个层级共享相同的 Kling 3.0 多镜头架构。层级在分辨率上限、运动保真度预算和定价上有所不同。

6 个 Kling 3.0 端点

每个端点对应一个(层级,模式)对。所有六个端点共享相同的 Kling 3.0 基础模型。

端点 锚点 分辨率 价格(无音频) 价格(含音频)
kling/kling-3.0/standard/text-to-video Kling 3.0 标准版 t2v 最高 1080p $0.084/秒 $0.126/秒
kling/kling-3.0/standard/image-to-video Kling 3.0 标准版图生视频 最高 1080p $0.084/秒 $0.126/秒
kling/kling-3.0/pro/text-to-video Kling V3.0 专业版文生视频 1080p $0.112/秒 $0.168/秒
kling/kling-3.0/pro/image-to-video Kling V3.0 专业版图生视频 1080p $0.112/秒 $0.168/秒
kling/kling-3.0/4k/text-to-video Kling V3.0 4K 文生视频 3840x2160 $0.42/秒固定 $0.42/秒固定
kling/kling-3.0/4k/image-to-video Kling V3.0 4K 图生视频 3840x2160 $0.42/秒固定 $0.42/秒固定

4K 层级无论是否启用音频,价格相同。标准和专业层级在启用音频时,每秒价格增加约 50%。

何时选择哪个 Kling 3.0 层级

根据输出在流程中的角色选择 Kling 3.0 层级。

  • 草稿、预览、社交媒体短片、A/B 变体:Kling 3.0 标准版。最便宜。除主镜头外,质量足够。
  • 主镜头 1080p 片段、广告创意、高运动保真度的说话人物:Kling V3.0 专业版。比标准版贵约 33%,但在相同分辨率下运动更紧密、身份保持更佳。
  • 4K 品牌影片、大屏幕电影级、成品母版:Kling V3.0 4K 版。原生 3840x2160(无放大步骤)。固定 $0.42/秒使预算可预测。仅在输出确实需要 4K 时使用——成本约为标准版的 5 倍。

根据是否有源图像选择模式:

  • 文生视频(t2v):仅提示词,Kling 3.0 从头生成外观。对于新颖场景、全新构图、无现有参考的环境,使用 Kling 3.0 t2v。
  • 图生视频(i2v):提示词 + 源图像,Kling 3.0 对图像进行动画处理。当有精确参考(人脸、产品、场景)且必须保留到输出中时,使用 Kling 3.0 i2v。

如果用户明确要求 Kling 3.0、Kling V3.0、Kling Pro 或 Kling 4K,则路由到此技能。

前提条件

  1. RunComfy CLInpm i -g @runcomfy/cli
  2. RunComfy 账户runcomfy login 打开浏览器设备码流程。
  3. CI / 容器:设置 RUNCOMFY_TOKEN=<token> 代替 runcomfy login
  4. 对于 i2v 端点:一个可公开获取的源图像 URL(HTTPS,JPEG/PNG/WebP)。

输入模式(所有 6 个 Kling 3.0 端点共享)

字段 类型 必填 默认值 说明
prompt string - 场景、运动、镜头、氛围的文字描述。通过 prompt_segments 支持多片段提示,用于一次 Kling 3.0 生成中的场景过渡。
image_url string 是(仅 i2v) - Kling 3.0 i2v 的源图像。HTTPS URL。JPEG/PNG/WebP。
tail_image_url string 否(仅 i2v) - 可选的结束图像,用于控制 Kling 3.0 i2v 的起始到结束帧过渡。
negative_prompt string - 要从 Kling 3.0 输出中排除的元素。
duration int 5 每次 Kling 3.0 生成 3-15 秒。
aspect_ratio enum 16:9 16:9, 9:16, 1:1, 4:3, 3:4, 21:9
cfg_scale float 0.5 提示引导强度。越高表示对提示的遵循越严格。
generate_audio bool false 启用 Kling 3.0 通道内同步音频。在标准和专业层级增加成本;4K 层级固定费率。
seed int - 用于 Kling 3.0 变体测试的可复现性。

如何调用每个 Kling 3.0 端点

Kling 3.0 标准版文生视频(最便宜的 1080p 草稿):

runcomfy run kling/kling-3.0/standard/text-to-video \
  --input '{
    "prompt": "<Kling 3.0 提示>",
    "duration": 5,
    "aspect_ratio": "16:9"
  }' \
  --output-dir <绝对路径>

Kling 3.0 标准版图生视频(动画化静态图像):

runcomfy run kling/kling-3.0/standard/image-to-video \
  --input '{
    "prompt": "<Kling 3.0 i2v 的运动描述>",
    "image_url": "https://.../source.jpg",
    "duration": 5
  }' \
  --output-dir <绝对路径>

Kling V3.0 专业版文生视频(最高 1080p 保真度):

runcomfy run kling/kling-3.0/pro/text-to-video \
  --input '{
    "prompt": "<Kling 3.0 专业版提示>",
    "duration": 8,
    "aspect_ratio": "16:9",
    "generate_audio": true
  }' \
  --output-dir <绝对路径>

Kling V3.0 专业版图生视频(从源图像生成主镜头动画):

runcomfy run kling/kling-3.0/pro/image-to-video \
  --input '{
    "prompt": "<Kling V3.0 专业版 i2v 的运动描述>",
    "image_url": "https://.../subject.jpg",
    "duration": 8,
    "generate_audio": true
  }' \
  --output-dir <绝对路径>

Kling V3.0 4K 文生视频(原生 4K 电影级):

runcomfy run kling/kling-3.0/4k/text-to-video \
  --input '{
    "prompt": "<Kling V3.0 4K 提示>",
    "duration": 10,
    "aspect_ratio": "16:9",
    "generate_audio": true
  }' \
  --output-dir <绝对路径>

Kling V3.0 4K 图生视频(参考图像的 4K 动画):

runcomfy run kling/kling-3.0/4k/image-to-video \
  --input '{
    "prompt": "<Kling V3.0 4K i2v 的运动描述>",
    "image_url": "https://.../source-4k.jpg",
    "duration": 10,
    "generate_audio": true
  }' \
  --output-dir <绝对路径>

CLI 提交 Kling 3.0 请求,每 2 秒轮询一次,获取结果,并将任何 *.runcomfy.net / *.runcomfy.com URL 下载到 --output-dir

Kling 3.0 提示技巧——有效的方法

Kling 3.0 对特定提示模式反应更好,而非简单的散文描述。

以运动和镜头语言开头。 Kling 3.0 将“广角镜头,缓慢推进”、“跟拍镜头,低角度”、“手持跟随”视为真实指令。将这些放在前面。

一次 Kling 3.0 生成中的多镜头。 单个 Kling 3.0 提示可以描述一系列镜头。对它们进行编号:“镜头 1:黄昏时咖啡馆的广角。镜头 2:咖啡师的中景特写。镜头 3:浓缩咖啡注入的特写。”Kling 3.0 将在镜头间保留身份(面部、服装、道具)。

i2v 的身份锚点。 使用 Kling 3.0 i2v 时,重申应保持稳定的内容:“保持主体的面部、姿势和服装不变;仅镜头移动和背景变化。”

tail_image_url 用于受控的结尾。 在 Kling 3.0 i2v 上,提供尾部图像以锁定最后一帧。Kling 3.0 将从源图像到尾部图像插值运动。

generate_audio: true 用于一次性对话。 描述 Kling 3.0 应在音频中生成的内容:“温暖友好的语气,英语画外音”或“城市氛围,远处交通声,无对话”。音频在标准/专业层级增加成本;4K 层级固定费率。

cfg_scale 调整。 默认 0.5 适用于大多数 Kling 3.0 提示。对于风格化输出,提高到 0.7-0.9 以严格遵循提示。对于松散提示下的自然运动,降低到 0.3-0.4。

反模式:

  • 在一个 Kling 3.0 提示中包含冲突的风格提示 -> 简化,选择一个或两个风格锚点。
  • 在一次 Kling 3.0 调用中要求超过 15 秒 -> 422 错误;分割脚本并拼接。
  • 使用支持范围之外的长宽比 -> 被拒绝。
  • 对于 Kling V3.0 4K,要求激进的多镜头故事加 15 秒加对话加 6 个剪辑 -> Kling 3.0 可以完成,但成本升至约 $6.30 每次生成。先用标准版验证。

Kling 3.0 的亮点

用例 最佳 Kling 3.0 端点
具有一致角色的电影级 1080p 品牌故事 Kling V3.0 专业版(t2v 或 i2v)
原生 4K 主镜头影片和大屏幕电影级 Kling V3.0 4K(t2v 或 i2v)
廉价迭代、社交媒体优先短片、A/B 变体 Kling 3.0 标准版 t2v
动画化品牌资产、产品照片、角色艺术 Kling 3.0 标准版 i2v 或 Kling V3.0 专业版 i2v
一次性生成带同步对话的多镜头广告 Kling V3.0 专业版,启用 generate_audio: true
带原生音频的高级 4K 成品母版 Kling V3.0 4K,启用 generate_audio: true(固定费率)

示例 Kling 3.0 提示

Kling 3.0 电影级多镜头(推荐专业版):

一对年轻美国夫妇在烛光屋顶餐厅庆祝结婚纪念日的电影级多镜头。
镜头 1:黄金时刻城市天际线的广角。镜头 2:中景双人镜头,夫妇举杯。
镜头 3:女人微笑的特写,柔和散景,温暖补光。
微弱的氛围弦乐,轻柔的风,远处交通声。

Kling 3.0 i2v(动画化肖像,4K 层级):

从源图像开始,镜头缓慢推进主体。微弱的呼吸运动,身份稳定的特征,
柔和的自然光,浅景深。背景:温暖的金色时刻光芒,尘埃颗粒缓慢飘动。
无对话,仅环境房间音。

Kling 3.0 竖屏短片(标准版,9:16):

9:16 竖屏。一位穿黑色围裙的咖啡师正在萃取单份浓缩咖啡,
蒸汽在晨光中升腾,丰富的油脂慢慢形成。手持特写,浅景深,
温暖的咖啡馆氛围和蒸汽棒的嘶嘶声。

Kling 3.0 常见问题

Kling 3.0 片段的最大时长是多少? 所有三个层级每次生成最长 15 秒。对于更长的叙事,将脚本分割为多个 Kling 3.0 调用并拼接。

Kling V3.0 4K 与标准和专业版相比如何定价? Kling V3.0 4K 固定 $0.42/秒,无论是否启用音频。标准版无音频为 $0.084/秒(最便宜)。专业版无音频为 $0.112/秒。4K 层级成本约为标准版的 5 倍,以获得分辨率升级。

Kling 3.0 是否支持单次生成中的多镜头? 是的。所有 Kling 3.0 端点都接受多片段提示。对镜头进行编号(“镜头 1:”、“镜头 2:”等),Kling 3.0 将在镜头间保留角色身份。

Kling 3.0 能否生成音频? 是的。设置 generate_audio: true。Kling 3.0 在同一生成通道中生成同步对话、环境音和音乐。在 4K 层级,价格保持 $0.42/秒固定;在标准/专业层级,启用音频后价格跳升约 50%。

Kling 3.0 支持哪些长宽比? 16:9、9:16、1:1、4:3、3:4、21:9。4K 层级将 21:9 渲染为宽银幕裁剪,原生 3840x2160。

Kling 3.0 i2v 是否支持尾部图像? 是的。tail_image_url 锁定最后一帧;Kling 3.0 从源图像到尾部图像插值运动。

Kling 3.0 与 Kling 2.x 有何不同? Kling 3.0 具有更强的多镜头身份保留、更长的最大时长(15 秒 vs 2.x 旗舰版的 10 秒)、4K 层级的原生 4K,以及所有层级统一的多个提示片段输入。

限制

  • 每次调用时长上限 15 秒,适用于所有 Kling 3.0 层级。
  • 一次 Kling 3.0 4K 生成中最多 6 个连续镜头
  • i2v 需要可公开获取的 HTTPS 图像 URL。 不支持本地文件。
  • 长宽比固定为文档中列出的六种。其他比例将被裁剪或拒绝。
  • 4K 输出文件很大。 在批量运行 Kling V3.0 4K 之前,规划磁盘和带宽。

退出码

runcomfy CLI 使用 sysexits 风格代码:

代码 含义
0 Kling 3.0 生成成功
64 CLI 参数错误
65 Kling 3.0 输入 JSON 错误 / 模式不匹配
69 上游 5xx 错误
75 可重试:超时 / 429
77 未登录或令牌被拒绝

完整参考:docs.runcomfy.com/cli/troubleshooting

工作原理

  1. 技能根据用户意图的层级(标准/专业/4K)和模式(t2v/i2v)选择六个 Kling 3.0 端点之一。
  2. 它调用 runcomfy run kling/kling-3.0/<tier>/<mode>,并附带符合模式的 JSON 体。
  3. CLI 使用用户的 bearer 令牌向 RunComfy 模型 API 发送 POST 请求。
  4. 模型 API 返回一个 request_id;CLI 每 2 秒轮询一次,直到 Kling 3.0 生成完成。
  5. 在终端状态上,CLI 获取 Kling 3.0 结果,并将任何 .runcomfy.net / .runcomfy.com URL 下载到 --output-dir
  6. Ctrl-C 在计费前取消正在进行的 Kling 3.0 请求。

安全与隐私

  • 令牌存储runcomfy login 将 API 令牌写入 ~/.config/runcomfy/token.json,权限为 0600。在 CI/容器中设置 RUNCOMFY_TOKEN 环境变量。
  • 输入边界:Kling 3.0 提示通过 --input 以 JSON 形式传递。CLI 不会进行 shell 扩展。无 shell 注入风险。
  • 第三方内容:您传递的图像 URL 由 RunComfy 服务器获取,而非您机器上的 CLI。将外部 URL 视为不可信;基于图像的提示注入是任何接受图像输入的视频模型的已知风险。
  • 出站端点:仅 model-api.runcomfy.net(请求提交)和 *.runcomfy.net / *.runcomfy.com(下载白名单)。
  • 生成文件大小上限:CLI 会中止任何大于 2 GiB 的单个下载,以防止失控的 Kling 3.0 4K 输出填满磁盘。