
kling-3-0
在 RunComfy 上使用 Kling 3.0 生成视频。Kling 3.0(也称 Kling V3.0)是快手科技的第三代多镜头视频模型,支持原生同步音频和跨镜头一致的角色身份。此技能涵盖所有六个 Kling 3.0 端点,跨越三个渲染层级(标准、专业、4K)和两种模式(文生视频、图生视频)。通过本地 RunComfy CLI 调用 runcomfy run kling/kling-3.0/<tier>/<mode>。触发词包括“kling”、“kling 3.0”、“kling v3”、“kling pro”、“kling 4k”、“kling text to video”、“kling image to video”,或任何明确要求使用 Kling 3.0 生成或动画的请求。
在 RunComfy 上使用 Kling 3.0 生成视频。Kling 3.0(也称 Kling V3.0)是快手科技的第三代多镜头视频模型,支持原生同步音频和跨镜头一致的角色身份。此技能涵盖所有六个 Kling 3.0 端点,跨越三个渲染层级(标准、专业、4K)和 两种模式(文生视频、图生视频)。通过本地 RunComfy CLI 调用 runcomfy run kling/kling-3.0/<tier>/<mode>。触发词包括 "kling", "kling 3.0", "kling v3", "kling pro", "kling 4k", "kling text to video", "kling image to video",或任何明确要求使用 Kling 3.0 生成或动画的请求。
Kling 3.0 - RunComfy 专业包
runcomfy.com · 文档 · GitHub
Kling 3.0 是快手科技的第三代电影级视频模型。此技能涵盖 RunComfy 上所有六个 Kling 3.0 渲染端点:三个质量层级(标准、专业、4K)和两种模式(文生视频和图生视频)。
Kling 3.0 是什么
Kling 3.0 是 Kling 视频模型的 V3 代。它生成多镜头电影级视频,具有同步原生音频、跨镜头一致的角色身份以及符合物理规律的运动。与 Kling 2.x 相比,Kling 3.0 支持更长的片段(最长 15 秒)、4K 层级的原生 4K 输出,以及统一的多提示片段系统,允许一次 Kling 3.0 生成包含多个不同场景并控制过渡。
Kling 3.0 在 RunComfy 上提供三个渲染层级,每个层级均可作为文生视频或图生视频使用:
- 标准 - 最便宜的层级,最高 1080p 输出。使用 Kling 3.0 标准版进行快速迭代、预览、A/B 变体和社交媒体短片。
- 专业 - 1080p 下最高保真度。在运动真实感和身份保留最为重要的场景下,使用 Kling V3.0 专业版生成高质量 1080p 片段。
- 4K - 原生 3840x2160 输出。使用 Kling V3.0 4K 版生成高分辨率品牌影片、大屏幕电影级序列以及原生分辨率的成品母版。
所有三个层级共享相同的 Kling 3.0 多镜头架构。层级在分辨率上限、运动保真度预算和定价上有所不同。
6 个 Kling 3.0 端点
每个端点对应一个(层级,模式)对。所有六个端点共享相同的 Kling 3.0 基础模型。
| 端点 | 锚点 | 分辨率 | 价格(无音频) | 价格(含音频) |
|---|---|---|---|---|
kling/kling-3.0/standard/text-to-video |
Kling 3.0 标准版 t2v | 最高 1080p | $0.084/秒 | $0.126/秒 |
kling/kling-3.0/standard/image-to-video |
Kling 3.0 标准版图生视频 | 最高 1080p | $0.084/秒 | $0.126/秒 |
kling/kling-3.0/pro/text-to-video |
Kling V3.0 专业版文生视频 | 1080p | $0.112/秒 | $0.168/秒 |
kling/kling-3.0/pro/image-to-video |
Kling V3.0 专业版图生视频 | 1080p | $0.112/秒 | $0.168/秒 |
kling/kling-3.0/4k/text-to-video |
Kling V3.0 4K 文生视频 | 3840x2160 | $0.42/秒固定 | $0.42/秒固定 |
kling/kling-3.0/4k/image-to-video |
Kling V3.0 4K 图生视频 | 3840x2160 | $0.42/秒固定 | $0.42/秒固定 |
4K 层级无论是否启用音频,价格相同。标准和专业层级在启用音频时,每秒价格增加约 50%。
何时选择哪个 Kling 3.0 层级
根据输出在流程中的角色选择 Kling 3.0 层级。
- 草稿、预览、社交媒体短片、A/B 变体:Kling 3.0 标准版。最便宜。除主镜头外,质量足够。
- 主镜头 1080p 片段、广告创意、高运动保真度的说话人物:Kling V3.0 专业版。比标准版贵约 33%,但在相同分辨率下运动更紧密、身份保持更佳。
- 4K 品牌影片、大屏幕电影级、成品母版:Kling V3.0 4K 版。原生 3840x2160(无放大步骤)。固定 $0.42/秒使预算可预测。仅在输出确实需要 4K 时使用——成本约为标准版的 5 倍。
根据是否有源图像选择模式:
- 文生视频(t2v):仅提示词,Kling 3.0 从头生成外观。对于新颖场景、全新构图、无现有参考的环境,使用 Kling 3.0 t2v。
- 图生视频(i2v):提示词 + 源图像,Kling 3.0 对图像进行动画处理。当有精确参考(人脸、产品、场景)且必须保留到输出中时,使用 Kling 3.0 i2v。
如果用户明确要求 Kling 3.0、Kling V3.0、Kling Pro 或 Kling 4K,则路由到此技能。
前提条件
- RunComfy CLI:
npm i -g @runcomfy/cli - RunComfy 账户:
runcomfy login打开浏览器设备码流程。 - CI / 容器:设置
RUNCOMFY_TOKEN=<token>代替runcomfy login。 - 对于 i2v 端点:一个可公开获取的源图像 URL(HTTPS,JPEG/PNG/WebP)。
输入模式(所有 6 个 Kling 3.0 端点共享)
| 字段 | 类型 | 必填 | 默认值 | 说明 |
|---|---|---|---|---|
prompt |
string | 是 | - | 场景、运动、镜头、氛围的文字描述。通过 prompt_segments 支持多片段提示,用于一次 Kling 3.0 生成中的场景过渡。 |
image_url |
string | 是(仅 i2v) | - | Kling 3.0 i2v 的源图像。HTTPS URL。JPEG/PNG/WebP。 |
tail_image_url |
string | 否(仅 i2v) | - | 可选的结束图像,用于控制 Kling 3.0 i2v 的起始到结束帧过渡。 |
negative_prompt |
string | 否 | - | 要从 Kling 3.0 输出中排除的元素。 |
duration |
int | 否 | 5 | 每次 Kling 3.0 生成 3-15 秒。 |
aspect_ratio |
enum | 否 | 16:9 |
16:9, 9:16, 1:1, 4:3, 3:4, 21:9。 |
cfg_scale |
float | 否 | 0.5 | 提示引导强度。越高表示对提示的遵循越严格。 |
generate_audio |
bool | 否 | false | 启用 Kling 3.0 通道内同步音频。在标准和专业层级增加成本;4K 层级固定费率。 |
seed |
int | 否 | - | 用于 Kling 3.0 变体测试的可复现性。 |
如何调用每个 Kling 3.0 端点
Kling 3.0 标准版文生视频(最便宜的 1080p 草稿):
runcomfy run kling/kling-3.0/standard/text-to-video \
--input '{
"prompt": "<Kling 3.0 提示>",
"duration": 5,
"aspect_ratio": "16:9"
}' \
--output-dir <绝对路径>
Kling 3.0 标准版图生视频(动画化静态图像):
runcomfy run kling/kling-3.0/standard/image-to-video \
--input '{
"prompt": "<Kling 3.0 i2v 的运动描述>",
"image_url": "https://.../source.jpg",
"duration": 5
}' \
--output-dir <绝对路径>
Kling V3.0 专业版文生视频(最高 1080p 保真度):
runcomfy run kling/kling-3.0/pro/text-to-video \
--input '{
"prompt": "<Kling 3.0 专业版提示>",
"duration": 8,
"aspect_ratio": "16:9",
"generate_audio": true
}' \
--output-dir <绝对路径>
Kling V3.0 专业版图生视频(从源图像生成主镜头动画):
runcomfy run kling/kling-3.0/pro/image-to-video \
--input '{
"prompt": "<Kling V3.0 专业版 i2v 的运动描述>",
"image_url": "https://.../subject.jpg",
"duration": 8,
"generate_audio": true
}' \
--output-dir <绝对路径>
Kling V3.0 4K 文生视频(原生 4K 电影级):
runcomfy run kling/kling-3.0/4k/text-to-video \
--input '{
"prompt": "<Kling V3.0 4K 提示>",
"duration": 10,
"aspect_ratio": "16:9",
"generate_audio": true
}' \
--output-dir <绝对路径>
Kling V3.0 4K 图生视频(参考图像的 4K 动画):
runcomfy run kling/kling-3.0/4k/image-to-video \
--input '{
"prompt": "<Kling V3.0 4K i2v 的运动描述>",
"image_url": "https://.../source-4k.jpg",
"duration": 10,
"generate_audio": true
}' \
--output-dir <绝对路径>
CLI 提交 Kling 3.0 请求,每 2 秒轮询一次,获取结果,并将任何 *.runcomfy.net / *.runcomfy.com URL 下载到 --output-dir。
Kling 3.0 提示技巧——有效的方法
Kling 3.0 对特定提示模式反应更好,而非简单的散文描述。
以运动和镜头语言开头。 Kling 3.0 将“广角镜头,缓慢推进”、“跟拍镜头,低角度”、“手持跟随”视为真实指令。将这些放在前面。
一次 Kling 3.0 生成中的多镜头。 单个 Kling 3.0 提示可以描述一系列镜头。对它们进行编号:“镜头 1:黄昏时咖啡馆的广角。镜头 2:咖啡师的中景特写。镜头 3:浓缩咖啡注入的特写。”Kling 3.0 将在镜头间保留身份(面部、服装、道具)。
i2v 的身份锚点。 使用 Kling 3.0 i2v 时,重申应保持稳定的内容:“保持主体的面部、姿势和服装不变;仅镜头移动和背景变化。”
tail_image_url 用于受控的结尾。 在 Kling 3.0 i2v 上,提供尾部图像以锁定最后一帧。Kling 3.0 将从源图像到尾部图像插值运动。
generate_audio: true 用于一次性对话。 描述 Kling 3.0 应在音频中生成的内容:“温暖友好的语气,英语画外音”或“城市氛围,远处交通声,无对话”。音频在标准/专业层级增加成本;4K 层级固定费率。
cfg_scale 调整。 默认 0.5 适用于大多数 Kling 3.0 提示。对于风格化输出,提高到 0.7-0.9 以严格遵循提示。对于松散提示下的自然运动,降低到 0.3-0.4。
反模式:
- 在一个 Kling 3.0 提示中包含冲突的风格提示 -> 简化,选择一个或两个风格锚点。
- 在一次 Kling 3.0 调用中要求超过 15 秒 -> 422 错误;分割脚本并拼接。
- 使用支持范围之外的长宽比 -> 被拒绝。
- 对于 Kling V3.0 4K,要求激进的多镜头故事加 15 秒加对话加 6 个剪辑 -> Kling 3.0 可以完成,但成本升至约 $6.30 每次生成。先用标准版验证。
Kling 3.0 的亮点
| 用例 | 最佳 Kling 3.0 端点 |
|---|---|
| 具有一致角色的电影级 1080p 品牌故事 | Kling V3.0 专业版(t2v 或 i2v) |
| 原生 4K 主镜头影片和大屏幕电影级 | Kling V3.0 4K(t2v 或 i2v) |
| 廉价迭代、社交媒体优先短片、A/B 变体 | Kling 3.0 标准版 t2v |
| 动画化品牌资产、产品照片、角色艺术 | Kling 3.0 标准版 i2v 或 Kling V3.0 专业版 i2v |
| 一次性生成带同步对话的多镜头广告 | Kling V3.0 专业版,启用 generate_audio: true |
| 带原生音频的高级 4K 成品母版 | Kling V3.0 4K,启用 generate_audio: true(固定费率) |
示例 Kling 3.0 提示
Kling 3.0 电影级多镜头(推荐专业版):
一对年轻美国夫妇在烛光屋顶餐厅庆祝结婚纪念日的电影级多镜头。
镜头 1:黄金时刻城市天际线的广角。镜头 2:中景双人镜头,夫妇举杯。
镜头 3:女人微笑的特写,柔和散景,温暖补光。
微弱的氛围弦乐,轻柔的风,远处交通声。
Kling 3.0 i2v(动画化肖像,4K 层级):
从源图像开始,镜头缓慢推进主体。微弱的呼吸运动,身份稳定的特征,
柔和的自然光,浅景深。背景:温暖的金色时刻光芒,尘埃颗粒缓慢飘动。
无对话,仅环境房间音。
Kling 3.0 竖屏短片(标准版,9:16):
9:16 竖屏。一位穿黑色围裙的咖啡师正在萃取单份浓缩咖啡,
蒸汽在晨光中升腾,丰富的油脂慢慢形成。手持特写,浅景深,
温暖的咖啡馆氛围和蒸汽棒的嘶嘶声。
Kling 3.0 常见问题
Kling 3.0 片段的最大时长是多少? 所有三个层级每次生成最长 15 秒。对于更长的叙事,将脚本分割为多个 Kling 3.0 调用并拼接。
Kling V3.0 4K 与标准和专业版相比如何定价? Kling V3.0 4K 固定 $0.42/秒,无论是否启用音频。标准版无音频为 $0.084/秒(最便宜)。专业版无音频为 $0.112/秒。4K 层级成本约为标准版的 5 倍,以获得分辨率升级。
Kling 3.0 是否支持单次生成中的多镜头? 是的。所有 Kling 3.0 端点都接受多片段提示。对镜头进行编号(“镜头 1:”、“镜头 2:”等),Kling 3.0 将在镜头间保留角色身份。
Kling 3.0 能否生成音频? 是的。设置 generate_audio: true。Kling 3.0 在同一生成通道中生成同步对话、环境音和音乐。在 4K 层级,价格保持 $0.42/秒固定;在标准/专业层级,启用音频后价格跳升约 50%。
Kling 3.0 支持哪些长宽比? 16:9、9:16、1:1、4:3、3:4、21:9。4K 层级将 21:9 渲染为宽银幕裁剪,原生 3840x2160。
Kling 3.0 i2v 是否支持尾部图像? 是的。tail_image_url 锁定最后一帧;Kling 3.0 从源图像到尾部图像插值运动。
Kling 3.0 与 Kling 2.x 有何不同? Kling 3.0 具有更强的多镜头身份保留、更长的最大时长(15 秒 vs 2.x 旗舰版的 10 秒)、4K 层级的原生 4K,以及所有层级统一的多个提示片段输入。
限制
- 每次调用时长上限 15 秒,适用于所有 Kling 3.0 层级。
- 一次 Kling 3.0 4K 生成中最多 6 个连续镜头。
- i2v 需要可公开获取的 HTTPS 图像 URL。 不支持本地文件。
- 长宽比固定为文档中列出的六种。其他比例将被裁剪或拒绝。
- 4K 输出文件很大。 在批量运行 Kling V3.0 4K 之前,规划磁盘和带宽。
退出码
runcomfy CLI 使用 sysexits 风格代码:
| 代码 | 含义 |
|---|---|
| 0 | Kling 3.0 生成成功 |
| 64 | CLI 参数错误 |
| 65 | Kling 3.0 输入 JSON 错误 / 模式不匹配 |
| 69 | 上游 5xx 错误 |
| 75 | 可重试:超时 / 429 |
| 77 | 未登录或令牌被拒绝 |
完整参考:docs.runcomfy.com/cli/troubleshooting。
工作原理
- 技能根据用户意图的层级(标准/专业/4K)和模式(t2v/i2v)选择六个 Kling 3.0 端点之一。
- 它调用
runcomfy run kling/kling-3.0/<tier>/<mode>,并附带符合模式的 JSON 体。 - CLI 使用用户的 bearer 令牌向 RunComfy 模型 API 发送 POST 请求。
- 模型 API 返回一个
request_id;CLI 每 2 秒轮询一次,直到 Kling 3.0 生成完成。 - 在终端状态上,CLI 获取 Kling 3.0 结果,并将任何
.runcomfy.net/.runcomfy.comURL 下载到--output-dir。 Ctrl-C在计费前取消正在进行的 Kling 3.0 请求。
安全与隐私
- 令牌存储:
runcomfy login将 API 令牌写入~/.config/runcomfy/token.json,权限为 0600。在 CI/容器中设置RUNCOMFY_TOKEN环境变量。 - 输入边界:Kling 3.0 提示通过
--input以 JSON 形式传递。CLI 不会进行 shell 扩展。无 shell 注入风险。 - 第三方内容:您传递的图像 URL 由 RunComfy 服务器获取,而非您机器上的 CLI。将外部 URL 视为不可信;基于图像的提示注入是任何接受图像输入的视频模型的已知风险。
- 出站端点:仅
model-api.runcomfy.net(请求提交)和*.runcomfy.net/*.runcomfy.com(下载白名单)。 - 生成文件大小上限:CLI 会中止任何大于 2 GiB 的单个下载,以防止失控的 Kling 3.0 4K 输出填满磁盘。





