kling-3-0

kling-3-0

>

21星標
9分支
更新於 2026/6/16
SKILL.md
唯讀
名稱
kling-3-0
描述

>

Kling 3.0 - Pro Pack on RunComfy

runcomfy.com · docs · GitHub

Kling 3.0 是快手科技第三代電影級影片模型。此技能涵蓋 RunComfy 上所有六個 Kling 3.0 渲染端點:三個品質層級(Standard、Pro、4K)搭配兩種模式(文字轉影片、圖片轉影片)。

Kling 3.0 是什麼

Kling 3.0 是 Kling 影片模型的 V3 世代。它能夠產出多鏡頭電影級影片,具備原生同步音訊、跨鏡頭一致的角色身份,以及符合物理法則的動態。相較於 Kling 2.x,Kling 3.0 支援更長的片段(最長 15 秒)、4K 層級的原生 4K 輸出,以及統一的多元提示段落系統,讓單次 Kling 3.0 生成可以包含多個不同場景並控制轉場。

Kling 3.0 在 RunComfy 上提供三個渲染層級,每個層級都有文字轉影片與圖片轉影片兩種模式:

  • Standard - 最便宜的層級,最高 1080p 輸出。適合快速迭代、預覽、A/B 測試、社群短片。
  • Pro - 1080p 最高畫質。適合需要動態真實感與身份保留的英雄級 1080p 片段。
  • 4K - 原生 3840x2160 輸出。適合高解析度品牌影片、大螢幕電影級序列,以及原生解析度的最終成品。

三個層級共用相同的 Kling 3.0 多鏡頭架構。差異在於解析度上限、動態保真度預算與價格。

六個 Kling 3.0 端點

每個端點對應一個(層級, 模式)組合。所有六個端點共用相同的 Kling 3.0 基礎模型。

端點 錨點 解析度 價格(無音訊) 價格(含音訊)
kling/kling-3.0/standard/text-to-video Kling 3.0 Standard t2v 最高 1080p $0.084/秒 $0.126/秒
kling/kling-3.0/standard/image-to-video Kling 3.0 Standard 圖片轉影片 最高 1080p $0.084/秒 $0.126/秒
kling/kling-3.0/pro/text-to-video Kling V3.0 Pro 文字轉影片 1080p $0.112/秒 $0.168/秒
kling/kling-3.0/pro/image-to-video Kling V3.0 Pro 圖片轉影片 1080p $0.112/秒 $0.168/秒
kling/kling-3.0/4k/text-to-video Kling V3.0 4K 文字轉影片 3840x2160 $0.42/秒固定 $0.42/秒固定
kling/kling-3.0/4k/image-to-video Kling V3.0 4K 圖片轉影片 3840x2160 $0.42/秒固定 $0.42/秒固定

4K 層級價格固定,不因音訊與否而異。Standard 與 Pro 層級啟用音訊時每秒價格約增加 50%。

何時選擇哪個 Kling 3.0 層級

根據輸出在流程中的角色選擇 Kling 3.0 層級。

  • 草稿、預覽、社群短片、A/B 測試:Kling 3.0 Standard。最便宜。除了英雄鏡頭外品質足夠。
  • 英雄級 1080p 片段、廣告創意、高動態保真度的 talking head:Kling V3.0 Pro。比 Standard 貴約 33%,但在相同解析度下動態與身份保留明顯更佳。
  • 4K 品牌影片、大螢幕電影級、最終成品:Kling V3.0 4K。原生 3840x2160(無需放大步驟)。固定 $0.42/秒讓預算可預測。僅在輸出確實需要 4K 時使用——成本約為 Standard 的 5 倍。

根據是否有來源圖片選擇模式:

  • 文字轉影片(t2v):僅提示詞,Kling 3.0 從頭生成畫面。適合全新場景、全新構圖、無現有參考的環境。
  • 圖片轉影片(i2v):提示詞 + 來源圖片,Kling 3.0 將圖片動畫化。適合有明確參考(臉部、產品、場景)且必須保留在輸出中的情況。

如果使用者明確要求 Kling 3.0、Kling V3.0、Kling Pro 或 Kling 4K,則路由至此技能。

前置需求

  1. RunComfy CLInpm i -g @runcomfy/cli
  2. RunComfy 帳號runcomfy login 會開啟瀏覽器裝置碼流程。
  3. CI / 容器:設定 RUNCOMFY_TOKEN=<token> 取代 runcomfy login
  4. i2v 端點:需要一個可公開存取的來源圖片 URL(HTTPS,JPEG/PNG/WebP)。

輸入結構(所有六個 Kling 3.0 端點共用)

欄位 型別 必填 預設值 備註
prompt string - 場景、動態、鏡頭、氛圍的文字描述。可透過 prompt_segments 支援多段落提示詞,在單次 Kling 3.0 生成中實現場景轉換。
image_url string 是(僅 i2v) - Kling 3.0 i2v 的來源圖片。HTTPS URL。JPEG/PNG/WebP。
tail_image_url string 否(僅 i2v) - 可選的結尾圖片,用於控制 Kling 3.0 i2v 從起始到結束的幀轉換。
negative_prompt string - 要從 Kling 3.0 輸出中排除的元素。
duration int 5 每次 Kling 3.0 生成 3-15 秒。
aspect_ratio enum 16:9 16:99:161:14:33:421:9
cfg_scale float 0.5 提示詞引導強度。數值越高表示更嚴格遵循提示詞。
generate_audio bool false 啟用 Kling 3.0 同步音訊。Standard 和 Pro 層級會增加成本;4K 層級為固定費率。
seed int - 用於 Kling 3.0 變體測試的可重現性。

如何呼叫每個 Kling 3.0 端點

Kling 3.0 Standard 文字轉影片(最便宜的 1080p 草稿):

runcomfy run kling/kling-3.0/standard/text-to-video \
  --input '{
    "prompt": "<Kling 3.0 提示詞>",
    "duration": 5,
    "aspect_ratio": "16:9"
  }' \
  --output-dir <絕對路徑>

Kling 3.0 Standard 圖片轉影片(將靜態圖片動畫化):

runcomfy run kling/kling-3.0/standard/image-to-video \
  --input '{
    "prompt": "<Kling 3.0 i2v 的動態描述>",
    "image_url": "https://.../source.jpg",
    "duration": 5
  }' \
  --output-dir <絕對路徑>

Kling V3.0 Pro 文字轉影片(最高 1080p 畫質):

runcomfy run kling/kling-3.0/pro/text-to-video \
  --input '{
    "prompt": "<Kling 3.0 Pro 提示詞>",
    "duration": 8,
    "aspect_ratio": "16:9",
    "generate_audio": true
  }' \
  --output-dir <絕對路徑>

Kling V3.0 Pro 圖片轉影片(從來源圖片進行英雄級動畫):

runcomfy run kling/kling-3.0/pro/image-to-video \
  --input '{
    "prompt": "<Kling V3.0 Pro i2v 的動態描述>",
    "image_url": "https://.../subject.jpg",
    "duration": 8,
    "generate_audio": true
  }' \
  --output-dir <絕對路徑>

Kling V3.0 4K 文字轉影片(原生 4K 電影級):

runcomfy run kling/kling-3.0/4k/text-to-video \
  --input '{
    "prompt": "<Kling V3.0 4K 提示詞>",
    "duration": 10,
    "aspect_ratio": "16:9",
    "generate_audio": true
  }' \
  --output-dir <絕對路徑>

Kling V3.0 4K 圖片轉影片(參考圖片的 4K 動畫):

runcomfy run kling/kling-3.0/4k/image-to-video \
  --input '{
    "prompt": "<Kling V3.0 4K i2v 的動態描述>",
    "image_url": "https://.../source-4k.jpg",
    "duration": 10,
    "generate_audio": true
  }' \
  --output-dir <絕對路徑>

CLI 會提交 Kling 3.0 請求,每 2 秒輪詢一次,取得結果,並將任何 *.runcomfy.net / *.runcomfy.com URL 下載到 --output-dir

Kling 3.0 提示技巧 - 有效做法

Kling 3.0 對特定提示模式的反應比單純敘述更好。

以動態和鏡頭語言開頭。 Kling 3.0 會將「廣角鏡頭、緩慢推進」、「跟拍鏡頭、低角度」、「手持跟隨」視為實際指令。請將這些放在前面。

單次 Kling 3.0 生成中的多鏡頭。 單一 Kling 3.0 提示詞可以描述一系列鏡頭。為它們編號:「鏡頭 1:黃昏時咖啡館的廣角。鏡頭 2:咖啡師的中景特寫。鏡頭 3:濃縮咖啡注入的特寫。」Kling 3.0 會跨鏡頭保留身份(臉部、服裝、道具)。

i2v 的身份錨點。 使用 Kling 3.0 i2v 時,重申應保持穩定的內容:「保留主體的臉部、姿勢和服裝;僅鏡頭移動和背景改變。」

tail_image_url 用於控制結尾。 在 Kling 3.0 i2v 中,提供結尾圖片以鎖定最終幀。Kling 3.0 會從來源到結尾插值動態。

generate_audio: true 用於一次性對話。 描述 Kling 3.0 應產生的音訊:「溫暖友善的語調、英語旁白」或「城市氛圍、遠處車流、無對話」。Standard/Pro 層級音訊會增加成本;4K 為固定費率。

cfg_scale 調整。 預設 0.5 適用於大多數 Kling 3.0 提示詞。對於風格化輸出,提高至 0.7-0.9 以嚴格遵循提示詞。對於寬鬆提示詞,降低至 0.3-0.4 以獲得自然動態。

反模式:

  • 在單一 Kling 3.0 提示詞中加入衝突的風格線索 -> 簡化,選擇一兩個風格錨點。
  • 要求單次 Kling 3.0 呼叫超過 15 秒 -> 422 錯誤;請分段腳本並拼接。
  • 使用不支援的長寬比 -> 被拒絕。
  • 對於 Kling V3.0 4K,要求激進的多鏡頭故事加上 15 秒加上對話加上 6 個剪輯 -> Kling 3.0 可以做到,但成本會升至每次生成約 $6.30。建議先用 Standard 驗證。

Kling 3.0 的強項

使用案例 最佳 Kling 3.0 端點
具有一致角色的電影級 1080p 品牌故事 Kling V3.0 Pro(t2v 或 i2v)
原生 4K 英雄影片與大螢幕電影級 Kling V3.0 4K(t2v 或 i2v)
低成本迭代、社群優先短片、A/B 測試 Kling 3.0 Standard t2v
將品牌素材、產品照片、角色藝術動畫化 Kling 3.0 Standard i2v 或 Kling V3.0 Pro i2v
一次性生成多鏡頭廣告並同步對話 Kling V3.0 Pro 搭配 generate_audio: true
具有原生音訊的高階 4K 最終成品 Kling V3.0 4K 搭配 generate_audio: true(固定費率)

Kling 3.0 提示範例

Kling 3.0 電影級多鏡頭(建議 Pro 層級):

一對年輕美國夫婦在燭光屋頂餐廳慶祝週年紀念的電影級多鏡頭。
鏡頭 1:金色時刻城市天際線的廣角。鏡頭 2:中景雙人鏡頭,夫婦舉杯。
鏡頭 3:女子微笑的特寫,柔和的散景,溫暖的補光。
輕柔的環境弦樂,微風,遠處車流聲。

Kling 3.0 i2v(將肖像動畫化,4K 層級):

從來源圖片對主體進行緩慢的推軌鏡頭。
微弱的呼吸動態,身份穩定的特徵,柔和自然光,
淺景深。背景:溫暖的金色時刻光暈,緩慢飄動的灰塵微粒。
無對話,僅環境室內音。

Kling 3.0 垂直短片(Standard 層級,9:16):

9:16 垂直。一位穿黑色圍裙的咖啡師正在萃取單份濃縮咖啡,
蒸氣在晨光中升起,豐富的 crema 緩慢形成。
手持特寫,淺景深,溫暖的咖啡館氛圍和蒸氣棒的嘶嘶聲。

Kling 3.0 常見問題

Kling 3.0 片段的最大長度是多少? 所有三個層級每次生成最長 15 秒。對於更長的敘事,請將腳本分段為多個 Kling 3.0 呼叫並拼接。

Kling V3.0 4K 與 Standard 和 Pro 相比如何定價? Kling V3.0 4K 固定為每秒 $0.42,無論是否啟用音訊。Standard 無音訊為 $0.084/秒(最便宜)。Pro 無音訊為 $0.112/秒。4K 層級的成本約為 Standard 的 5 倍,以換取解析度升級。

Kling 3.0 是否支援單次生成中的多鏡頭? 是。所有 Kling 3.0 端點都接受多段落提示詞。為鏡頭編號(「鏡頭 1:」、「鏡頭 2:」等),Kling 3.0 會跨鏡頭保留角色身份。

Kling 3.0 可以生成音訊嗎? 可以。設定 generate_audio: true。Kling 3.0 會在相同生成過程中產生同步對話、環境音和音樂。4K 層級價格固定為 $0.42/秒;Standard/Pro 層級啟用音訊後價格約增加 50%。

Kling 3.0 支援哪些長寬比? 16:9、9:16、1:1、4:3、3:4、21:9。4K 層級會將 21:9 渲染為原生 3840x2160 的寬銀幕裁切。

Kling 3.0 i2v 是否支援結尾圖片? 是。tail_image_url 鎖定最終幀;Kling 3.0 會從來源到結尾插值動態。

Kling 3.0 與 Kling 2.x 有何不同? Kling 3.0 具有更強的多鏡頭身份保留、更長的最大時長(15 秒 vs 2.x 旗艦的 10 秒)、4K 層級的原生 4K,以及所有層級統一的多元提示段落輸入。

限制

  • 每次呼叫時長上限 15 秒,適用於所有 Kling 3.0 層級。
  • 單次 Kling 3.0 4K 生成最多 6 個連續鏡頭
  • i2v 需要可公開存取的 HTTPS 圖片 URL。不支援本地檔案。
  • 長寬比固定為文件中的六種。其他比例會被裁切或拒絕。
  • 4K 輸出檔案很大。在批次執行 Kling V3.0 4K 前請規劃磁碟和頻寬。

退出碼

runcomfy CLI 使用 sysexits 風格的代碼:

代碼 意義
0 Kling 3.0 生成成功
64 CLI 參數錯誤
65 Kling 3.0 輸入 JSON 錯誤 / 結構不符
69 上游 5xx 錯誤
75 可重試:超時 / 429
77 未登入或 token 被拒絕

完整參考:docs.runcomfy.com/cli/troubleshooting

運作方式

  1. 技能根據使用者的層級(Standard / Pro / 4K)和模式(t2v / i2v)意圖,選擇六個 Kling 3.0 端點之一。
  2. 它使用符合結構的 JSON 主體呼叫 runcomfy run kling/kling-3.0/<tier>/<mode>
  3. CLI 使用使用者的 bearer token 向 RunComfy Model API 發送 POST 請求。
  4. Model API 返回 request_id;CLI 每 2 秒輪詢一次,直到 Kling 3.0 生成完成。
  5. 在終端狀態下,CLI 取得 Kling 3.0 結果並將任何 .runcomfy.net / .runcomfy.com URL 下載到 --output-dir
  6. Ctrl-C 可在計費前取消進行中的 Kling 3.0 請求。

安全性與隱私

  • Token 儲存runcomfy login 將 API token 寫入 ~/.config/runcomfy/token.json,權限設為 0600。在 CI / 容器中設定 RUNCOMFY_TOKEN 環境變數。
  • 輸入邊界:Kling 3.0 提示詞透過 --input 以 JSON 傳遞。CLI 不會進行 shell 展開。無 shell 注入風險。
  • 第三方內容:您傳遞的圖片 URL 由 RunComfy 伺服器擷取,而非您機器上的 CLI。請將外部 URL 視為不可信任;基於圖片的提示詞注入是任何接受圖片輸入的影片模型的已知風險。
  • 對外端點:僅 model-api.runcomfy.net(請求提交)和 *.runcomfy.net / *.runcomfy.com(下載白名單)。
  • 生成檔案大小上限:CLI 會中止任何大於 2 GiB 的單一下載,以防止失控的 Kling 3.0 4K 輸出耗盡磁碟空間。