kling-3-0

kling-3-0

>

2星標
1分支
更新於 2026/6/18
SKILL.md
唯讀
名稱
kling-3-0
描述

>

Kling 3.0 - Pro Pack on RunComfy

runcomfy.com · docs · GitHub

Kling 3.0 是快手科技第三代電影級影片模型。此技能涵蓋 RunComfy 上所有六個 Kling 3.0 渲染端點:三個品質層級(Standard、Pro、4K)搭配兩種模式(文字轉影片、圖片轉影片)。

Kling 3.0 是什麼

Kling 3.0 是 Kling 影片模型的 V3 世代。它可產生多鏡頭電影級影片,具備原生同步音訊、跨鏡頭一致的角色身份,以及符合物理的動態。相較於 Kling 2.x,Kling 3.0 支援更長的片段(最長 15 秒)、4K 層級的原生 4K 輸出,以及統一的多元提示片段系統,讓一個 Kling 3.0 生成可包含多個不同場景並控制轉場。

Kling 3.0 在 RunComfy 上提供三個渲染層級,每個層級皆可選擇文字轉影片或圖片轉影片:

  • Standard - 最便宜的層級,輸出最高 1080p。適合快速迭代、預覽、A/B 變體、社群短片。
  • Pro - 1080p 最高保真度。適合需要動態真實感與身份保留的旗艦級 1080p 片段。
  • 4K - 原生 3840x2160 輸出。適合高解析度品牌影片、大螢幕電影級序列,以及原生解析度的最終成品。

三個層級共用相同的 Kling 3.0 多鏡頭架構。層級差異在於解析度上限、動態保真度預算與價格。

6 個 Kling 3.0 端點

每個端點對應一個(層級, 模式)組合。所有六個端點共用相同的 Kling 3.0 基礎模型。

端點 錨點 解析度 費用(無音訊) 費用(含音訊)
kling/kling-3.0/standard/text-to-video Kling 3.0 Standard t2v 最高 1080p $0.084/秒 $0.126/秒
kling/kling-3.0/standard/image-to-video Kling 3.0 Standard Image to Video 最高 1080p $0.084/秒 $0.126/秒
kling/kling-3.0/pro/text-to-video Kling V3.0 Pro Text-to-Video 1080p $0.112/秒 $0.168/秒
kling/kling-3.0/pro/image-to-video Kling V3.0 Pro Image-to-Video 1080p $0.112/秒 $0.168/秒
kling/kling-3.0/4k/text-to-video Kling V3.0 4K Text-to-Video 3840x2160 $0.42/秒固定 $0.42/秒固定
kling/kling-3.0/4k/image-to-video Kling V3.0 4K Image-to-Video 3840x2160 $0.42/秒固定 $0.42/秒固定

4K 層級價格固定,不因音訊與否而異。Standard 與 Pro 層級啟用音訊時每秒費用約增加 50%。

何時選擇哪個 Kling 3.0 層級

根據輸出在流程中的角色選擇 Kling 3.0 層級。

  • 草稿、預覽、社群短片、A/B 變體:Kling 3.0 Standard。最便宜。除了旗艦級鏡頭外,品質已足夠。
  • 旗艦級 1080p 片段、廣告創意、高動態保真度的 talking head:Kling V3.0 Pro。比 Standard 貴約 33%,但在相同解析度下動態與身份保留明顯更佳。
  • 4K 品牌影片、大螢幕電影級、最終成品:Kling V3.0 4K。原生 3840x2160(無需放大步驟)。固定 $0.42/秒,預算易於預測。僅在輸出真正需要 4K 時使用——成本約為 Standard 的 5 倍。

根據是否有來源圖片選擇模式:

  • 文字轉影片(t2v):僅提示詞,Kling 3.0 從頭生成畫面。適合全新場景、全新構圖、無現有參考的環境。
  • 圖片轉影片(i2v):提示詞 + 來源圖片,Kling 3.0 將圖片動畫化。當你有確切參考(臉部、產品、場景)且必須保留在輸出中時使用。

如果使用者明確要求 Kling 3.0、Kling V3.0、Kling Pro 或 Kling 4K,則路由至此技能。

前置需求

  1. RunComfy CLInpm i -g @runcomfy/cli
  2. RunComfy 帳號runcomfy login 會開啟瀏覽器裝置碼流程。
  3. CI / 容器:設定 RUNCOMFY_TOKEN=<token> 取代 runcomfy login
  4. i2v 端點:需要一個可公開存取的來源圖片 URL(HTTPS,JPEG/PNG/WebP)。

輸入結構(所有 6 個 Kling 3.0 端點共用)

欄位 型別 必填 預設值 備註
prompt string - 場景、動態、鏡頭、氛圍的文字描述。可透過 prompt_segments 支援多片段提示,在一個 Kling 3.0 生成中實現場景轉場。
image_url string 是(僅 i2v) - Kling 3.0 i2v 的來源圖片。HTTPS URL。JPEG/PNG/WebP。
tail_image_url string 否(僅 i2v) - 可選的結尾圖片,用於控制 Kling 3.0 i2v 的起點到終點幀轉場。
negative_prompt string - 要從 Kling 3.0 輸出中排除的元素。
duration int 5 每次 Kling 3.0 生成 3-15 秒。
aspect_ratio enum 16:9 16:99:161:14:33:421:9
cfg_scale float 0.5 提示引導強度。越高表示越嚴格遵循提示。
generate_audio bool false 啟用 Kling 3.0 同步音訊。Standard 和 Pro 層級會增加費用;4K 層級為固定費率。
seed int - 用於 Kling 3.0 變體測試的可重現性。

如何呼叫每個 Kling 3.0 端點

Kling 3.0 Standard 文字轉影片(最便宜的 1080p 草稿):

runcomfy run kling/kling-3.0/standard/text-to-video \
  --input '{
    "prompt": "<Kling 3.0 提示>",
    "duration": 5,
    "aspect_ratio": "16:9"
  }' \
  --output-dir <絕對路徑>

Kling 3.0 Standard 圖片轉影片(將靜態圖片動畫化):

runcomfy run kling/kling-3.0/standard/image-to-video \
  --input '{
    "prompt": "<Kling 3.0 i2v 動態描述>",
    "image_url": "https://.../source.jpg",
    "duration": 5
  }' \
  --output-dir <絕對路徑>

Kling V3.0 Pro 文字轉影片(最高 1080p 保真度):

runcomfy run kling/kling-3.0/pro/text-to-video \
  --input '{
    "prompt": "<Kling 3.0 Pro 提示>",
    "duration": 8,
    "aspect_ratio": "16:9",
    "generate_audio": true
  }' \
  --output-dir <絕對路徑>

Kling V3.0 Pro 圖片轉影片(從來源圖片進行旗艦級動畫):

runcomfy run kling/kling-3.0/pro/image-to-video \
  --input '{
    "prompt": "<Kling V3.0 Pro i2v 動態描述>",
    "image_url": "https://.../subject.jpg",
    "duration": 8,
    "generate_audio": true
  }' \
  --output-dir <絕對路徑>

Kling V3.0 4K 文字轉影片(原生 4K 電影級):

runcomfy run kling/kling-3.0/4k/text-to-video \
  --input '{
    "prompt": "<Kling V3.0 4K 提示>",
    "duration": 10,
    "aspect_ratio": "16:9",
    "generate_audio": true
  }' \
  --output-dir <絕對路徑>

Kling V3.0 4K 圖片轉影片(參考圖片的 4K 動畫):

runcomfy run kling/kling-3.0/4k/image-to-video \
  --input '{
    "prompt": "<Kling V3.0 4K i2v 動態描述>",
    "image_url": "https://.../source-4k.jpg",
    "duration": 10,
    "generate_audio": true
  }' \
  --output-dir <絕對路徑>

CLI 會提交 Kling 3.0 請求,每 2 秒輪詢一次,取得結果,並將任何 *.runcomfy.net / *.runcomfy.com URL 下載到 --output-dir

Kling 3.0 提示技巧 - 有效做法

Kling 3.0 對特定提示模式的反應優於單純的散文描述。

以動態和鏡頭語言開頭。 Kling 3.0 會將「廣角鏡頭、緩慢推近」、「跟拍鏡頭、低角度」、「手持跟隨」視為實際指令。將這些放在前面。

單次 Kling 3.0 生成中的多鏡頭。 一個 Kling 3.0 提示可以描述一系列鏡頭。為它們編號:「鏡頭 1:黃昏時咖啡館的廣角。鏡頭 2:咖啡師的中景特寫。鏡頭 3:濃縮咖啡注入的特寫。」Kling 3.0 會在各鏡頭間保留身份(臉部、服裝、道具)。

i2v 的身份錨點。 使用 Kling 3.0 i2v 時,重申應保持穩定的部分:「保留主體的面部、姿勢和服裝;僅鏡頭移動和背景變化。」

tail_image_url 用於控制結尾。 在 Kling 3.0 i2v 中,提供結尾圖片以鎖定最終幀。Kling 3.0 會從來源到結尾插值動態。

generate_audio: true 用於一次性對話。 描述 Kling 3.0 應產生的音訊:「溫暖友善的語氣,英語旁白」或「城市氛圍,遠處車流,無對話」。Standard / Pro 層級啟用音訊會增加費用;4K 層級為固定費率。

cfg_scale 調整。 預設 0.5 適用於大多數 Kling 3.0 提示。對於風格化輸出,提高至 0.7-0.9 以嚴格遵循提示。對於寬鬆提示,降低至 0.3-0.4 以獲得自然動態。

反模式:

  • 在一個 Kling 3.0 提示中加入衝突的風格線索 -> 簡化,選擇一兩個風格錨點。
  • 要求單次 Kling 3.0 呼叫超過 15 秒 -> 422 錯誤;將腳本分段並拼接。
  • 使用不支援的長寬比 -> 被拒絕。
  • 對於 Kling V3.0 4K,要求激進的多鏡頭故事加上 15 秒加上對話加上 6 個剪輯 -> Kling 3.0 會產出,但成本約為每次生成 $6.30。先用 Standard 驗證。

Kling 3.0 的強項

使用案例 最佳 Kling 3.0 端點
角色一致的電影級 1080p 品牌故事 Kling V3.0 Pro(t2v 或 i2v)
原生 4K 旗艦影片與大螢幕電影級 Kling V3.0 4K(t2v 或 i2v)
低成本迭代、社群優先短片、A/B 變體 Kling 3.0 Standard t2v
品牌素材、產品照片、角色藝術的動畫化 Kling 3.0 Standard i2v 或 Kling V3.0 Pro i2v
一次性同步對話的多鏡頭廣告 Kling V3.0 Pro 搭配 generate_audio: true
含原生音訊的高階 4K 最終成品 Kling V3.0 4K 搭配 generate_audio: true(固定費率)

Kling 3.0 提示範例

Kling 3.0 電影級多鏡頭(建議 Pro 層級):

一對年輕美國夫婦在燭光屋頂餐廳慶祝週年紀念的電影級多鏡頭。
鏡頭 1:金色時刻城市天際線的廣角。鏡頭 2:中景雙人鏡頭,
夫婦舉杯。鏡頭 3:女子微笑的特寫,柔和散景,溫暖補光。
微弱的環境弦樂,輕柔的風,遠處的車流聲。

Kling 3.0 i2v(將肖像動畫化,4K 層級):

從來源圖片對主體進行輕柔的攝影機推近。微弱的呼吸動態,
身份穩定的特徵,柔和自然光,淺景深。背景:溫暖的金色時刻
光暈,緩慢飄動的灰塵微粒。無對話,僅環境室內音。

Kling 3.0 垂直短片(Standard 層級,9:16):

9:16 垂直。一位穿著黑色圍裙的咖啡師正在萃取單份濃縮咖啡,
蒸氣在晨光中升起,豐富的 crema 緩慢形成。手持特寫,
淺景深,溫暖的咖啡館氛圍和蒸氣棒的嘶嘶聲。

Kling 3.0 常見問題

Kling 3.0 片段的最大時長是多少? 所有三個層級每次生成最長 15 秒。對於更長的敘事,將腳本分段為多個 Kling 3.0 呼叫並拼接。

Kling V3.0 4K 的價格與 Standard 和 Pro 相比如何? Kling V3.0 4K 固定為每秒 $0.42,無論是否啟用音訊。Standard 無音訊為 $0.084/秒(最便宜)。Pro 無音訊為 $0.112/秒。4K 層級的成本約為 Standard 的 5 倍,以換取解析度升級。

Kling 3.0 是否支援單次生成中的多鏡頭? 是的。所有 Kling 3.0 端點都接受多片段提示。為鏡頭編號(「鏡頭 1:」、「鏡頭 2:」等),Kling 3.0 會在各鏡頭間保留角色身份。

Kling 3.0 可以生成音訊嗎? 可以。設定 generate_audio: true。Kling 3.0 會在相同生成過程中產生同步對話、環境音和音樂。4K 層級價格固定為 $0.42/秒;Standard / Pro 層級啟用音訊後費用約增加 50%。

Kling 3.0 支援哪些長寬比? 16:9、9:16、1:1、4:3、3:4、21:9。4K 層級會將 21:9 渲染為原生 3840x2160 的寬銀幕裁切。

Kling 3.0 i2v 是否支援結尾圖片? 是的。tail_image_url 鎖定最終幀;Kling 3.0 從來源到結尾插值動態。

Kling 3.0 與 Kling 2.x 有何不同? Kling 3.0 具有更強的多鏡頭身份保留、更長的最大時長(15 秒 vs 2.x 旗艦的 10 秒)、4K 層級的原生 4K,以及所有層級統一的多元提示片段輸入。

限制

  • 每次呼叫時長上限 15 秒,適用於所有 Kling 3.0 層級。
  • 單次 Kling 3.0 4K 生成最多 6 個連續鏡頭
  • i2v 需要可公開存取的 HTTPS 圖片 URL。不支援本地檔案。
  • 長寬比固定為文件中的六種。其他比例會被裁切或拒絕。
  • 4K 輸出檔案很大。在批次執行 Kling V3.0 4K 前,請規劃磁碟和頻寬。

退出碼

runcomfy CLI 使用 sysexits 風格的代碼:

代碼 含義
0 Kling 3.0 生成成功
64 CLI 參數錯誤
65 Kling 3.0 輸入 JSON 錯誤 / 結構不符
69 上游 5xx 錯誤
75 可重試:超時 / 429
77 未登入或 token 被拒絕

完整參考:docs.runcomfy.com/cli/troubleshooting

運作方式

  1. 技能根據使用者的層級(Standard / Pro / 4K)和模式(t2v / i2v)意圖,選擇六個 Kling 3.0 端點之一。
  2. 它使用符合結構的 JSON 主體呼叫 runcomfy run kling/kling-3.0/<tier>/<mode>
  3. CLI 使用使用者的 bearer token 向 RunComfy Model API 發送 POST 請求。
  4. Model API 返回 request_id;CLI 每 2 秒輪詢一次,直到 Kling 3.0 生成完成。
  5. 在終端狀態下,CLI 取得 Kling 3.0 結果,並將任何 .runcomfy.net / .runcomfy.com URL 下載到 --output-dir
  6. Ctrl-C 可在計費前取消進行中的 Kling 3.0 請求。

安全性與隱私

  • Token 儲存runcomfy login 將 API token 寫入 ~/.config/runcomfy/token.json,權限設為 0600。在 CI / 容器中設定 RUNCOMFY_TOKEN 環境變數。
  • 輸入邊界:Kling 3.0 提示透過 --input 以 JSON 傳遞。CLI 不會進行 shell 擴展。無 shell 注入風險。
  • 第三方內容:你傳遞的圖片 URL 由 RunComfy 伺服器擷取,而非你機器上的 CLI。將外部 URL 視為不受信任;基於圖片的提示注入是任何接受圖片輸入的影片模型的已知風險。
  • 對外端點:僅 model-api.runcomfy.net(請求提交)和 *.runcomfy.net / *.runcomfy.com(下載白名單)。
  • 生成檔案大小上限:CLI 會中止任何大於 2 GiB 的單一下載,以防止失控的 Kling 3.0 4K 輸出填滿磁碟。