>
Kling 3.0 - Pro Pack on RunComfy
runcomfy.com · docs · GitHub
Kling 3.0 是快手科技第三代電影級影片模型。此技能涵蓋 RunComfy 上所有六個 Kling 3.0 渲染端點:三個品質層級(Standard、Pro、4K)搭配兩種模式(文字轉影片、圖片轉影片)。
Kling 3.0 是什麼
Kling 3.0 是 Kling 影片模型的 V3 世代。它可產生多鏡頭電影級影片,具備原生同步音訊、跨鏡頭一致的角色身份,以及符合物理的動態。相較於 Kling 2.x,Kling 3.0 支援更長的片段(最長 15 秒)、4K 層級的原生 4K 輸出,以及統一的多元提示片段系統,讓一個 Kling 3.0 生成可包含多個不同場景並控制轉場。
Kling 3.0 在 RunComfy 上提供三個渲染層級,每個層級皆可選擇文字轉影片或圖片轉影片:
- Standard - 最便宜的層級,輸出最高 1080p。適合快速迭代、預覽、A/B 變體、社群短片。
- Pro - 1080p 最高保真度。適合需要動態真實感與身份保留的旗艦級 1080p 片段。
- 4K - 原生 3840x2160 輸出。適合高解析度品牌影片、大螢幕電影級序列,以及原生解析度的最終成品。
三個層級共用相同的 Kling 3.0 多鏡頭架構。層級差異在於解析度上限、動態保真度預算與價格。
6 個 Kling 3.0 端點
每個端點對應一個(層級, 模式)組合。所有六個端點共用相同的 Kling 3.0 基礎模型。
| 端點 | 錨點 | 解析度 | 費用(無音訊) | 費用(含音訊) |
|---|---|---|---|---|
kling/kling-3.0/standard/text-to-video |
Kling 3.0 Standard t2v | 最高 1080p | $0.084/秒 | $0.126/秒 |
kling/kling-3.0/standard/image-to-video |
Kling 3.0 Standard Image to Video | 最高 1080p | $0.084/秒 | $0.126/秒 |
kling/kling-3.0/pro/text-to-video |
Kling V3.0 Pro Text-to-Video | 1080p | $0.112/秒 | $0.168/秒 |
kling/kling-3.0/pro/image-to-video |
Kling V3.0 Pro Image-to-Video | 1080p | $0.112/秒 | $0.168/秒 |
kling/kling-3.0/4k/text-to-video |
Kling V3.0 4K Text-to-Video | 3840x2160 | $0.42/秒固定 | $0.42/秒固定 |
kling/kling-3.0/4k/image-to-video |
Kling V3.0 4K Image-to-Video | 3840x2160 | $0.42/秒固定 | $0.42/秒固定 |
4K 層級價格固定,不因音訊與否而異。Standard 與 Pro 層級啟用音訊時每秒費用約增加 50%。
何時選擇哪個 Kling 3.0 層級
根據輸出在流程中的角色選擇 Kling 3.0 層級。
- 草稿、預覽、社群短片、A/B 變體:Kling 3.0 Standard。最便宜。除了旗艦級鏡頭外,品質已足夠。
- 旗艦級 1080p 片段、廣告創意、高動態保真度的 talking head:Kling V3.0 Pro。比 Standard 貴約 33%,但在相同解析度下動態與身份保留明顯更佳。
- 4K 品牌影片、大螢幕電影級、最終成品:Kling V3.0 4K。原生 3840x2160(無需放大步驟)。固定 $0.42/秒,預算易於預測。僅在輸出真正需要 4K 時使用——成本約為 Standard 的 5 倍。
根據是否有來源圖片選擇模式:
- 文字轉影片(t2v):僅提示詞,Kling 3.0 從頭生成畫面。適合全新場景、全新構圖、無現有參考的環境。
- 圖片轉影片(i2v):提示詞 + 來源圖片,Kling 3.0 將圖片動畫化。當你有確切參考(臉部、產品、場景)且必須保留在輸出中時使用。
如果使用者明確要求 Kling 3.0、Kling V3.0、Kling Pro 或 Kling 4K,則路由至此技能。
前置需求
- RunComfy CLI:
npm i -g @runcomfy/cli - RunComfy 帳號:
runcomfy login會開啟瀏覽器裝置碼流程。 - CI / 容器:設定
RUNCOMFY_TOKEN=<token>取代runcomfy login。 - i2v 端點:需要一個可公開存取的來源圖片 URL(HTTPS,JPEG/PNG/WebP)。
輸入結構(所有 6 個 Kling 3.0 端點共用)
| 欄位 | 型別 | 必填 | 預設值 | 備註 |
|---|---|---|---|---|
prompt |
string | 是 | - | 場景、動態、鏡頭、氛圍的文字描述。可透過 prompt_segments 支援多片段提示,在一個 Kling 3.0 生成中實現場景轉場。 |
image_url |
string | 是(僅 i2v) | - | Kling 3.0 i2v 的來源圖片。HTTPS URL。JPEG/PNG/WebP。 |
tail_image_url |
string | 否(僅 i2v) | - | 可選的結尾圖片,用於控制 Kling 3.0 i2v 的起點到終點幀轉場。 |
negative_prompt |
string | 否 | - | 要從 Kling 3.0 輸出中排除的元素。 |
duration |
int | 否 | 5 | 每次 Kling 3.0 生成 3-15 秒。 |
aspect_ratio |
enum | 否 | 16:9 |
16:9、9:16、1:1、4:3、3:4、21:9。 |
cfg_scale |
float | 否 | 0.5 | 提示引導強度。越高表示越嚴格遵循提示。 |
generate_audio |
bool | 否 | false | 啟用 Kling 3.0 同步音訊。Standard 和 Pro 層級會增加費用;4K 層級為固定費率。 |
seed |
int | 否 | - | 用於 Kling 3.0 變體測試的可重現性。 |
如何呼叫每個 Kling 3.0 端點
Kling 3.0 Standard 文字轉影片(最便宜的 1080p 草稿):
runcomfy run kling/kling-3.0/standard/text-to-video \
--input '{
"prompt": "<Kling 3.0 提示>",
"duration": 5,
"aspect_ratio": "16:9"
}' \
--output-dir <絕對路徑>
Kling 3.0 Standard 圖片轉影片(將靜態圖片動畫化):
runcomfy run kling/kling-3.0/standard/image-to-video \
--input '{
"prompt": "<Kling 3.0 i2v 動態描述>",
"image_url": "https://.../source.jpg",
"duration": 5
}' \
--output-dir <絕對路徑>
Kling V3.0 Pro 文字轉影片(最高 1080p 保真度):
runcomfy run kling/kling-3.0/pro/text-to-video \
--input '{
"prompt": "<Kling 3.0 Pro 提示>",
"duration": 8,
"aspect_ratio": "16:9",
"generate_audio": true
}' \
--output-dir <絕對路徑>
Kling V3.0 Pro 圖片轉影片(從來源圖片進行旗艦級動畫):
runcomfy run kling/kling-3.0/pro/image-to-video \
--input '{
"prompt": "<Kling V3.0 Pro i2v 動態描述>",
"image_url": "https://.../subject.jpg",
"duration": 8,
"generate_audio": true
}' \
--output-dir <絕對路徑>
Kling V3.0 4K 文字轉影片(原生 4K 電影級):
runcomfy run kling/kling-3.0/4k/text-to-video \
--input '{
"prompt": "<Kling V3.0 4K 提示>",
"duration": 10,
"aspect_ratio": "16:9",
"generate_audio": true
}' \
--output-dir <絕對路徑>
Kling V3.0 4K 圖片轉影片(參考圖片的 4K 動畫):
runcomfy run kling/kling-3.0/4k/image-to-video \
--input '{
"prompt": "<Kling V3.0 4K i2v 動態描述>",
"image_url": "https://.../source-4k.jpg",
"duration": 10,
"generate_audio": true
}' \
--output-dir <絕對路徑>
CLI 會提交 Kling 3.0 請求,每 2 秒輪詢一次,取得結果,並將任何 *.runcomfy.net / *.runcomfy.com URL 下載到 --output-dir。
Kling 3.0 提示技巧 - 有效做法
Kling 3.0 對特定提示模式的反應優於單純的散文描述。
以動態和鏡頭語言開頭。 Kling 3.0 會將「廣角鏡頭、緩慢推近」、「跟拍鏡頭、低角度」、「手持跟隨」視為實際指令。將這些放在前面。
單次 Kling 3.0 生成中的多鏡頭。 一個 Kling 3.0 提示可以描述一系列鏡頭。為它們編號:「鏡頭 1:黃昏時咖啡館的廣角。鏡頭 2:咖啡師的中景特寫。鏡頭 3:濃縮咖啡注入的特寫。」Kling 3.0 會在各鏡頭間保留身份(臉部、服裝、道具)。
i2v 的身份錨點。 使用 Kling 3.0 i2v 時,重申應保持穩定的部分:「保留主體的面部、姿勢和服裝;僅鏡頭移動和背景變化。」
tail_image_url 用於控制結尾。 在 Kling 3.0 i2v 中,提供結尾圖片以鎖定最終幀。Kling 3.0 會從來源到結尾插值動態。
generate_audio: true 用於一次性對話。 描述 Kling 3.0 應產生的音訊:「溫暖友善的語氣,英語旁白」或「城市氛圍,遠處車流,無對話」。Standard / Pro 層級啟用音訊會增加費用;4K 層級為固定費率。
cfg_scale 調整。 預設 0.5 適用於大多數 Kling 3.0 提示。對於風格化輸出,提高至 0.7-0.9 以嚴格遵循提示。對於寬鬆提示,降低至 0.3-0.4 以獲得自然動態。
反模式:
- 在一個 Kling 3.0 提示中加入衝突的風格線索 -> 簡化,選擇一兩個風格錨點。
- 要求單次 Kling 3.0 呼叫超過 15 秒 -> 422 錯誤;將腳本分段並拼接。
- 使用不支援的長寬比 -> 被拒絕。
- 對於 Kling V3.0 4K,要求激進的多鏡頭故事加上 15 秒加上對話加上 6 個剪輯 -> Kling 3.0 會產出,但成本約為每次生成 $6.30。先用 Standard 驗證。
Kling 3.0 的強項
| 使用案例 | 最佳 Kling 3.0 端點 |
|---|---|
| 角色一致的電影級 1080p 品牌故事 | Kling V3.0 Pro(t2v 或 i2v) |
| 原生 4K 旗艦影片與大螢幕電影級 | Kling V3.0 4K(t2v 或 i2v) |
| 低成本迭代、社群優先短片、A/B 變體 | Kling 3.0 Standard t2v |
| 品牌素材、產品照片、角色藝術的動畫化 | Kling 3.0 Standard i2v 或 Kling V3.0 Pro i2v |
| 一次性同步對話的多鏡頭廣告 | Kling V3.0 Pro 搭配 generate_audio: true |
| 含原生音訊的高階 4K 最終成品 | Kling V3.0 4K 搭配 generate_audio: true(固定費率) |
Kling 3.0 提示範例
Kling 3.0 電影級多鏡頭(建議 Pro 層級):
一對年輕美國夫婦在燭光屋頂餐廳慶祝週年紀念的電影級多鏡頭。
鏡頭 1:金色時刻城市天際線的廣角。鏡頭 2:中景雙人鏡頭,
夫婦舉杯。鏡頭 3:女子微笑的特寫,柔和散景,溫暖補光。
微弱的環境弦樂,輕柔的風,遠處的車流聲。
Kling 3.0 i2v(將肖像動畫化,4K 層級):
從來源圖片對主體進行輕柔的攝影機推近。微弱的呼吸動態,
身份穩定的特徵,柔和自然光,淺景深。背景:溫暖的金色時刻
光暈,緩慢飄動的灰塵微粒。無對話,僅環境室內音。
Kling 3.0 垂直短片(Standard 層級,9:16):
9:16 垂直。一位穿著黑色圍裙的咖啡師正在萃取單份濃縮咖啡,
蒸氣在晨光中升起,豐富的 crema 緩慢形成。手持特寫,
淺景深,溫暖的咖啡館氛圍和蒸氣棒的嘶嘶聲。
Kling 3.0 常見問題
Kling 3.0 片段的最大時長是多少? 所有三個層級每次生成最長 15 秒。對於更長的敘事,將腳本分段為多個 Kling 3.0 呼叫並拼接。
Kling V3.0 4K 的價格與 Standard 和 Pro 相比如何? Kling V3.0 4K 固定為每秒 $0.42,無論是否啟用音訊。Standard 無音訊為 $0.084/秒(最便宜)。Pro 無音訊為 $0.112/秒。4K 層級的成本約為 Standard 的 5 倍,以換取解析度升級。
Kling 3.0 是否支援單次生成中的多鏡頭? 是的。所有 Kling 3.0 端點都接受多片段提示。為鏡頭編號(「鏡頭 1:」、「鏡頭 2:」等),Kling 3.0 會在各鏡頭間保留角色身份。
Kling 3.0 可以生成音訊嗎? 可以。設定 generate_audio: true。Kling 3.0 會在相同生成過程中產生同步對話、環境音和音樂。4K 層級價格固定為 $0.42/秒;Standard / Pro 層級啟用音訊後費用約增加 50%。
Kling 3.0 支援哪些長寬比? 16:9、9:16、1:1、4:3、3:4、21:9。4K 層級會將 21:9 渲染為原生 3840x2160 的寬銀幕裁切。
Kling 3.0 i2v 是否支援結尾圖片? 是的。tail_image_url 鎖定最終幀;Kling 3.0 從來源到結尾插值動態。
Kling 3.0 與 Kling 2.x 有何不同? Kling 3.0 具有更強的多鏡頭身份保留、更長的最大時長(15 秒 vs 2.x 旗艦的 10 秒)、4K 層級的原生 4K,以及所有層級統一的多元提示片段輸入。
限制
- 每次呼叫時長上限 15 秒,適用於所有 Kling 3.0 層級。
- 單次 Kling 3.0 4K 生成最多 6 個連續鏡頭。
- i2v 需要可公開存取的 HTTPS 圖片 URL。不支援本地檔案。
- 長寬比固定為文件中的六種。其他比例會被裁切或拒絕。
- 4K 輸出檔案很大。在批次執行 Kling V3.0 4K 前,請規劃磁碟和頻寬。
退出碼
runcomfy CLI 使用 sysexits 風格的代碼:
| 代碼 | 含義 |
|---|---|
| 0 | Kling 3.0 生成成功 |
| 64 | CLI 參數錯誤 |
| 65 | Kling 3.0 輸入 JSON 錯誤 / 結構不符 |
| 69 | 上游 5xx 錯誤 |
| 75 | 可重試:超時 / 429 |
| 77 | 未登入或 token 被拒絕 |
完整參考:docs.runcomfy.com/cli/troubleshooting。
運作方式
- 技能根據使用者的層級(Standard / Pro / 4K)和模式(t2v / i2v)意圖,選擇六個 Kling 3.0 端點之一。
- 它使用符合結構的 JSON 主體呼叫
runcomfy run kling/kling-3.0/<tier>/<mode>。 - CLI 使用使用者的 bearer token 向 RunComfy Model API 發送 POST 請求。
- Model API 返回
request_id;CLI 每 2 秒輪詢一次,直到 Kling 3.0 生成完成。 - 在終端狀態下,CLI 取得 Kling 3.0 結果,並將任何
.runcomfy.net/.runcomfy.comURL 下載到--output-dir。 Ctrl-C可在計費前取消進行中的 Kling 3.0 請求。
安全性與隱私
- Token 儲存:
runcomfy login將 API token 寫入~/.config/runcomfy/token.json,權限設為 0600。在 CI / 容器中設定RUNCOMFY_TOKEN環境變數。 - 輸入邊界:Kling 3.0 提示透過
--input以 JSON 傳遞。CLI 不會進行 shell 擴展。無 shell 注入風險。 - 第三方內容:你傳遞的圖片 URL 由 RunComfy 伺服器擷取,而非你機器上的 CLI。將外部 URL 視為不受信任;基於圖片的提示注入是任何接受圖片輸入的影片模型的已知風險。
- 對外端點:僅
model-api.runcomfy.net(請求提交)和*.runcomfy.net/*.runcomfy.com(下載白名單)。 - 生成檔案大小上限:CLI 會中止任何大於 2 GiB 的單一下載,以防止失控的 Kling 3.0 4K 輸出填滿磁碟。






