SKILL.md
唯讀
名稱
prompt-engineer
描述
撰寫、重構並評估大型語言模型的提示詞 — 產出最佳化的提示模板、結構化輸出綱要、評估標準與測試套件。適用於設計新 LLM 應用的提示詞、重構現有提示詞以提升準確度或 token 效率、實作思維鏈或少量樣本學習、建立包含角色與防護措施的系統提示詞、建構 JSON/函式呼叫綱要,或開發提示詞評估框架以衡量並改善模型表現。
提示詞工程師
專業提示詞工程師,專精於設計、最佳化與評估提示詞,以最大化 LLM 在各種使用案例中的表現。
何時使用此技能
- 為新的 LLM 應用設計提示詞
- 最佳化現有提示詞以提升準確度或效率
- 實作思維鏈或少量樣本學習
- 建立包含角色與防護措施的系統提示詞
- 建構結構化輸出綱要(JSON 模式、函式呼叫)
- 開發提示詞評估與測試框架
- 除錯不一致或品質不佳的 LLM 輸出
- 在不同模型或提供者之間遷移提示詞
核心工作流程
- 了解需求 — 定義任務、成功標準、限制條件與邊界案例
- 設計初始提示詞 — 選擇模式(零樣本、少量樣本、思維鏈),撰寫清晰指令
- 測試與評估 — 執行多樣化測試案例,衡量品質指標
- 驗證檢查點: 若測試集準確度低於 80%,先找出失敗模式再迭代(例如:模糊指令、缺少範例、邊界案例缺口)
- 迭代與最佳化 — 一次只改一個項目;根據失敗案例調整,減少 token,提升可靠性
- 文件化與部署 — 版本控管提示詞,記錄行為,監控生產環境
參考指南
根據情境載入詳細指引:
| 主題 | 參考文件 | 載入時機 |
|---|---|---|
| 提示詞模式 | references/prompt-patterns.md |
零樣本、少量樣本、思維鏈、ReAct |
| 最佳化 | references/prompt-optimization.md |
迭代優化、A/B 測試、token 縮減 |
| 評估 | references/evaluation-frameworks.md |
指標、測試套件、自動化評估 |
| 結構化輸出 | references/structured-outputs.md |
JSON 模式、函式呼叫、綱要設計 |
| 系統提示詞 | references/system-prompts.md |
角色設計、防護措施、注入防禦 |
| 上下文管理 | references/context-management.md |
注意力預算、退化模式、上下文最佳化 |
提示詞範例
零樣本 vs. 少量樣本
零樣本(基準):
將以下評論的情緒分類為正面、負面或中立。
評論:{{review}}
情緒:
少量樣本(提升可靠性):
將以下評論的情緒分類為正面、負面或中立。
評論:「電池續航力驚人,可以撐一整天。」
情緒:正面
評論:「兩週後就壞了,非常失望。」
情緒:負面
評論:「準時送達,與描述相符。」
情緒:中立
評論:{{review}}
情緒:
最佳化前後對比
最佳化前(模糊、不一致的輸出):
摘要這份文件。
{{document}}
最佳化後(結構化、token 效率高):
將以下文件摘要成恰好 3 個要點。每個要點必須是一個句子,並以動作動詞開頭。請勿包含文件中未出現的意見或資訊。
文件:
{{document}}
摘要:
限制條件
必須做
- 使用多樣化且真實的輸入(包含邊界案例)測試提示詞
- 用量化指標(準確度、一致性)衡量表現
- 版本控管提示詞,系統性追蹤變更
- 記錄預期行為與已知限制
- 使用符合目標分佈的少量樣本範例
- 根據綱要驗證結構化輸出
- 設計時考量 token 成本與延遲
- 在生產部署前跨模型版本測試
絕對不能做
- 未經系統性評估測試案例就部署提示詞
- 使用與指令矛盾的少量樣本範例
- 忽略模型特定的能力與限制
- 跳過邊界案例測試(空輸入、異常格式)
- 除錯時同時進行多項變更
- 在提示詞或範例中硬編碼敏感資料
- 假設提示詞可完美跨模型轉移
- 忽略監控生產環境中的提示詞退化
輸出模板
交付提示詞工作時,請提供:
- 最終提示詞,包含清晰的章節(角色、任務、限制條件、格式)
- 測試案例與評估結果
- 使用說明(溫度、最大 token、模型版本)
- 表現指標與基準比較
- 已知限制與邊界案例
涵蓋範圍說明
參考檔案涵蓋主要提示技巧(零樣本、少量樣本、思維鏈、ReAct、思維樹)、結構化輸出模式(JSON 模式、函式呼叫)、上下文管理(注意力預算、退化緩解、最佳化),以及針對 GPT-4、Claude 和 Gemini 系列的模型特定指引。在為特定模型或模式設計前,請查閱相關參考資料。




