aws-ai-ml

aws-ai-ml

熱門

在 Amazon SageMaker 上選取、部署及自訂 AI 模型。涵蓋微調(SFT、DPO、RLVR、RLAIF)、模型選取、資料集準備、評估、部署至 SageMaker 端點或 Bedrock,以及端點診斷。涵蓋從規劃到生產的完整生命週期。當在 SageMaker 上微調模型、從 SageMaker Hub 選擇/挑選要自訂或微調的基礎模型、尋找無需微調即可部署的模型、轉換資料集以進行訓練、檢查資料就緒度、評估模型品質、部署至端點、設定 IAM 角色和 S3 儲存桶以進行訓練任務,或管理 SageMaker Managed MLflow 應用程式時使用。也可用於檢查端點健康狀態、診斷失敗、偵錯延遲或錯誤,或檢視容器日誌和 CloudWatch 指標。涵蓋 Serverless Model Customization、Nova 和 OSS 部署路徑,以及 PySDK v3 用法。不適用於 Ground Truth 標記、Feature Store 或一般用途的 AWS 基礎設施。

2474星標
275分支
更新於 2026/8/28
SKILL.md
唯讀
名稱
aws-ai-ml
描述

在 Amazon SageMaker 上選取、部署及自訂 AI 模型。涵蓋微調(SFT、DPO、RLVR、RLAIF)、模型選取、資料集準備、評估、部署至 SageMaker 端點或 Bedrock,以及端點診斷。涵蓋從規劃到生產的完整生命週期。當在 SageMaker 上微調模型、從 SageMaker Hub 選擇/挑選要自訂或微調的基礎模型、尋找無需微調即可部署的模型、轉換資料集以進行訓練、檢查資料就緒度、評估模型品質、部署至端點、設定 IAM 角色和 S3 儲存桶以進行訓練任務,或管理 SageMaker Managed MLflow 應用程式時使用。也可用於檢查端點健康狀態、診斷失敗、偵錯延遲或錯誤,或檢視容器日誌和 CloudWatch 指標。涵蓋 Serverless Model Customization、Nova 和 OSS 部署路徑,以及 PySDK v3 用法。不適用於 Ground Truth 標記、Feature Store 或一般用途的 AWS 基礎設施。

AWS AI/ML 模型自訂

在 Amazon SageMaker 上微調和部署模型的領域專業知識。涵蓋從規劃到生產部署的完整模型自訂生命週期。

路由

將使用者的意圖對應至適當的參考資料夾,並僅載入該內容。

使用者意圖 參考資料 使用時機
規劃模型自訂專案、探索工作範圍、恢復或修改計畫 references/planning/ 使用者的請求與模型自訂或部署相關(微調、訓練、建置、自訂、檢閱資料、部署或建立模型——包括選取或部署現成或基礎模型且無需訓練——或尋求方法建議)。務必與其他意圖共同啟用以探索完整範圍。當請求符合此表格多列時,請先載入此參考資料——在路由至單一動作參考資料前,先閱讀其計畫範本。
定義商業問題、成功標準或使用案例規格 references/use-case-specification/ 使用者說「定義我的使用案例」、「擷取需求」、「我應該事先決定什麼」,或作為任何計畫的預設第一步。僅在使用者明確拒絕時略過。
選取或變更基礎模型 references/model-selection/ 使用者詢問要使用哪個模型、提及模型名稱或系列,或想要評估可用的選項。即使已知模型名稱,也務必啟用 model-selection,因為必須解析確切的 Hub 模型 ID。建議: 先路由至 use-case-specification 以擷取需求——這會產生更好的篩選結果。若使用者提供特定模型名稱/ID 或拒絕,則不要求先路由至 use-case-specification。若意圖模糊(微調 vs 直接部署),model-selection 必須先確認路徑再繼續。部署的基礎模型篩選必須透過 select-for-deployment.md 及其腳本進行任何最終建議。
選擇微調技術(SFT、DPO、RLVR、RLAIF) references/finetuning-technique/ 使用者已決定微調並需要選擇技術,或技術需要針對所選模型的配方進行驗證。需要先選取基礎模型。
驗證資料集品質和格式 references/dataset-evaluation/ 使用者說「我的資料集可以嗎」、「檢查我的訓練資料」、「我有自己的資料」,或在開始任何微調任務之前。
在格式之間轉換或轉換資料集 references/dataset-transformation/ 使用者說「轉換」、「轉換」、「重新格式化」,或資料集結構描述需要變更。務必使用此參考資料,而非撰寫內嵌轉換程式碼。
產生微調程式碼並開始訓練 references/finetuning/ 使用者說「開始訓練」、「微調我的模型」、「我準備好訓練了」,或計畫達到微調步驟。支援 SFT、DPO、RLVR、RLAIF 訓練器。
評估或基準測試已訓練的模型 references/model-evaluation/ 使用者說「評估我的模型」、「執行基準測試」、「測試模型效能」、「比較模型」。支援 LLM-as-Judge 和 Custom Scorer。
部署模型至端點或 Bedrock references/model-deployment/ 使用者說「部署我的模型」、「建立端點」、「讓它可用」。處理 Nova 與 OSS 部署路徑。
設定 IAM 角色、S3 儲存桶、SDK 設定 references/sdk-getting-started/ 使用者說「設定」、「開始使用」、「檢查我的環境」、「設定 SDK」,或作為任何涉及 SageMaker 訓練/評估/部署的計畫的第一步。
管理專案目錄和工件 references/directory-management/ 開始新專案、恢復現有專案,或當 PLAN.md 需要與專案目錄關聯時。
設定、更新或刪除 SageMaker Managed MLflow 應用程式 references/manage-mlflow/ 使用者說「設定 MLflow」、「建立 MLflow 應用程式」、「更新我的 MLflow 應用程式」、「刪除我的 MLflow 應用程式」、「我需要 MLflow 伺服器」、詢問「什麼是 SageMaker MLflow」,或工作流程需要 MLflow 後端但未連接。
診斷失敗或不健康的 SageMaker 端點 references/endpoint-diagnostics/ 使用者回報端點錯誤、延遲、推論失敗,或部署失敗。「我的端點狀態如何?」、「我的端點是否出錯?」、「我的端點失敗——為什麼?」、「我的端點背後執行多少個執行個體?」、「延遲是我的模型還是 SageMaker?」、「顯示我的端點的容器日誌。」不適用於訓練任務問題、端點刪除、擴展變更或新部署。

規則

  • 漸進式揭露。 僅載入與目前使用者意圖相關的參考資料夾。不要一次載入所有參考資料。
  • 盡力協助。 如果使用者的請求超出此技能的參考資料範圍,請勿讓對話陷入死胡同。使用一般的 AWS 知識和文件協助他們,並告知使用者此指引不受此技能驗證的工作流程涵蓋。
  • 使用歸因。 在執行任何 AWS CLI 命令或打包腳本之前,設定 export AWS_SDK_UA_APP_ID=AWSSkill-SageMaker