
aws-ai-ml
热门在Amazon SageMaker上选择、部署和定制AI模型。微调(SFT、DPO、RLVR、RLAIF)、模型选择、数据集准备、评估、部署到SageMaker端点或Bedrock,以及端点诊断。涵盖从规划到生产的完整生命周期。当在SageMaker上微调模型、从SageMaker Hub选择/挑选要定制或微调的基础模型、寻找无需微调即可部署的模型、转换用于训练的数据集、检查数据就绪性、评估模型质量、部署到端点、为训练作业设置IAM角色和S3存储桶,或管理SageMaker托管的MLflow应用时使用。也用于检查端点健康状况、诊断故障、调试延迟或错误,或查看容器日志和CloudWatch指标。涵盖无服务器模型定制、Nova和OSS部署路径以及PySDK v3的使用。不适用于Ground Truth标注、Feature Store或通用AWS基础设施。
在Amazon SageMaker上选择、部署和定制AI模型。微调(SFT、DPO、RLVR、RLAIF)、模型选择、数据集准备、评估、部署到SageMaker端点或Bedrock,以及端点诊断。涵盖从规划到生产的完整生命周期。当在SageMaker上微调模型、从SageMaker Hub选择/挑选要定制或微调的基础模型、寻找无需微调即可部署的模型、转换用于训练的数据集、检查数据就绪性、评估模型质量、部署到端点、为训练作业设置IAM角色和S3存储桶,或管理SageMaker托管的MLflow应用时使用。也用于检查端点健康状况、诊断故障、调试延迟或错误,或查看容器日志和CloudWatch指标。涵盖无服务器模型定制、Nova和OSS部署路径以及PySDK v3的使用。不适用于Ground Truth标注、Feature Store或通用AWS基础设施。
AWS AI/ML 模型定制
在Amazon SageMaker上微调和部署模型的领域专业知识。涵盖从规划到生产部署的完整模型定制生命周期。
路由
将用户的意图匹配到相应的参考文件夹,并仅加载该内容。
| 用户意图 | 参考 | 使用时机 |
|---|---|---|
| 规划模型定制项目、发现工作范围、恢复或修改计划 | references/planning/ | 用户的请求涉及模型定制或部署(微调、训练、构建、定制、审查数据、部署或建立模型——包括选择或部署现成或基础模型而无需训练,或获取方法建议)。始终与其他意图共同激活以发现完整范围。当请求匹配此表中的多行时,首先加载此参考——在路由到单一操作参考之前阅读其计划模板。 |
| 定义业务问题、成功标准或用例规范 | references/use-case-specification/ | 用户说“定义我的用例”、“捕获需求”、“我应该提前决定什么”,或作为任何计划的默认第一步。仅当用户明确拒绝时跳过。 |
| 选择或更改基础模型 | references/model-selection/ | 用户询问使用哪个模型、提及模型名称或系列,或想要评估可用选项。即使已知模型名称,也始终激活model-selection,因为必须解析确切的Hub模型ID。推荐: 首先路由到use-case-specification以捕获需求——这会产生更好的过滤结果。如果用户提供特定的模型名称/ID或拒绝,则不是必须首先路由到use-case-specification。如果意图不明确(微调与按原样部署),model-selection必须确认路径后才能继续。用于部署的基础模型过滤必须通过select-for-deployment.md及其脚本进行任何最终推荐。 |
| 选择微调技术(SFT、DPO、RLVR、RLAIF) | references/finetuning-technique/ | 用户已决定微调并需要选择技术,或技术需要针对所选模型的配方进行验证。需要先选择基础模型。 |
| 验证数据集质量和格式 | references/dataset-evaluation/ | 用户说“我的数据集可以吗”、“检查我的训练数据”、“我有自己的数据”,或在开始任何微调作业之前。 |
| 在格式之间转换或转换数据集 | references/dataset-transformation/ | 用户说“转换”、“转换”、“重新格式化”,或数据集模式需要更改。始终使用此参考,而不是编写内联转换代码。 |
| 生成微调代码并开始训练 | references/finetuning/ | 用户说“开始训练”、“微调我的模型”、“我准备好训练了”,或计划达到微调步骤。支持SFT、DPO、RLVR、RLAIF训练器。 |
| 评估或基准测试训练好的模型 | references/model-evaluation/ | 用户说“评估我的模型”、“运行基准测试”、“测试模型性能”、“比较模型”。支持LLM-as-Judge和自定义评分器。 |
| 将模型部署到端点或Bedrock | references/model-deployment/ | 用户说“部署我的模型”、“创建端点”、“使其可用”。处理Nova与OSS部署路径。 |
| 设置IAM角色、S3存储桶、SDK配置 | references/sdk-getting-started/ | 用户说“设置”、“入门”、“检查我的环境”、“配置SDK”,或作为任何涉及SageMaker训练/评估/部署的计划的第一步。 |
| 管理项目目录和工件 | references/directory-management/ | 开始新项目、恢复现有项目,或当PLAN.md需要与项目目录关联时。 |
| 设置、更新或删除SageMaker托管的MLflow应用 | references/manage-mlflow/ | 用户说“设置MLflow”、“创建MLflow应用”、“更新我的MLflow应用”、“删除我的MLflow应用”、“我需要MLflow服务器”,询问“什么是SageMaker MLflow”,或工作流需要MLflow后端且未连接。 |
| 诊断失败或不健康的SageMaker端点 | references/endpoint-diagnostics/ | 用户报告端点错误、延迟、推理失败或部署失败。“我的端点状态如何?”、“我的端点是否出错?”、“我的端点失败了——为什么?”、“我的端点后面运行了多少个实例?”、“延迟是我的模型还是SageMaker?”、“显示我的端点的容器日志。”不适用于训练作业问题、端点删除、扩展更改或新部署。 |
规则
- 渐进式披露。 仅加载与当前用户意图相关的参考文件夹。不要一次加载所有参考。
- 尽力帮助。 如果用户的请求超出此技能参考的范围,不要使对话陷入死胡同。使用一般的AWS知识和文档帮助他们,并告知用户该指导不受此技能验证的工作流程覆盖。
- 使用归属。 在运行任何AWS CLI命令或打包脚本之前,设置
export AWS_SDK_UA_APP_ID=AWSSkill-SageMaker。





