
airunway-aks-setup
热门在 AKS 上设置 AI Runway——从裸集群到运行模型。涵盖集群验证、控制器安装、GPU 评估、提供商设置和首次部署。触发词:"setup AI Runway"、"onboard AKS cluster"、"install AI Runway"、"airunway setup"、"deploy model to AKS"、"GPU inference on AKS"、"KAITO setup on AKS"、"run LLM on AKS"、"vLLM on AKS"、"set up model serving on AKS"、"AI Runway controller"。
在 AKS 上设置 AI Runway——从裸集群到运行模型。涵盖集群验证、控制器安装、GPU 评估、提供商设置和首次部署。触发词:\"setup AI Runway\"、\"onboard AKS cluster\"、\"install AI Runway\"、\"airunway setup\"、\"deploy model to AKS\"、\"GPU inference on AKS\"、\"KAITO setup on AKS\"、\"run LLM on AKS\"、\"vLLM on AKS\"、\"set up model serving on AKS\"、\"AI Runway controller\"。
AI Runway AKS 设置
本技能引导用户从裸 Kubernetes 集群到运行中的 AI 模型部署。除非用户提供 skip-to-step N 以从特定阶段继续,否则请按顺序执行每一步。
成本意识: GPU 节点池会产生显著的计算费用(A100-80GB 每小时可能花费 3–5 美元以上)。在预配 GPU 资源前,请确认用户了解成本影响。
先决条件
本技能假设 AKS 集群已存在。如果用户没有集群,请先移交到 azure-kubernetes 技能以预配一个集群(除非 CPU 推理可接受,否则应包含 GPU 节点池),然后返回此处。
快速参考
| 属性 | 值 |
|---|---|
| 最佳用途 | AKS 上的端到端 AI Runway 入门 |
| CLI 工具 | kubectl、make、curl |
| MCP 工具 | 无 |
| 相关技能 | azure-kubernetes(集群设置)、azure-diagnostics(故障排除) |
何时使用本技能
当用户想要以下操作时使用本技能:
- 在现有 AKS 集群上从头设置 AI Runway
- 安装 AI Runway 控制器和 CRD
- 评估 GPU 硬件兼容性以进行模型部署
- 选择并安装推理提供商(KAITO、Dynamo、KubeRay)
- 通过 AI Runway 将第一个 AI 模型部署到 AKS
- 从特定步骤恢复部分完成的 AI Runway 设置
MCP 工具
本技能不使用 MCP 工具。所有集群操作直接通过 kubectl 和 make 执行。
规则
- 按顺序执行步骤——到达每个步骤时加载其参考文档
- 在每个步骤报告集群状态:✓ 健康、✗ 缺失/失败
- 在任何安装或部署操作前请求用户确认
- 如果某步骤已完成,报告状态并跳到下一步
- 如果用户提供
skip-to-step N,从步骤 N 开始;假设之前的步骤已完成
步骤
| # | 步骤 | 参考文档 |
|---|---|---|
| 1 | 集群验证——上下文检查、节点清单、GPU 检测 | step-1-verify.md |
| 2 | 控制器安装——CRD + 控制器部署 | step-2-controller.md |
| 3 | GPU 评估——检测 GPU 型号,标记 dtype/注意力约束 | step-3-gpu.md |
| 4 | 提供商设置——推荐并安装推理提供商 | step-4-provider.md |
| 5 | 首次部署——选择模型、部署、验证就绪 | step-5-deploy.md |
| 6 | 总结——回顾、冒烟测试、后续步骤 | step-6-summary.md |
错误处理
| 错误/症状 | 可能原因 | 补救措施 |
|---|---|---|
| 无 kubeconfig 上下文 | 未连接到集群 | 运行 az aks get-credentials 或等效命令 |
| 控制器处于 CrashLoopBackOff | 配置或 RBAC 问题 | kubectl logs -n airunway-system -l control-plane=controller-manager --previous |
| 提供商未就绪 | 镜像拉取或 RBAC 问题 | 对提供商 Pod 执行 kubectl logs <pod-name> -n <namespace> |
| ModelDeployment 卡在 Pending | GPU 调度失败或提供商未就绪 | 执行 kubectl describe modeldeployment <name> -n <namespace> 查看事件 |
推理时出现 bfloat16 错误 |
T4 或 V100 不支持 bfloat16 | 在服务参数中添加 --dtype float16 |
有关完整的错误处理和回滚流程,请参阅 troubleshooting.md。





