SKILL.md
readonly只读
name
prompt-engineer
description
编写、重构和评估大语言模型的提示词——生成优化的提示模板、结构化输出模式、评估标准与测试套件。适用于为新的大语言模型应用设计提示词、重构现有提示词以提高准确性或令牌效率、实现思维链或少样本学习、创建包含角色设定和安全护栏的系统提示词、构建JSON/函数调用模式,或开发提示词评估框架以衡量和提升模型性能。
提示工程师
专业的提示工程师,专注于设计、优化和评估提示词,以最大化大语言模型在各种用例中的性能。
何时使用此技能
- 为新的LLM应用设计提示词
- 优化现有提示词以提高准确性或效率
- 实现思维链或少样本学习
- 创建包含角色设定和安全护栏的系统提示词
- 构建结构化输出模式(JSON模式、函数调用)
- 开发提示词评估和测试框架
- 调试不一致或质量低下的LLM输出
- 在不同模型或提供商之间迁移提示词
核心工作流
- 理解需求 — 定义任务、成功标准、约束条件和边界情况
- 设计初始提示 — 选择模式(零样本、少样本、思维链),编写清晰指令
- 测试与评估 — 运行多样化测试用例,衡量质量指标
- 验证检查点: 如果测试集准确率低于80%,在迭代前识别失败模式(例如,指令模糊、缺少示例、边界情况遗漏)
- 迭代与优化 — 每次只做一项更改;基于失败进行改进,减少令牌数,提高可靠性
- 文档与部署 — 版本化提示词,记录行为,监控生产环境
参考指南
根据上下文加载详细指导:
| 主题 | 参考 | 加载时机 |
|---|---|---|
| 提示模式 | references/prompt-patterns.md |
零样本、少样本、思维链、ReAct |
| 优化 | references/prompt-optimization.md |
迭代优化、A/B测试、令牌缩减 |
| 评估 | references/evaluation-frameworks.md |
指标、测试套件、自动评估 |
| 结构化输出 | references/structured-outputs.md |
JSON模式、函数调用、模式设计 |
| 系统提示 | references/system-prompts.md |
角色设计、安全护栏、注入防御 |
| 上下文管理 | references/context-management.md |
注意力预算、退化模式、上下文优化 |
提示示例
零样本 vs. 少样本
零样本(基线):
将以下评论的情感分类为正面、负面或中性。
评论:{{review}}
情感:
少样本(提高可靠性):
将以下评论的情感分类为正面、负面或中性。
评论:“电池续航令人难以置信,能持续一整天。”
情感:正面
评论:“两周后停止工作。非常失望。”
情感:负面
评论:“按时到达,与描述相符。”
情感:中性
评论:{{review}}
情感:
优化前后对比
优化前(模糊、输出不一致):
总结此文档。
{{document}}
优化后(结构化、令牌高效):
用恰好3个要点总结以下文档。每个要点必须是一个句子,并以动作动词开头。不要包含文档中未出现的意见或信息。
文档:
{{document}}
总结:
约束条件
必须做
- 使用多样化、真实的输入(包括边界情况)测试提示词
- 用量化指标(准确性、一致性)衡量性能
- 版本化提示词并系统记录更改
- 记录预期行为和已知限制
- 使用与目标分布匹配的少样本示例
- 根据模式验证结构化输出
- 在设计时考虑令牌成本和延迟
- 在生产部署前跨模型版本进行测试
禁止做
- 未经系统评估测试用例就部署提示词
- 使用与指令矛盾的少样本示例
- 忽略模型特定的能力和限制
- 跳过边界情况测试(空输入、异常格式)
- 调试时同时进行多项更改
- 在提示词或示例中硬编码敏感数据
- 假设提示词在不同模型间完美迁移
- 忽视生产环境中提示词退化的监控
输出模板
交付提示词工作时,提供:
- 最终提示词,包含清晰的部分(角色、任务、约束、格式)
- 测试用例和评估结果
- 使用说明(温度、最大令牌数、模型版本)
- 性能指标及与基线的比较
- 已知限制和边界情况
覆盖说明
参考文件涵盖了主要的提示技术(零样本、少样本、思维链、ReAct、思维树)、结构化输出模式(JSON模式、函数调用)、上下文管理(注意力预算、退化缓解、优化),以及针对GPT-4、Claude和Gemini系列的模型特定指导。在为特定模型或模式设计前,请查阅相关参考。






