受GAN启发的生成器-评估器智能体框架,用于自主构建高质量应用。基于Anthropic 2026年3月的框架设计论文。
GAN风格框架技能
灵感来源于 Anthropic的长时间运行应用开发框架设计(2026年3月24日)
一个多智能体框架,将生成与评估分离,形成对抗性反馈循环,从而将质量提升到单个智能体无法达到的水平。
核心洞察
当被要求评估自己的工作时,智能体是病态的乐观主义者——它们会赞美平庸的输出,并说服自己忽略合理的问题。但设计一个独立的评估器使其严格无情,远比教会生成器自我批评要容易得多。
这与GAN(生成对抗网络)的机制相同:生成器产生内容,评估器进行批评,反馈驱动下一轮迭代。
何时使用
- 从一行提示构建完整应用
- 需要高视觉质量的前端设计任务
- 需要工作功能而不仅仅是代码的全栈项目
- 任何“AI垃圾”美学不可接受的任务
- 愿意投入50-200美元以获得生产级质量输出的项目
何时不使用
- 快速单文件修复(使用标准
claude -p) - 预算紧张的任务(<10美元)
- 简单重构(改用去垃圾模式)
- 已有良好规范并附带测试的任务(使用TDD工作流)
架构
┌─────────────┐
│ 规划器 │
│ (Opus 4.6) │
└──────┬──────┘
│ 产品规格
│ (功能、冲刺、设计方向)
▼
┌────────────────────────┐
│ │
│ 生成器-评估器 │
│ 反馈循环 │
│ │
│ ┌──────────┐ │
│ │ 生成器 │--构建-->│──┐
│ │(Opus 4.6)│ │ │
│ └────▲─────┘ │ │
│ │ │ │ 实时应用
│ 反馈 │ │
│ │ │ │
│ ┌────┴─────┐ │ │
│ │ 评估器 │<-测试----│──┘
│ │(Opus 4.6)│ │
│ │+Playwright│ │
│ └──────────┘ │
│ │
│ 5-15次迭代 │
└────────────────────────┘
三个智能体
1. 规划器智能体
角色: 产品经理——将简短的提示扩展为完整的产品规格。
关键行为:
- 接收一行提示,生成包含16个功能、多个冲刺的规格
- 定义用户故事、技术需求和视觉设计方向
- 故意雄心勃勃——保守规划会导致平庸结果
- 生成评估器后续使用的评估标准
模型: Opus 4.6(需要深度推理进行规格扩展)
2. 生成器智能体
角色: 开发者——根据规格实现功能。
关键行为:
- 在结构化冲刺中工作(或使用新模型的连续模式)
- 在编写代码前与评估器协商“冲刺合同”
- 使用全栈工具:React、FastAPI/Express、数据库、CSS
- 管理git进行迭代间的版本控制
- 读取评估器反馈并在下一次迭代中融入
模型: Opus 4.6(需要强大的编码能力)
3. 评估器智能体
角色: QA工程师——测试实时运行的应用,而不仅仅是代码。
关键行为:
- 使用Playwright MCP与实时应用交互
- 点击功能、填写表单、测试API端点
- 根据四个标准(可配置)评分:
- 设计质量——整体是否协调一致?
- 原创性——自定义决策 vs. 模板/AI模式?
- 工艺——排版、间距、动画、微交互?
- 功能性——所有功能是否实际可用?
- 返回带有分数和具体问题的结构化反馈
- 设计为严格无情——从不赞美平庸的工作
模型: Opus 4.6(需要强大的判断力和工具使用能力)
评估标准
默认四个标准,每个评分1-10:
## 评估细则
### 设计质量(权重:0.3)
- 1-3:通用、模板化、“AI垃圾”美学
- 4-6:合格但不出众,遵循常规
- 7-8:独特、连贯的视觉标识
- 9-10:可媲美专业设计师的作品
### 原创性(权重:0.2)
- 1-3:默认颜色、标准布局、无个性
- 4-6:一些自定义选择,大多为标准模式
- 7-8:清晰的创意愿景,独特的方法
- 9-10:令人惊喜、愉悦、真正新颖
### 工艺(权重:0.3)
- 1-3:布局破损、缺少状态、无动画
- 4-6:可用但感觉粗糙、间距不一致
- 7-8:精致、流畅的过渡、响应式
- 9-10:像素完美、令人愉悦的微交互
### 功能性(权重:0.2)
- 1-3:核心功能损坏或缺失
- 4-6:正常路径可用,边缘情况失败
- 7-8:所有功能可用,错误处理良好
- 9-10:无懈可击,处理所有边缘情况
评分
- 加权分数 = 总和(标准分数 * 权重)
- 通过阈值 = 7.0(可配置)
- 最大迭代次数 = 15(可配置,通常5-15次足够)
使用方法
通过命令
# 完整三智能体框架
/project:gan-build "构建一个包含看板、团队协作和深色模式的项目管理应用"
# 自定义配置
/project:gan-build "构建一个食谱分享平台" --max-iterations 10 --pass-threshold 7.5
# 前端设计模式(仅生成器+评估器,无规划器)
/project:gan-design "为加密货币投资组合追踪器创建着陆页"
通过Shell脚本
# 基本用法
./scripts/gan-harness.sh "构建一个音乐流媒体仪表盘"
# 带选项
GAN_MAX_ITERATIONS=10 \
GAN_PASS_THRESHOLD=7.5 \
GAN_EVAL_CRITERIA="functionality,performance,security" \
./scripts/gan-harness.sh "构建一个任务管理的REST API"
通过Claude Code(手动)
# 步骤1:规划
claude -p --model opus "你是一个产品规划器。阅读PLANNER_PROMPT.md。将以下简要扩展为完整产品规格:'构建一个看板应用'。将规格写入spec.md"
# 步骤2:生成(第1次迭代)
claude -p --model opus "你是一个生成器。阅读spec.md。实现冲刺1。在端口3000启动开发服务器。"
# 步骤3:评估(第1次迭代)
claude -p --model opus --allowedTools "Read,Bash,mcp__playwright__*" "你是一个评估器。阅读EVALUATOR_PROMPT.md。测试位于http://localhost:3000的实时应用。根据细则评分。将反馈写入feedback-001.md"
# 步骤4:生成(第2次迭代——读取反馈)
claude -p --model opus "你是一个生成器。阅读spec.md和feedback-001.md。解决所有问题。提高分数。"
# 重复步骤3-4直到达到通过阈值
随模型能力的演进
框架应随着模型改进而简化。遵循Anthropic的演进:
阶段1——较弱模型(Sonnet级别)
- 需要完整的冲刺分解
- 冲刺间重置上下文(避免上下文焦虑)
- 最少2个智能体:初始化器 + 编码智能体
- 大量脚手架弥补模型限制
阶段2——能力模型(Opus 4.5级别)
- 完整3智能体框架:规划器 + 生成器 + 评估器
- 每个实现阶段前签订冲刺合同
- 复杂应用分解为10个冲刺
- 上下文重置仍有帮助但不再关键
阶段3——前沿模型(Opus 4.6级别)
- 简化框架:单次规划,连续生成
- 评估简化为单次最终评估(模型更智能)
- 无需冲刺结构
- 自动压缩处理上下文增长
关键原则: 框架的每个组件都编码了对模型无法独立完成任务的假设。当模型改进时,重新测试这些假设。去掉不再需要的部分。
配置
环境变量
| 变量 | 默认值 | 描述 |
|---|---|---|
GAN_MAX_ITERATIONS |
15 |
最大生成器-评估器循环次数 |
GAN_PASS_THRESHOLD |
7.0 |
通过所需的加权分数(1-10) |
GAN_PLANNER_MODEL |
opus |
规划智能体的模型 |
GAN_GENERATOR_MODEL |
opus |
生成智能体的模型 |
GAN_EVALUATOR_MODEL |
opus |
评估智能体的模型 |
GAN_EVAL_CRITERIA |
design,originality,craft,functionality |
逗号分隔的标准 |
GAN_DEV_SERVER_PORT |
3000 |
实时应用的端口 |
GAN_DEV_SERVER_CMD |
npm run dev |
启动开发服务器的命令 |
GAN_PROJECT_DIR |
. |
项目工作目录 |
GAN_SKIP_PLANNER |
false |
跳过规划器,直接使用规格 |
GAN_EVAL_MODE |
playwright |
playwright、screenshot或code-only |
评估模式
| 模式 | 工具 | 最适合 |
|---|---|---|
playwright |
浏览器MCP + 实时交互 | 带UI的全栈应用 |
screenshot |
截图 + 视觉分析 | 静态网站、纯设计 |
code-only |
测试 + 代码检查 + 构建 | API、库、CLI工具 |
反模式
-
评估器过于宽松——如果评估器在第一次迭代就通过所有内容,说明你的细则过于慷慨。收紧评分标准,并对常见的AI模式添加明确惩罚。
-
生成器忽略反馈——确保反馈以文件形式传递,而非内联。生成器应在每次迭代开始时读取
feedback-NNN.md。 -
无限循环——始终设置
GAN_MAX_ITERATIONS。如果生成器在3次迭代后无法突破分数平台,停止并标记人工审查。 -
评估器测试表面化——评估器必须使用Playwright交互实时应用,而不仅仅是截图。点击按钮、填写表单、测试错误状态。
-
评估器赞扬自己的修复——绝不能让评估器建议修复然后评估这些修复。评估器只批评;生成器负责修复。
-
上下文耗尽——对于长时间会话,使用Claude Agent SDK的自动压缩或在主要阶段之间重置上下文。
结果:预期效果
基于Anthropic公布的结果:
| 指标 | 单智能体 | GAN框架 | 改进 |
|---|---|---|---|
| 时间 | 20分钟 | 4-6小时 | 长12-18倍 |
| 成本 | 9美元 | 125-200美元 | 多14-22倍 |
| 质量 | 勉强可用 | 生产就绪 | 质变 |
| 核心功能 | 损坏 | 全部可用 | 不适用 |
| 设计 | 通用AI垃圾 | 独特、精致 | 不适用 |
权衡显而易见: 约20倍的时间和成本换来输出质量的质的飞跃。这适用于质量至关重要的项目。
参考
- Anthropic:长时间运行应用的框架设计 —— Prithvi Rajasekaran的原始论文
- Epsilla:GAN风格智能体循环 —— 架构解构
- Martin Fowler:框架工程 —— 更广泛的行业背景
- OpenAI:框架工程 —— OpenAI的并行工作






