SKILL.md
readonly只读
name
nanobanana
description
使用 Google Gemini 3 Pro Image(Nano Banana Pro)生成和编辑图像。支持文生图、图像编辑、多种宽高比以及高分辨率输出(2K/4K)。当用户想要生成图像、创建图像、使用 Gemini 图像生成或进行 AI 图像生成时使用。
Nano Banana - AI 图像生成
使用 Google 的 Gemini 3 Pro Image 模型(gemini-3-pro-image-preview,昵称“Nano Banana Pro”🍌)生成和编辑图像。
前提条件
必需:
GEMINI_API_KEY- 从 Google AI Studio 获取- Python 3.10+ 及
google-genai包
安装依赖:
pip install google-genai pillow
快速开始
生成图像:
python3 <skill_dir>/scripts/generate.py "一个可爱的机器人吉祥物,像素艺术风格" -o robot.png
编辑现有图像:
python3 <skill_dir>/scripts/generate.py "将背景改为蓝色" -i input.jpg -o output.png
按特定宽高比生成:
python3 <skill_dir>/scripts/generate.py "电影感风景" --ratio 21:9 -o landscape.png
生成高分辨率 4K 图像:
python3 <skill_dir>/scripts/generate.py "专业产品照片" --size 4K -o product.png
脚本参考
scripts/generate.py
主图像生成脚本。
用法:generate.py [选项] PROMPT
参数:
PROMPT 图像生成的文本提示
选项:
-o, --output PATH 输出文件路径(默认:自动生成)
-i, --input PATH 用于编辑的输入图像(可选)
-r, --ratio RATIO 宽高比(1:1, 16:9, 9:16, 21:9 等)
-s, --size SIZE 图像尺寸:2K 或 4K(默认:标准)
--search 启用 Google 搜索接地以提高准确性
-v, --verbose 显示详细输出
支持的宽高比:
1:1- 正方形(默认)2:3,3:2- 竖屏/横屏3:4,4:3- 标准4:5,5:4- 照片9:16,16:9- 宽屏21:9- 超宽/电影感
scripts/batch_generate.py
批量生成多张图像,自动顺序命名。
用法:batch_generate.py [选项] PROMPT
参数:
PROMPT 图像生成的文本提示
选项:
-n, --count N 生成图像数量(默认:10)
-d, --dir PATH 输出目录
-p, --prefix STR 文件名前缀(默认:"image")
-r, --ratio RATIO 宽高比
-s, --size SIZE 图像尺寸(2K/4K)
--delay SECONDS 生成间隔秒数(默认:3)
示例:
python3 <skill_dir>/scripts/batch_generate.py "像素艺术标志" -n 20 -d ./logos -p logo
Python API
你也可以直接使用模块:
from generate import generate_image, edit_image
# 生成图像
result = generate_image(
prompt="夜晚的未来城市",
output_path="city.png",
aspect_ratio="16:9",
image_size="4K"
)
# 编辑现有图像
result = edit_image(
prompt="在天空中增加飞行汽车",
input_path="city.png",
output_path="city_edited.png"
)
环境变量
| 变量 | 描述 | 默认值 |
|---|---|---|
GEMINI_API_KEY |
Google Gemini API 密钥 | 必需 |
IMAGE_OUTPUT_DIR |
默认输出目录 | ./nanobanana-images |
功能
文生图
根据文本描述创建图像。该模型擅长:
- 逼真照片
- 艺术风格(像素艺术、插画等)
- 产品摄影
- 风景和场景
图像编辑
用自然语言转换现有图像:
- 风格迁移
- 添加/移除物体
- 背景更改
- 颜色调整
高分辨率输出
- 标准:快速生成,质量良好
- 2K:增强细节(2048px)
- 4K:最高质量(3840px),最适合文本渲染
Google 搜索接地
启用 --search 以获得涉及以下内容的准确图像:
- 真实人物、地点、地标
- 当前事件
- 特定产品或品牌
最佳实践
提示词编写
好的提示词包括:
- 主体描述
- 风格/美学
- 光线和氛围
- 构图细节
- 色彩调色板
示例:
"舒适的咖啡店内部,暖色调灯光,复古美学,
木质家具,架子上有植物,早晨阳光透过窗户,
背景柔焦,35mm 胶片摄影风格"
批量生成技巧
- 生成 10-20 个变体以探索选项
- 使用一致的提示词保持风格连贯
- 添加 3-5 秒延迟以避免速率限制
- 审查结果并在最佳候选中迭代
速率限制
- Gemini API 有使用配额
- 在批量生成之间添加延迟
- 在 Google AI Studio 检查你的配额
故障排除
"未找到 API 密钥"
- 设置
GEMINI_API_KEY环境变量 - 或通过
--api-key选项传递
"响应中无图像"
- 提示词可能触发了安全过滤器
- 尝试重新措辞以避免敏感内容
"超出速率限制"
- 等待几秒后重试
- 减少批量大小或增加延迟
参考
- references/prompts.md - 按类别分类的提示词示例
- examples/ - 示例使用脚本






