vision-analysis

vision-analysis

热门

使用 MiniMax 视觉 MCP 工具对图片进行分析、描述和提取信息。适用场景:用户发送了图片文件路径或 URL(消息中包含 .jpg、.jpeg、.png、.gif、.webp、.bmp 或 .svg 等扩展名),或在涉及图片、截图、架构图、图表、UI 原型、线框图或照片时使用了以下词汇/短语:“分析”、“描述”、“解释”、“理解”、“看看”、“评审”、“提取文本”、“OCR”、“里面有什么”、“读取图片”、“看下这张图”、“告诉我”、“解读”。此外还适用于:UI 原型评审、线框图分析、设计点评、图表数据提取、目标检测、人物/动物/活动识别。触发条件:任何包含图片扩展名(jpg, jpeg, png, gif, webp, bmp, svg)的消息,或任何要求对图片、截图、架构图、图表、照片、原型或线框图进行分析/描述/理解/评审/提取文本的请求。

1.3万Star
1130Fork
更新于 2026/4/18
SKILL.md
只读
名称
vision-analysis
描述

使用 MiniMax 视觉 MCP 工具对图片进行分析、描述和提取信息。适用场景:用户发送了图片文件路径或 URL(消息中包含 .jpg、.jpeg、.png、.gif、.webp、.bmp 或 .svg 等扩展名),或在涉及图片、截图、架构图、图表、UI 原型、线框图或照片时使用了以下词汇/短语:“分析”、“描述”、“解释”、“理解”、“看看”、“评审”、“提取文本”、“OCR”、“里面有什么”、“读取图片”、“看下这张图”、“告诉我”、“解读”。此外还适用于:UI 原型评审、线框图分析、设计点评、图表数据提取、目标检测、人物/动物/活动识别。触发条件:任何包含图片扩展名(jpg, jpeg, png, gif, webp, bmp, svg)的消息,或任何要求对图片、截图、架构图、图表、照片、原型或线框图进行分析/描述/理解/评审/提取文本的请求。

图片分析 (Vision Analysis)

使用 MiniMax Token Plan 中提供的 MiniMax MiniMax_understand_image MCP 工具分析图片。

前置条件

  • 已订阅 MiniMax Token Plan 并拥有有效的 MINIMAX_API_KEY
  • 已配置 MiniMax MCP(确保 MiniMax_understand_image 工具可用)

若未配置 MCP 工具

步骤 1: Agent 应从以下网址获取配置指南:
https://platform.minimaxi.com/docs/token-plan/mcp-guide

步骤 2: 检测用户的开发环境(OpenCode、Cursor、Claude Code 等)并输出所需的具体配置或命令。常见示例如下:

OpenCode — 添加到 ~/.config/opencode/opencode.jsonpackage.json

{
  "mcp": {
    "MiniMax": {
      "type": "local",
      "command": ["uvx", "minimax-coding-plan-mcp", "-y"],
      "environment": {
        "MINIMAX_API_KEY": "YOUR_TOKEN_PLAN_KEY",
        "MINIMAX_API_HOST": "https://api.minimaxi.com"
      },
      "enabled": true
    }
  }
}

Claude Code

claude mcp add -s user MiniMax --env MINIMAX_API_KEY=your-key --env MINIMAX_API_HOST=https://api.minimaxi.com -- uvx minimax-coding-plan-mcp -y

Cursor — 添加到 MCP 设置中:

{
  "mcpServers": {
    "MiniMax": {
      "command": "uvx",
      "args": ["minimax-coding-plan-mcp"],
      "env": {
        "MINIMAX_API_KEY": "your-key",
        "MINIMAX_API_HOST": "https://api.minimaxi.com"
      }
    }
  }
}

步骤 3: 配置完成后,提示用户重启应用并通过 /mcp 进行验证。

重要说明: 如果用户未订阅 MiniMax Token Plan,请告知对方 understand_image 工具需要 Token Plan 订阅权限 — 免费版或其它层级的 API Key 无法调用该工具。

分析模式

模式 适用场景 Prompt 策略
describe 通用图像理解 请求详细的图片内容描述
ocr 从截图、文档中提取文字 请求原样逐字提取图片中的所有文本
ui-review UI 原型、线框图、设计稿 请求针对 UI/UX 设计给出评审意见与优化建议
chart-data 图表、统计图、数据可视化 请求提取关键数据点及趋势总结
object-detect 识别物体、人物、活动 请求列出并定位图片中的所有元素

工作流

步骤 1:自动识别图片

当消息中包含以下扩展名的图片文件路径或 URL 时,技能将自动触发:
.jpg, .jpeg, .png, .gif, .webp, .bmp, .svg

从消息中提取图片路径。

步骤 2:选择分析模式并调用 MCP 工具

针对对应模式选择专属的 Prompt,调用 MiniMax_understand_image 工具:

describe:

Provide a detailed description of this image. Include: main subject, setting/background,
colors/style, any text visible, notable objects, and overall composition.

ocr:

Extract all text visible in this image verbatim. Preserve structure and formatting
(headers, lists, columns). If no text is found, say so.

ui-review:

You are a UI/UX design reviewer. Analyze this interface mockup or design. Provide:
(1) Strengths — what works well, (2) Issues — usability or design problems,
(3) Specific, actionable suggestions for improvement. Be constructive and detailed.

chart-data:

Extract all data from this chart or graph. List: chart title, axis labels, all
data points/series with values if readable, and a brief summary of the trend.

object-detect:

List all distinct objects, people, and activities you can identify. For each,
describe what it is and its approximate location in the image.

步骤 3:展示结果

清晰直观地呈现分析结果。对于 describe 模式,使用流畅易读的段落叙述;对于 ocr 模式,保持原始文本结构;对于 ui-review 模式,使用结构化的点评格式输出。

输出格式示例

describe 模式:

## Image Description

[Detailed description of the image contents...]

ocr 模式:

## Extracted Text

[Preserved text structure from the image]

ui-review 模式:

## UI Design Review

### Strengths
- ...

### Issues
- ...

### Suggestions
- ...

注意事项

  • 最大支持 20MB 的图片文件(JPEG, PNG, GIF, WebP)
  • 若 MiniMax MCP 已配置本地文件访问权限,则支持直接传入本地文件路径
  • MiniMax_understand_image 工具由 minimax-coding-plan-mcp 包提供