
vision-analysis
热门使用 MiniMax 视觉 MCP 工具对图片进行分析、描述和提取信息。适用场景:用户发送了图片文件路径或 URL(消息中包含 .jpg、.jpeg、.png、.gif、.webp、.bmp 或 .svg 等扩展名),或在涉及图片、截图、架构图、图表、UI 原型、线框图或照片时使用了以下词汇/短语:“分析”、“描述”、“解释”、“理解”、“看看”、“评审”、“提取文本”、“OCR”、“里面有什么”、“读取图片”、“看下这张图”、“告诉我”、“解读”。此外还适用于:UI 原型评审、线框图分析、设计点评、图表数据提取、目标检测、人物/动物/活动识别。触发条件:任何包含图片扩展名(jpg, jpeg, png, gif, webp, bmp, svg)的消息,或任何要求对图片、截图、架构图、图表、照片、原型或线框图进行分析/描述/理解/评审/提取文本的请求。
使用 MiniMax 视觉 MCP 工具对图片进行分析、描述和提取信息。适用场景:用户发送了图片文件路径或 URL(消息中包含 .jpg、.jpeg、.png、.gif、.webp、.bmp 或 .svg 等扩展名),或在涉及图片、截图、架构图、图表、UI 原型、线框图或照片时使用了以下词汇/短语:“分析”、“描述”、“解释”、“理解”、“看看”、“评审”、“提取文本”、“OCR”、“里面有什么”、“读取图片”、“看下这张图”、“告诉我”、“解读”。此外还适用于:UI 原型评审、线框图分析、设计点评、图表数据提取、目标检测、人物/动物/活动识别。触发条件:任何包含图片扩展名(jpg, jpeg, png, gif, webp, bmp, svg)的消息,或任何要求对图片、截图、架构图、图表、照片、原型或线框图进行分析/描述/理解/评审/提取文本的请求。
图片分析 (Vision Analysis)
使用 MiniMax Token Plan 中提供的 MiniMax MiniMax_understand_image MCP 工具分析图片。
前置条件
- 已订阅 MiniMax Token Plan 并拥有有效的
MINIMAX_API_KEY - 已配置 MiniMax MCP(确保
MiniMax_understand_image工具可用)
若未配置 MCP 工具
步骤 1: Agent 应从以下网址获取配置指南:
https://platform.minimaxi.com/docs/token-plan/mcp-guide
步骤 2: 检测用户的开发环境(OpenCode、Cursor、Claude Code 等)并输出所需的具体配置或命令。常见示例如下:
OpenCode — 添加到 ~/.config/opencode/opencode.json 或 package.json:
{
"mcp": {
"MiniMax": {
"type": "local",
"command": ["uvx", "minimax-coding-plan-mcp", "-y"],
"environment": {
"MINIMAX_API_KEY": "YOUR_TOKEN_PLAN_KEY",
"MINIMAX_API_HOST": "https://api.minimaxi.com"
},
"enabled": true
}
}
}
Claude Code:
claude mcp add -s user MiniMax --env MINIMAX_API_KEY=your-key --env MINIMAX_API_HOST=https://api.minimaxi.com -- uvx minimax-coding-plan-mcp -y
Cursor — 添加到 MCP 设置中:
{
"mcpServers": {
"MiniMax": {
"command": "uvx",
"args": ["minimax-coding-plan-mcp"],
"env": {
"MINIMAX_API_KEY": "your-key",
"MINIMAX_API_HOST": "https://api.minimaxi.com"
}
}
}
}
步骤 3: 配置完成后,提示用户重启应用并通过 /mcp 进行验证。
重要说明: 如果用户未订阅 MiniMax Token Plan,请告知对方 understand_image 工具需要 Token Plan 订阅权限 — 免费版或其它层级的 API Key 无法调用该工具。
分析模式
| 模式 | 适用场景 | Prompt 策略 |
|---|---|---|
describe |
通用图像理解 | 请求详细的图片内容描述 |
ocr |
从截图、文档中提取文字 | 请求原样逐字提取图片中的所有文本 |
ui-review |
UI 原型、线框图、设计稿 | 请求针对 UI/UX 设计给出评审意见与优化建议 |
chart-data |
图表、统计图、数据可视化 | 请求提取关键数据点及趋势总结 |
object-detect |
识别物体、人物、活动 | 请求列出并定位图片中的所有元素 |
工作流
步骤 1:自动识别图片
当消息中包含以下扩展名的图片文件路径或 URL 时,技能将自动触发:
.jpg, .jpeg, .png, .gif, .webp, .bmp, .svg
从消息中提取图片路径。
步骤 2:选择分析模式并调用 MCP 工具
针对对应模式选择专属的 Prompt,调用 MiniMax_understand_image 工具:
describe:
Provide a detailed description of this image. Include: main subject, setting/background,
colors/style, any text visible, notable objects, and overall composition.
ocr:
Extract all text visible in this image verbatim. Preserve structure and formatting
(headers, lists, columns). If no text is found, say so.
ui-review:
You are a UI/UX design reviewer. Analyze this interface mockup or design. Provide:
(1) Strengths — what works well, (2) Issues — usability or design problems,
(3) Specific, actionable suggestions for improvement. Be constructive and detailed.
chart-data:
Extract all data from this chart or graph. List: chart title, axis labels, all
data points/series with values if readable, and a brief summary of the trend.
object-detect:
List all distinct objects, people, and activities you can identify. For each,
describe what it is and its approximate location in the image.
步骤 3:展示结果
清晰直观地呈现分析结果。对于 describe 模式,使用流畅易读的段落叙述;对于 ocr 模式,保持原始文本结构;对于 ui-review 模式,使用结构化的点评格式输出。
输出格式示例
describe 模式:
## Image Description
[Detailed description of the image contents...]
ocr 模式:
## Extracted Text
[Preserved text structure from the image]
ui-review 模式:
## UI Design Review
### Strengths
- ...
### Issues
- ...
### Suggestions
- ...
注意事项
- 最大支持 20MB 的图片文件(JPEG, PNG, GIF, WebP)
- 若 MiniMax MCP 已配置本地文件访问权限,则支持直接传入本地文件路径
MiniMax_understand_image工具由minimax-coding-plan-mcp包提供





