
vision-analysis
熱門使用 MiniMax 視覺 MCP 工具對圖片進行分析、描述與資訊擷取。適用時機:使用者分享圖片檔案路徑或 URL(訊息中包含 .jpg、.jpeg、.png、.gif、.webp、.bmp 或 .svg 等副檔名),或在附帶圖片、螢幕截圖、圖表、Mockup、線框圖(Wireframe)或照片時使用以下字詞:「分析」、「描述」、「解釋」、「理解」、「看看」、「審視」、「擷取文字」、「OCR」、「裡面有什麼」、「讀取這張圖」、「看這張圖」、「告訴我關於」、「解釋這個」、「解讀這個」。此外亦適用於:UI Mockup 審查、線框圖分析、設計評估、圖表資料擷取、物件偵測、人物/動物/活動識別。觸發條件:任何包含圖片副檔名(jpg, jpeg, png, gif, webp, bmp, svg)的訊息,或任何要求對圖片、截圖、圖表、照片、Mockup 或線框圖進行分析、描述、理解、審視、擷取文字的請求。
使用 MiniMax 視覺 MCP 工具對圖片進行分析、描述與資訊擷取。適用時機:使用者分享圖片檔案路徑或 URL(訊息中包含 .jpg、.jpeg、.png、.gif、.webp、.bmp 或 .svg 等副檔名),或在附帶圖片、螢幕截圖、圖表、Mockup、線框圖(Wireframe)或照片時使用以下字詞:「分析」、「描述」、「解釋」、「理解」、「看看」、「審視」、「擷取文字」、「OCR」、「裡面有什麼」、「讀取這張圖」、「看這張圖」、「告訴我關於」、「解釋這個」、「解讀這個」。此外亦適用於:UI Mockup 審查、線框圖分析、設計評估、圖表資料擷取、物件偵測、人物/動物/活動識別。觸發條件:任何包含圖片副檔名(jpg, jpeg, png, gif, webp, bmp, svg)的訊息,或任何要求對圖片、截圖、圖表、照片、Mockup 或線框圖進行分析、描述、理解、審視、擷取文字的請求。
Vision Analysis
使用 MiniMax Token Plan 中提供的 MiniMax MiniMax_understand_image MCP 工具進行圖片分析。
前置需求
- 擁有 MiniMax Token Plan 訂閱方案以及有效的
MINIMAX_API_KEY - 已設定 MiniMax MCP(可使用
MiniMax_understand_image工具)
若尚未設定 MCP 工具
步驟 1: Agent 應從以下連結獲取設定說明:
https://platform.minimaxi.com/docs/token-plan/mcp-guide
步驟 2: 偵測使用者的開發環境(OpenCode、Cursor、Claude Code 等),並輸出所需的精確命令。常見範例如下:
OpenCode — 新增至 ~/.config/opencode/opencode.json 或 package.json:
{
"mcp": {
"MiniMax": {
"type": "local",
"command": ["uvx", "minimax-coding-plan-mcp", "-y"],
"environment": {
"MINIMAX_API_KEY": "YOUR_TOKEN_PLAN_KEY",
"MINIMAX_API_HOST": "https://api.minimaxi.com"
},
"enabled": true
}
}
}
Claude Code:
claude mcp add -s user MiniMax --env MINIMAX_API_KEY=your-key --env MINIMAX_API_HOST=https://api.minimaxi.com -- uvx minimax-coding-plan-mcp -y
Cursor — 新增至 MCP 設定:
{
"mcpServers": {
"MiniMax": {
"command": "uvx",
"args": ["minimax-coding-plan-mcp"],
"env": {
"MINIMAX_API_KEY": "your-key",
"MINIMAX_API_HOST": "https://api.minimaxi.com"
}
}
}
}
步驟 3: 設定完成後,請提醒使用者重啟應用程式,並透過 /mcp 進行驗證。
重要事項: 若使用者未訂閱 MiniMax Token Plan,請告知對方 understand_image 工具需要 Token Plan 訂閱才能使用,無法搭配免費版或其他層級的 API Key。
分析模式
| 模式 | 適用時機 | Prompt 策略 |
|---|---|---|
describe |
一般圖片理解 | 要求提供詳細描述 |
ocr |
從螢幕截圖、文件擷取文字 | 要求逐字擷取所有文字 |
ui-review |
UI Mockup、線框圖、設計稿 | 要求提供設計評估與改善建議 |
chart-data |
圖表、統計圖、資料視覺化 | 要求擷取資料點與趨勢 |
object-detect |
識別物件、人物、活動 | 要求列出並標示所有元素的位置 |
工作流程
步驟 1:自動偵測圖片
當訊息包含以下副檔名的圖片檔案路徑或 URL 時,本 Skill 將自動觸發:
.jpg、.jpeg、.png、.gif、.webp、.bmp、.svg
請從訊息中擷取出圖片路徑。
步驟 2:選擇分析模式並呼叫 MCP 工具
使用 MiniMax_understand_image 工具,並搭配對應模式的 Prompt:
describe:
請提供這張圖片的詳細描述。包含:主要主體、場景/背景、色彩/風格、任何可見文字、值得注意的物件以及整體構圖。
ocr:
請逐字擷取這張圖片中所有可見的文字。保持原本的結構與格式(標題、清單、欄位)。如果未發現任何文字,請明確說明。
ui-review:
你是一位 UI/UX 設計審查員。請分析此介面 Mockup 或設計稿,並提供:(1) 優點——哪些部分設計得很好,(2) 問題——可用性或設計上的缺失,(3) 具體且可執行的改善建議。請保持建設性與詳細度。
chart-data:
請擷取此圖表或統計圖中的所有資料。列出:圖表標題、軸線標籤、所有可讀取的資料點/數列數值,以及趨勢的簡短總結。
object-detect:
請列出所有你可以識別出的獨立物件、人物與活動。針對每一項,描述其為何物以及在圖片中的大致位置。
步驟 3:呈現結果
清晰地傳回分析結果。對於 describe 模式,使用流暢易讀的文句;對於 ocr 模式,保留原文結構;對於 ui-review 模式,使用結構化的評估格式。
輸出格式範例
describe 模式:
## 圖片描述
[圖片內容的詳細描述...]
ocr 模式:
## 擷取的文字
[保留自圖片的文字結構]
ui-review 模式:
## UI 設計審查
### 優點
- ...
### 問題
- ...
### 建議
- ...
注意事項
- 支援最高 20MB 的圖片(JPEG、PNG、GIF、WebP)
- 若 MiniMax MCP 已設定檔案存取權限,則可支援本機檔案路徑
MiniMax_understand_image工具由minimax-coding-plan-mcp套件提供





