vision-mcp
Adds image recognition and UI grounding capabilities to text-only LLMs through MCP tools, supporting local and cloud vision backends.
README
vision-mcp
给纯文本模型(如 DeepSeek)补上"看图"能力的 MCP 服务器 | Vision MCP server: image recognition for text-only models (DeepSeek, etc.)
这是什么 / What
vision-mcp 是一个标准的 MCP 服务器:通过 MCP 工具为不支持图片输入的大模型(如 deepseek-v4-flash)提供图像识别能力。
不依赖任何特定客户端——Codex、Claude Code、Cursor、Cline、opencode 等任何支持 MCP 的 agent 都能用,别人不需要安装 opencode。
- 默认后端:OpenCode Zen MiMo V2.5 Free(
mimo-v2.5-free)——免费、无需 API key,识别质量好。 - 可选后端:本地 Ollama(
qwen2.5vl-vision)——离线/隐私场景,图片不出本机。 - 可选:任何 Zen 模型列表里的模型(如
gpt-5.6-luna、qwen3.6-plus),直接传裸模型名即可。
工具 / Tools
| 工具 | 说明 |
|---|---|
vision_recognize |
识别/描述图片(内容、文字、颜色、布局、物体位置)。输入支持:本地路径、http(s) URL、file:// URL、data: URI。 |
vision_grounding |
用本地 Ollama 分析 UI 截图,输出交互元素及归一化坐标(0–1000,多轮投票合并)。用于 GUI 自动化。 |
vision_status |
健康检查:Zen 可达性 + Ollama 可达性,列出可用模型。 |
安装运行 / Install & run
npm install -g vision-mcp # 或本地:npm run build && node dist/index.js
vision-mcp # 启动 stdio MCP 服务器
vision-mcp doctor # 诊断报告(后端可达性/模型列表)
或者不安装直接用:
npx -y vision-mcp
要求 Node.js 18+。
客户端配置 / Client configuration
Codex(~/.codex/config.toml):
[mcp_servers.vision]
command = "npx"
args = ["-y", "vision-mcp"]
Claude Code:
claude mcp add vision -- npx -y vision-mcp
opencode(opencode.json):
{
"mcp": {
"vision": {
"type": "local",
"command": ["npx", "-y", "vision-mcp"],
"enabled": true
}
}
}
Cursor:设置 → MCP → 添加 → 命令:npx -y vision-mcp
使用 / Usage
直接让你的 agent "看一下 / 描述 / 读一下这张图",把路径或 URL 给它:
描述 C:\path\to\image.png —— 图里有什么文字和物体?
agent 会自动调用 vision_recognize。GUI 自动化场景:vision_grounding —— "列出 screenshot.png 里的按钮及其位置"。
配置(环境变量)/ Configuration
| 变量 | 默认值 | 说明 |
|---|---|---|
ZEN_BASE |
https://opencode.ai/zen |
OpenCode Zen 端点 |
ZEN_MODEL |
mimo-v2.5-free |
默认 Zen 模型(免费) |
ZEN_API_KEY / OPENCODE_ZEN_API_KEY |
— | 可选,使用付费 Zen 模型时需要 |
OLLAMA_BASE |
http://127.0.0.1:11434 |
本地 Ollama 端点 |
OLLAMA_MODEL |
qwen2.5vl-vision |
本地 Ollama 视觉模型 |
VISION_TIMEOUT_MS |
180000 |
单次请求超时 |
GROUNDING_ROUNDS |
3 |
grounding 投票轮数 |
vision_recognize 传 model: "local" 强制走本地 Ollama;否则默认用 Zen 模型。任意裸模型名(如 gpt-5.6-luna)会直接透传给 Zen。
隐私说明 / Privacy
默认免费模型 mimo-v2.5-free 为尽力提供,可能随时变更;免费期间数据可能用于改进模型。敏感图片请配置 API key 或使用 model: "local" 全本地处理。
开发 / Development
npm install
npm run build # tsc -> dist/
node scripts/smoke-test.mjs # 端到端 MCP 客户端冒烟测试(需联网,可选 Ollama)
npm run doctor # 同 node dist/index.js doctor
许可证 / License
MIT
推荐服务器
Baidu Map
百度地图核心API现已全面兼容MCP协议,是国内首家兼容MCP协议的地图服务商。
Playwright MCP Server
一个模型上下文协议服务器,它使大型语言模型能够通过结构化的可访问性快照与网页进行交互,而无需视觉模型或屏幕截图。
Magic Component Platform (MCP)
一个由人工智能驱动的工具,可以从自然语言描述生成现代化的用户界面组件,并与流行的集成开发环境(IDE)集成,从而简化用户界面开发流程。
Audiense Insights MCP Server
通过模型上下文协议启用与 Audiense Insights 账户的交互,从而促进营销洞察和受众数据的提取和分析,包括人口统计信息、行为和影响者互动。
VeyraX
一个单一的 MCP 工具,连接你所有喜爱的工具:Gmail、日历以及其他 40 多个工具。
graphlit-mcp-server
模型上下文协议 (MCP) 服务器实现了 MCP 客户端与 Graphlit 服务之间的集成。 除了网络爬取之外,还可以将任何内容(从 Slack 到 Gmail 再到播客订阅源)导入到 Graphlit 项目中,然后从 MCP 客户端检索相关内容。
Kagi MCP Server
一个 MCP 服务器,集成了 Kagi 搜索功能和 Claude AI,使 Claude 能够在回答需要最新信息的问题时执行实时网络搜索。
e2b-mcp-server
使用 MCP 通过 e2b 运行代码。
Neon MCP Server
用于与 Neon 管理 API 和数据库交互的 MCP 服务器
Exa MCP Server
模型上下文协议(MCP)服务器允许像 Claude 这样的 AI 助手使用 Exa AI 搜索 API 进行网络搜索。这种设置允许 AI 模型以安全和受控的方式获取实时的网络信息。