vision-mcp

vision-mcp

Adds image recognition and UI grounding capabilities to text-only LLMs through MCP tools, supporting local and cloud vision backends.

Category
访问服务器

README

vision-mcp

给纯文本模型(如 DeepSeek)补上"看图"能力的 MCP 服务器 | Vision MCP server: image recognition for text-only models (DeepSeek, etc.)

English | 中文

这是什么 / What

vision-mcp 是一个标准的 MCP 服务器:通过 MCP 工具为不支持图片输入的大模型(如 deepseek-v4-flash)提供图像识别能力。

不依赖任何特定客户端——Codex、Claude Code、Cursor、Cline、opencode 等任何支持 MCP 的 agent 都能用,别人不需要安装 opencode。

  • 默认后端:OpenCode Zen MiMo V2.5 Freemimo-v2.5-free)——免费、无需 API key,识别质量好。
  • 可选后端:本地 Ollamaqwen2.5vl-vision)——离线/隐私场景,图片不出本机。
  • 可选:任何 Zen 模型列表里的模型(如 gpt-5.6-lunaqwen3.6-plus),直接传裸模型名即可。

工具 / Tools

工具 说明
vision_recognize 识别/描述图片(内容、文字、颜色、布局、物体位置)。输入支持:本地路径、http(s) URL、file:// URL、data: URI。
vision_grounding 用本地 Ollama 分析 UI 截图,输出交互元素及归一化坐标(0–1000,多轮投票合并)。用于 GUI 自动化。
vision_status 健康检查:Zen 可达性 + Ollama 可达性,列出可用模型。

安装运行 / Install & run

npm install -g vision-mcp    # 或本地:npm run build && node dist/index.js
vision-mcp                   # 启动 stdio MCP 服务器
vision-mcp doctor            # 诊断报告(后端可达性/模型列表)

或者不安装直接用:

npx -y vision-mcp

要求 Node.js 18+。

客户端配置 / Client configuration

Codex~/.codex/config.toml):

[mcp_servers.vision]
command = "npx"
args = ["-y", "vision-mcp"]

Claude Code

claude mcp add vision -- npx -y vision-mcp

opencodeopencode.json):

{
  "mcp": {
    "vision": {
      "type": "local",
      "command": ["npx", "-y", "vision-mcp"],
      "enabled": true
    }
  }
}

Cursor:设置 → MCP → 添加 → 命令:npx -y vision-mcp

使用 / Usage

直接让你的 agent "看一下 / 描述 / 读一下这张图",把路径或 URL 给它:

描述 C:\path\to\image.png —— 图里有什么文字和物体?

agent 会自动调用 vision_recognize。GUI 自动化场景:vision_grounding —— "列出 screenshot.png 里的按钮及其位置"。

配置(环境变量)/ Configuration

变量 默认值 说明
ZEN_BASE https://opencode.ai/zen OpenCode Zen 端点
ZEN_MODEL mimo-v2.5-free 默认 Zen 模型(免费)
ZEN_API_KEY / OPENCODE_ZEN_API_KEY 可选,使用付费 Zen 模型时需要
OLLAMA_BASE http://127.0.0.1:11434 本地 Ollama 端点
OLLAMA_MODEL qwen2.5vl-vision 本地 Ollama 视觉模型
VISION_TIMEOUT_MS 180000 单次请求超时
GROUNDING_ROUNDS 3 grounding 投票轮数

vision_recognizemodel: "local" 强制走本地 Ollama;否则默认用 Zen 模型。任意裸模型名(如 gpt-5.6-luna)会直接透传给 Zen。

隐私说明 / Privacy

默认免费模型 mimo-v2.5-free 为尽力提供,可能随时变更;免费期间数据可能用于改进模型。敏感图片请配置 API key 或使用 model: "local" 全本地处理。

开发 / Development

npm install
npm run build        # tsc -> dist/
node scripts/smoke-test.mjs   # 端到端 MCP 客户端冒烟测试(需联网,可选 Ollama)
npm run doctor       # 同 node dist/index.js doctor

许可证 / License

MIT

推荐服务器

Baidu Map

Baidu Map

百度地图核心API现已全面兼容MCP协议,是国内首家兼容MCP协议的地图服务商。

官方
精选
JavaScript
Playwright MCP Server

Playwright MCP Server

一个模型上下文协议服务器,它使大型语言模型能够通过结构化的可访问性快照与网页进行交互,而无需视觉模型或屏幕截图。

官方
精选
TypeScript
Magic Component Platform (MCP)

Magic Component Platform (MCP)

一个由人工智能驱动的工具,可以从自然语言描述生成现代化的用户界面组件,并与流行的集成开发环境(IDE)集成,从而简化用户界面开发流程。

官方
精选
本地
TypeScript
Audiense Insights MCP Server

Audiense Insights MCP Server

通过模型上下文协议启用与 Audiense Insights 账户的交互,从而促进营销洞察和受众数据的提取和分析,包括人口统计信息、行为和影响者互动。

官方
精选
本地
TypeScript
VeyraX

VeyraX

一个单一的 MCP 工具,连接你所有喜爱的工具:Gmail、日历以及其他 40 多个工具。

官方
精选
本地
graphlit-mcp-server

graphlit-mcp-server

模型上下文协议 (MCP) 服务器实现了 MCP 客户端与 Graphlit 服务之间的集成。 除了网络爬取之外,还可以将任何内容(从 Slack 到 Gmail 再到播客订阅源)导入到 Graphlit 项目中,然后从 MCP 客户端检索相关内容。

官方
精选
TypeScript
Kagi MCP Server

Kagi MCP Server

一个 MCP 服务器,集成了 Kagi 搜索功能和 Claude AI,使 Claude 能够在回答需要最新信息的问题时执行实时网络搜索。

官方
精选
Python
e2b-mcp-server

e2b-mcp-server

使用 MCP 通过 e2b 运行代码。

官方
精选
Neon MCP Server

Neon MCP Server

用于与 Neon 管理 API 和数据库交互的 MCP 服务器

官方
精选
Exa MCP Server

Exa MCP Server

模型上下文协议(MCP)服务器允许像 Claude 这样的 AI 助手使用 Exa AI 搜索 API 进行网络搜索。这种设置允许 AI 模型以安全和受控的方式获取实时的网络信息。

官方
精选