Vision Bridge MCP
A universal vision MCP server that enables Claude Code and Claude Desktop to describe images, extract text, and answer questions about images by converting visual content to text via multiple AI providers.
README
Vision Bridge MCP
通用视觉 MCP 服务器,支持多种多模态 API 格式。当 Claude Code / Claude Desktop 使用的模型无法直接处理图片时,可通过该 MCP 工具将图片内容转换为文字描述,从而间接“看懂”图片。
功能
提供 3 个 MCP 工具:
describe_image:详细描述图片内容(对象、场景、文字、人物动作、颜色、布局等)。extract_image_text:提取图片中的所有文字(OCR)。ask_about_image:针对图片回答具体问题。
支持四种图片输入方式:
image_url:图片 URLimage_path:本地图片路径image_base64:Base64 编码的图片数据image:Messages API 格式的图片内容块,例如:
{
"type": "image",
"source": {
"type": "base64",
"media_type": "image/png",
"data": "iVBORw0KGgo..."
}
}
支持的 API 格式(Provider)
| Provider | 说明 | 默认 Endpoint |
|---|---|---|
anthropic |
Anthropic Messages API | /v1/messages |
openai |
OpenAI Chat Completions API | /chat/completions |
gemini |
Gemini Native generateContent API | /v1beta/models/{model}:generateContent |
通过 PROVIDER 环境变量切换 API 格式。
快速开始
全局安装
npm install -g @shen866/vision-bridge-mcp
本地开发
git clone https://github.com/shen866/vision-bridge-mcp.git
cd vision-bridge-mcp
npm install
npm run build
配置 Claude Code
API_KEY、BASE_URL、MODEL 为必填项。
Anthropic Messages
{
"mcpServers": {
"vision_bridge": {
"command": "npx",
"args": ["-y", "@shen866/vision-bridge-mcp"],
"env": {
"API_KEY": "your-api-key",
"BASE_URL": "https://api.anthropic.com",
"MODEL": "claude-3-5-sonnet-20241022"
}
}
}
}
如果使用本地构建版本,将 command 改为 node 并把 args 改为绝对路径:
{
"mcpServers": {
"vision_bridge": {
"command": "node",
"args": ["/Users/shen/workspace/kimi-vision-mcp/dist/index.js"],
"env": {
"API_KEY": "your-api-key",
"BASE_URL": "https://api.anthropic.com",
"MODEL": "claude-3-5-sonnet-20241022"
}
}
}
}
OpenAI Chat Completions
{
"mcpServers": {
"vision_bridge": {
"command": "npx",
"args": ["-y", "@shen866/vision-bridge-mcp"],
"env": {
"PROVIDER": "openai",
"API_KEY": "your-api-key",
"BASE_URL": "https://api.openai.com/v1",
"MODEL": "gpt-4o"
}
}
}
}
Gemini Native generateContent
{
"mcpServers": {
"vision_bridge": {
"command": "npx",
"args": ["-y", "@shen866/vision-bridge-mcp"],
"env": {
"PROVIDER": "gemini",
"API_KEY": "your-api-key",
"BASE_URL": "https://generativelanguage.googleapis.com",
"MODEL": "gemini-1.5-pro-latest"
}
}
}
}
使用
在 Claude Code / Claude Desktop 中发送图片或引用图片路径后,Claude 会自动调用 describe_image 等工具获取多模态模型对图片的文字描述,然后将描述交给纯文本模型继续处理。
如果 Claude Code 经常直接把图片发给模型导致报错,可以在项目根目录创建 .claude/CLAUDE.md:
当前模型不支持图片输入。当用户发送图片时,必须调用 vision_bridge MCP 工具处理,不要直接传给模型。
环境变量
| 变量 | 说明 | 默认值 |
|---|---|---|
PROVIDER |
API 格式:anthropic、openai、gemini |
anthropic |
API_KEY |
API 密钥 | 必填 |
BASE_URL |
API 基础地址 | 必填 |
ENDPOINT |
API 端点路径 | 取决于 provider |
MODEL |
模型名称 | 必填 |
MAX_TOKENS |
最大输出 token 数 | 4096 |
API_VERSION |
Messages API 版本 | 2023-06-01 |
AUTH_HEADER |
Messages API 认证方式:x-api-key 或 bearer |
x-api-key |
协议
基于 MCP(Model Context Protocol)JSON-RPC 2.0,通过 stdio 进行通信。
401 排查
如果返回 401,通常是认证头不对。各 provider 默认认证方式如下:
anthropic:x-api-key+anthropic-versionopenai:Authorization: Bearergemini:URL query parameter?key=
如果 Messages API 网关需要 Bearer Token,可设置:
"AUTH_HEADER": "bearer"
推荐服务器
Baidu Map
百度地图核心API现已全面兼容MCP协议,是国内首家兼容MCP协议的地图服务商。
Playwright MCP Server
一个模型上下文协议服务器,它使大型语言模型能够通过结构化的可访问性快照与网页进行交互,而无需视觉模型或屏幕截图。
Magic Component Platform (MCP)
一个由人工智能驱动的工具,可以从自然语言描述生成现代化的用户界面组件,并与流行的集成开发环境(IDE)集成,从而简化用户界面开发流程。
Audiense Insights MCP Server
通过模型上下文协议启用与 Audiense Insights 账户的交互,从而促进营销洞察和受众数据的提取和分析,包括人口统计信息、行为和影响者互动。
VeyraX
一个单一的 MCP 工具,连接你所有喜爱的工具:Gmail、日历以及其他 40 多个工具。
graphlit-mcp-server
模型上下文协议 (MCP) 服务器实现了 MCP 客户端与 Graphlit 服务之间的集成。 除了网络爬取之外,还可以将任何内容(从 Slack 到 Gmail 再到播客订阅源)导入到 Graphlit 项目中,然后从 MCP 客户端检索相关内容。
Kagi MCP Server
一个 MCP 服务器,集成了 Kagi 搜索功能和 Claude AI,使 Claude 能够在回答需要最新信息的问题时执行实时网络搜索。
e2b-mcp-server
使用 MCP 通过 e2b 运行代码。
Neon MCP Server
用于与 Neon 管理 API 和数据库交互的 MCP 服务器
Exa MCP Server
模型上下文协议(MCP)服务器允许像 Claude 这样的 AI 助手使用 Exa AI 搜索 API 进行网络搜索。这种设置允许 AI 模型以安全和受控的方式获取实时的网络信息。