Mimo Vision MCP

Mimo Vision MCP

An image recognition MCP server based on mimo-v2.5, enabling AI assistants to describe images, extract text via OCR, and output structured information in JSON or table format.

Category
访问服务器

README

Mimo Vision MCP

基于 mimo-v2.5 的图像识别 MCP 服务器,为 AI 助手提供"看图"能力。

Python 3.10+ MCP License: MIT


功能特性

单一工具 recognize_image,通过 mode 参数切换三种识别能力:

模式 用途 输出格式 典型场景
describe 通用图像描述 纯文本 场景理解、内容审核、图片摘要
ocr 文字识别 纯文本 截图提取、文档数字化、车牌/招牌识别
extract 结构化信息提取 JSON 发票解析、名片录入、表格数据化

extract 模式输出格式

通过 format 参数控制输出结构:

行为
auto(默认) 由模型自动判断最合适的结构
json 强制输出 JSON 对象
table 强制输出 Markdown 表格

快速开始

1. 安装

# 克隆仓库
git clone https://github.com/k0tori/mimo-vision-mcp.git
cd mimo-vision-mcp

# 安装(开发模式)
pip install -e .

2. 配置 API

cp .env.example .env

编辑 .env,填入你的 API 凭据:

MIMO_API_BASE_URL=https://your-api-endpoint/v1
MIMO_API_KEY=your-api-key

3. 注册 MCP 服务器

在你的 MCP 客户端配置中添加:

{
  "mcpServers": {
    "mimo-vision": {
      "command": "python",
      "args": ["-m", "mimo_vision_mcp"],
      "env": {
        "MIMO_API_BASE_URL": "https://your-api-endpoint/v1",
        "MIMO_API_KEY": "your-api-key"
      }
    }
  }
}

提示: env 字段可选。如果省略,服务器会从项目目录下的 .env 文件读取配置。


使用示例

describe — 描述图片内容

{
  "image": "/path/to/photo.jpg",
  "mode": "describe"
}

也支持 URL 输入:

{ "image": "https://example.com/photo.jpg", "mode": "describe" }

ocr — 提取文字

{
  "image": "/path/to/screenshot.png",
  "mode": "ocr"
}

extract — 结构化提取

{
  "image": "/path/to/invoice.jpg",
  "mode": "extract",
  "prompt": "提取发票号码、开票日期和总金额"
}

强制 JSON 输出:

{
  "image": "/path/to/business-card.png",
  "mode": "extract",
  "format": "json"
}

工具接口

recognize_image

参数 类型 必填 默认值 说明
image string 本地文件路径或图片 URL
mode string describe / ocr / extract
prompt string "" 补充提示词,引导模型关注特定内容
format string "auto" 仅 extract 模式:auto / json / table

支持的图片格式

格式 扩展名 最大大小
PNG .png 20 MB
JPEG .jpg / .jpeg 20 MB
WebP .webp 20 MB
GIF .gif(静态) 20 MB

格式通过文件头(magic bytes)自动检测,不依赖扩展名。


错误处理

所有错误以纯文本返回,不会抛出异常。常见错误类型:

错误 示例
文件不存在 错误:文件不存在 - /path/to/missing.png
格式不支持 错误:不支持的图片格式,支持 PNG/JPEG/WebP/GIF
文件过大 错误:文件过大(25.3MB),限制 20MB
API 认证失败 错误:API 认证失败,请检查 API Key
模型返回异常 错误:模型调用失败 - ...

开发

# 安装开发依赖
pip install -e ".[dev]"

# 运行测试
pytest

# 运行测试(详细输出)
pytest -v

项目结构

src/mimo_vision_mcp/
├── __init__.py          # 包初始化
├── __main__.py          # python -m 入口
├── server.py            # MCP 服务,注册工具
├── api/
│   └── client.py        # OpenAI 兼容 API 客户端
├── tools/
│   └── recognize.py     # recognize_image 实现
└── utils/
    ├── image.py         # 图片处理(magic bytes、base64)
    └── prompts.py       # System prompt 定义

License

MIT

推荐服务器

Baidu Map

Baidu Map

百度地图核心API现已全面兼容MCP协议,是国内首家兼容MCP协议的地图服务商。

官方
精选
JavaScript
Playwright MCP Server

Playwright MCP Server

一个模型上下文协议服务器,它使大型语言模型能够通过结构化的可访问性快照与网页进行交互,而无需视觉模型或屏幕截图。

官方
精选
TypeScript
Magic Component Platform (MCP)

Magic Component Platform (MCP)

一个由人工智能驱动的工具,可以从自然语言描述生成现代化的用户界面组件,并与流行的集成开发环境(IDE)集成,从而简化用户界面开发流程。

官方
精选
本地
TypeScript
Audiense Insights MCP Server

Audiense Insights MCP Server

通过模型上下文协议启用与 Audiense Insights 账户的交互,从而促进营销洞察和受众数据的提取和分析,包括人口统计信息、行为和影响者互动。

官方
精选
本地
TypeScript
VeyraX

VeyraX

一个单一的 MCP 工具,连接你所有喜爱的工具:Gmail、日历以及其他 40 多个工具。

官方
精选
本地
graphlit-mcp-server

graphlit-mcp-server

模型上下文协议 (MCP) 服务器实现了 MCP 客户端与 Graphlit 服务之间的集成。 除了网络爬取之外,还可以将任何内容(从 Slack 到 Gmail 再到播客订阅源)导入到 Graphlit 项目中,然后从 MCP 客户端检索相关内容。

官方
精选
TypeScript
Kagi MCP Server

Kagi MCP Server

一个 MCP 服务器,集成了 Kagi 搜索功能和 Claude AI,使 Claude 能够在回答需要最新信息的问题时执行实时网络搜索。

官方
精选
Python
e2b-mcp-server

e2b-mcp-server

使用 MCP 通过 e2b 运行代码。

官方
精选
Neon MCP Server

Neon MCP Server

用于与 Neon 管理 API 和数据库交互的 MCP 服务器

官方
精选
Exa MCP Server

Exa MCP Server

模型上下文协议(MCP)服务器允许像 Claude 这样的 AI 助手使用 Exa AI 搜索 API 进行网络搜索。这种设置允许 AI 模型以安全和受控的方式获取实时的网络信息。

官方
精选