airus-mcp
MCP server exposing 1688 and OZON e-commerce crawling tools, enabling AI agents to perform product search, image search, and supplier contact scraping via natural language.
README
airus-mcp
1688 / OZON 电商爬虫的 MCP Server。把选品爬虫暴露为标准 MCP 工具,供 Claude 桌面版、Cowork、Claude Code 等任何 MCP 宿主直接调用——agent 当大脑,爬虫当手。
由 AIRus 项目的爬虫核心迁移而来,剥离了飞书机器人层与自建 WebSearch 层(宿主 agent 的原生联网能力已覆盖),并修复了迁移前的若干已知 bug。
架构
MCP 宿主(Claude Desktop / Cowork / Claude Code …)
│ stdio
▼
mcp_server.py ← MCP 工具入口(本仓库)
│ HTTP :8765
▼
web_app.py ← 任务队列 + 爬虫调度(单账号串行)
│ subprocess
├── scrape_1688.py ← 1688 关键词搜索 / 以图搜款 / 店铺联系方式(需登录态)
└── crawl_ozon.py ← OZON 关键词搜索(需俄罗斯 IP)
▲
└── Chrome CDP :9222(真实 Chrome,登录态 / 过反爬的根基)
MCP 工具(7 个)
| 工具 | 说明 |
|---|---|
crawler_browser_status |
检查 Chrome CDP 与队列状态,是否需要人工登录/验证码 |
crawler_create_job |
创建异步采集任务(1688 / ozon) |
crawler_image_search |
1688 以图搜款:传本地图片路径,自动上传并建任务 |
crawler_wait_job |
阻塞等待任务完成(推荐,代替客户端轮询) |
crawler_get_job |
查询任务状态与结果(含中文字段的 bitable_rows) |
crawler_list_jobs |
列出近期任务 |
crawler_cancel_job |
取消排队中的任务 |
快速开始
1. 启动爬虫 Worker(Mac 采集机)
./start_mac_worker.sh
脚本会自动创建 venv、装依赖、拉起 Chrome CDP (:9222) 和 web_app (:8765)。
首次使用请在弹出的 Chrome 窗口里手动登录 1688(登录态保存在 ~/.1688-tool-chrome)。
2. 注册 MCP Server
Claude Desktop 的 claude_desktop_config.json(或任何 MCP 宿主的等价配置):
{
"mcpServers": {
"airus-crawler": {
"command": "/path/to/airus-mcp/.venv/bin/python",
"args": ["/path/to/airus-mcp/mcp_server.py"],
"env": {
"CRAWLER_BASE_URL": "http://127.0.0.1:8765"
}
}
}
}
3. 对话示例
帮我在 1688 搜「蓝牙耳机」前 2 页,采集供应商联系方式
帮我爬 OZON 上「механическая клавиатура」的第 1 页
用这张图在 1688 找同款:/Users/me/Desktop/product.jpg
环境变量
| 变量 | 默认 | 说明 |
|---|---|---|
CRAWLER_BASE_URL |
http://127.0.0.1:8765 |
web_app 地址(MCP 端) |
WEB_HOST / WEB_PORT |
127.0.0.1 / 8765 |
web_app 监听地址(Worker 端) |
RUB_CNY_RATE |
0.078 |
卢布→人民币汇率(OZON 价格换算) |
CDP_PORT |
9222 |
Chrome CDP 端口 |
COMPANY_WORKER_URL |
— | 设置后 web_app 变为到远端 Worker 的反向代理 |
CRAWLER_WAIT_POLL_INTERVAL |
10 |
crawler_wait_job 轮询间隔(秒) |
注意事项
- 1688:必须已登录(诚信通账号);出现滑块/验证码时
browser_status.needs_action会提示,请到采集机 Chrome 窗口人工完成。 - OZON:采集机必须是俄罗斯出口 IP;无需登录。
- 任务队列为单账号串行(物理上只有一个 Chrome),并发请求会自动排队。
- 队列当前为内存态,web_app 重启后任务与结果丢失(结果同时落盘在
scrape_result/的 CSV/JSONL 里)。
相对原项目(AIRus)的变更
- 删除:飞书机器人层(Node/TS)、webfetch 自建搜索抓取、market_research 双市场调研、同步阻塞的
crawler_search工具 - 新增:
crawler_wait_job(阻塞等待)、crawler_image_search(本地图片以图搜款) - 修复:联系方式按下标兜底导致串店、供应商电话列被覆盖丢失、
rating/review_count字段映射重复定义、汇率硬编码(改为RUB_CNY_RATE)、多处乱码提示文案、登录误报 marker、删除 3 个遗留死函数
推荐服务器
Baidu Map
百度地图核心API现已全面兼容MCP协议,是国内首家兼容MCP协议的地图服务商。
Playwright MCP Server
一个模型上下文协议服务器,它使大型语言模型能够通过结构化的可访问性快照与网页进行交互,而无需视觉模型或屏幕截图。
Magic Component Platform (MCP)
一个由人工智能驱动的工具,可以从自然语言描述生成现代化的用户界面组件,并与流行的集成开发环境(IDE)集成,从而简化用户界面开发流程。
Audiense Insights MCP Server
通过模型上下文协议启用与 Audiense Insights 账户的交互,从而促进营销洞察和受众数据的提取和分析,包括人口统计信息、行为和影响者互动。
VeyraX
一个单一的 MCP 工具,连接你所有喜爱的工具:Gmail、日历以及其他 40 多个工具。
graphlit-mcp-server
模型上下文协议 (MCP) 服务器实现了 MCP 客户端与 Graphlit 服务之间的集成。 除了网络爬取之外,还可以将任何内容(从 Slack 到 Gmail 再到播客订阅源)导入到 Graphlit 项目中,然后从 MCP 客户端检索相关内容。
Kagi MCP Server
一个 MCP 服务器,集成了 Kagi 搜索功能和 Claude AI,使 Claude 能够在回答需要最新信息的问题时执行实时网络搜索。
e2b-mcp-server
使用 MCP 通过 e2b 运行代码。
Neon MCP Server
用于与 Neon 管理 API 和数据库交互的 MCP 服务器
Exa MCP Server
模型上下文协议(MCP)服务器允许像 Claude 这样的 AI 助手使用 Exa AI 搜索 API 进行网络搜索。这种设置允许 AI 模型以安全和受控的方式获取实时的网络信息。