VisualWebScraper

VisualWebScraper

MCP server for web scraping using Playwright headless Chromium. It provides tools to fetch webpage screenshots, search article listings, and generate article briefs via local LM Studio models.

Category
访问服务器

README

VisualWebScraper

基于 MCP(Model Context Protocol) 的网页抓取服务,使用 Playwright 无头 Chromium 渲染动态网页, 并可调用本地 LM Studio 大模型生成文章简报。

安装

pip install -r requirements.txt
playwright install chromium

启动

python screenshot_scraper_mcp.py
# 或
python -m webscraper.server

本地可视化操作台(Web UI)

除 MCP stdio 外,另提供基于标准库 http.server 的网页界面,无需额外依赖, 复用同一套工具层与浏览器池,供非开发者在浏览器中可视化操作。

python run_webui.py                 # 默认 http://127.0.0.1:8765
python run_webui.py --port 9000     # 自定义端口

打开页面后,可在「网页截图 / 文章检索 / 简报生成」三个标签页填写参数并运行; 截图工具会直接渲染返回的长图,检索与简报以文本形式展示(简报生成依赖 LM Studio)。

该 Web UI 与 MCP stdio 入口相互独立,互不影响;退出时浏览器实例同样会被释放。

MCP 客户端配置

{
  "mcpServers": {
    "VisualWebScraper": {
      "command": "python",
      "args": ["d:/BaiduSyncdisk/desktop/WebSearchMCP/screenshot_scraper_mcp.py"],
      "env": {
        "LMSTUDIO_BASE_URL": "http://localhost:1234/v1"
      }
    }
  }
}

提供的工具

fetch_webpage_with_screenshot

抓取网页纯文本 + 整页长截图(PNG base64),供多模态模型做视觉分析。

参数 类型 必填 说明
url string 是 目标网页链接

search_webpage_articles

从栏目/列表页提取文章条目,按标题关键词筛选,按日期倒序输出。

参数 类型 必填 说明
url string 是 栏目/列表页链接
keyword string 是 标题筛选关键词
count integer 是 输出条数,<=0 表示全部

generate_webpage_brief

提取文章 → 抓取详情页正文 → 调用本地大模型逐篇生成摘要 → 输出简报。

参数 类型 必填 说明
url string 是 栏目/列表页链接
count integer 是 生成条数
keyword string 否 标题筛选关键词,留空为全部
summary_len integer 否 每条摘要目标字数,默认 60
model string 否 LM Studio 模型名,缺省用当前加载的模型

三级降级链(保证任何环境下都有输出):

层级 触发条件 行为
L1 首次摘要为空 换更直接的指令重试
L2 仍为空 取正文首段作为摘要
L3 全部条目模型调用均失败 判定 LM Studio 不可用,落盘 Markdown 到 briefs/

项目结构

webscraper/
├── config.py          # 集中配置:超时、限额、环境变量
├── browser.py         # Playwright 浏览器池(复用实例)
├── extractors.py      # 文章提取、正文抓取、文本清洗
├── llm.py             # LM Studio 调用(OpenAI 兼容接口)
├── reporter.py        # 简报 Markdown 落盘与文本渲染
├── server.py          # MCP 入口:handler 注册与生命周期
└── tools/
    ├── base.py        # 工具注册表、参数校验、结果构造
    ├── screenshot.py  # fetch_webpage_with_screenshot
    ├── search.py      # search_webpage_articles
    └── brief.py       # generate_webpage_brief

站点适配

文章链接识别规则集中在 extractors.py 顶部,换站点时只需调整:

ARTICLE_PATH_MARK = "/article/"                      # 文章链接特征
ARTICLE_DATE_RE = re.compile(r"/article/(\d{4})/(\d{1,2})/")  # URL 日期格式

环境变量

变量 默认值 说明
LMSTUDIO_BASE_URL http://localhost:1234/v1 LM Studio OpenAI 兼容接口地址

推荐服务器

Baidu Map

Baidu Map

百度地图核心API现已全面兼容MCP协议,是国内首家兼容MCP协议的地图服务商。

官方
精选
JavaScript
Playwright MCP Server

Playwright MCP Server

一个模型上下文协议服务器,它使大型语言模型能够通过结构化的可访问性快照与网页进行交互,而无需视觉模型或屏幕截图。

官方
精选
TypeScript
Magic Component Platform (MCP)

Magic Component Platform (MCP)

一个由人工智能驱动的工具,可以从自然语言描述生成现代化的用户界面组件,并与流行的集成开发环境(IDE)集成,从而简化用户界面开发流程。

官方
精选
本地
TypeScript
Audiense Insights MCP Server

Audiense Insights MCP Server

通过模型上下文协议启用与 Audiense Insights 账户的交互,从而促进营销洞察和受众数据的提取和分析,包括人口统计信息、行为和影响者互动。

官方
精选
本地
TypeScript
VeyraX

VeyraX

一个单一的 MCP 工具,连接你所有喜爱的工具:Gmail、日历以及其他 40 多个工具。

官方
精选
本地
graphlit-mcp-server

graphlit-mcp-server

模型上下文协议 (MCP) 服务器实现了 MCP 客户端与 Graphlit 服务之间的集成。 除了网络爬取之外,还可以将任何内容(从 Slack 到 Gmail 再到播客订阅源)导入到 Graphlit 项目中,然后从 MCP 客户端检索相关内容。

官方
精选
TypeScript
Kagi MCP Server

Kagi MCP Server

一个 MCP 服务器,集成了 Kagi 搜索功能和 Claude AI,使 Claude 能够在回答需要最新信息的问题时执行实时网络搜索。

官方
精选
Python
e2b-mcp-server

e2b-mcp-server

使用 MCP 通过 e2b 运行代码。

官方
精选
Neon MCP Server

Neon MCP Server

用于与 Neon 管理 API 和数据库交互的 MCP 服务器

官方
精选
Exa MCP Server

Exa MCP Server

模型上下文协议(MCP)服务器允许像 Claude 这样的 AI 助手使用 Exa AI 搜索 API 进行网络搜索。这种设置允许 AI 模型以安全和受控的方式获取实时的网络信息。

官方
精选