DeepSeek PDF Reader

DeepSeek PDF Reader

MCP server for comprehensive PDF processing including text extraction with OCR, keyword search with regex, table extraction, and page preview as Base64 PNG images.

Category
访问服务器

README

DeepSeek PDF Reader MCP Server v5.0.0

Version Python License Tests MCP SDK

MCP 服务器,提供全面的 PDF 处理能力:文字提取(自动 OCR)、关键词搜索(支持正则)、表格提取(三路径)、页面预览(Base64 PNG)。

v5.0.0 重大更新:基于官方 mcp Python SDK 重构,12 文件模块化架构,支持 SDK 模式 + 内置 JSON-RPC 兼容模式双引擎。


🆕 v5.0.0 vs v4.0.0

v4.0.0 v5.0.0
架构 单体 504 行 12 文件模块化 (~650 行)
MCP 协议 手写 JSON-RPC 官方 SDK + 内置引擎双模式
inputSchema 手动维护 JSON Schema SDK 模式自动生成 / 兼容模式预定义
生命周期 不完整 lifespan 上下文管理器
日志 stderr 不可见 SDK 模式通过 ctx.info() 推送到客户端
打包 requirements.txt pyproject.toml (PEP 621)

功能概览

工具 说明
read_pdf 读取 PDF 文字,支持 text / json / markdown 三种输出格式,扫描件自动 OCR
list_pdf_info 获取 PDF 元信息:页数、文件大小、是否加密、是否有文字层、OCR 状态、Tesseract 语言包
search_pdf 搜索关键词,支持正则表达式,返回页码、命中次数、上下文摘录
extract_tables 三路径表格提取策略:PyMuPDF 内置检测(有边框)→ block/line 结构化解析 → TSV 坐标聚类(无边框兜底)
preview_page 指定页码渲染为 PNG 图片(Base64 编码),可直接在聊天界面展示

系统要求

  • Python 3.10+
  • Tesseract OCR(可选,用于扫描件 PDF 的文字识别):
平台 安装命令
Windows 下载安装 Tesseract-OCR,安装时勾选中文语言包
macOS brew install tesseract tesseract-lang
Ubuntu/Debian sudo apt install tesseract-ocr tesseract-ocr-chi-sim tesseract-ocr-eng
Arch Linux sudo pacman -S tesseract tesseract-data-eng tesseract-data-chi_sim

安装

# 克隆仓库
git clone https://github.com/FLT1milize/deepseek-pdf-reader.git
cd deepseek-pdf-reader

# 安装 Python 依赖
pip install -r requirements.txt

运行测试

python test_server.py

预期输出:[OK] All 30 tests passed!

在 Cline 中配置

编辑 Cline 的 MCP 配置文件,添加如下条目:

{
  "mcpServers": {
    "deepseek-pdf-reader": {
      "command": "python",
      "args": ["path/to/deepseek-pdf-reader/server.py"],
      "env": {
        "TESSERACT_CMD": "C:/Program Files/Tesseract-OCR/tesseract.exe"
      }
    }
  }
}

提示TESSERACT_CMD 可选;若留空,服务器会自动搜索常见安装路径。也可以通过环境变量 TESSDATA_PREFIX 指定语言包路径。

配置选项

环境变量 说明 默认值
TESSERACT_CMD Tesseract 可执行文件路径 自动搜索
TESSDATA_PREFIX tessdata 语言包目录 自动搜索

架构说明

deepseek-pdf-reader/
├── server.py          # 入口:SDK模式 + 内置JSON-RPC兼容引擎
├── config.py          # 全局配置(Settings dataclass)
├── ocr.py             # Tesseract 5路径自动发现 + OCR 调用
├── doc.py             # PDFDoc 类(线程安全缓存 + LRU) + 文档池
├── table.py           # TSV坐标 → 表格结构(无边框表格检测)
├── format.py            # 格式化工具(text/json/markdown 输出)
├── tools/
│   ├── read_pdf.py       # read_pdf 工具
│   ├── list_info.py      # list_pdf_info 工具
│   ├── search_pdf.py     # search_pdf 工具
│   ├── extract_tables.py # extract_tables 工具
│   └── preview_page.py   # preview_page 工具
├── pyproject.toml     # PEP 621 项目配置
└── test_server.py     # 30 个单元测试

双引擎设计:优先使用官方 mcp SDK(自动 inputSchema、lifespan、日志推送);若 SDK 未安装,自动回退到内置 JSON-RPC 2.0 引擎,零额外依赖可用。

核心依赖:PyMuPDF (fitz) + mcp (可选),OCR 通过 subprocess 调用 Tesseract CLI。

许可证

MIT · 详见 LICENSE

推荐服务器

Baidu Map

Baidu Map

百度地图核心API现已全面兼容MCP协议,是国内首家兼容MCP协议的地图服务商。

官方
精选
JavaScript
Playwright MCP Server

Playwright MCP Server

一个模型上下文协议服务器,它使大型语言模型能够通过结构化的可访问性快照与网页进行交互,而无需视觉模型或屏幕截图。

官方
精选
TypeScript
Magic Component Platform (MCP)

Magic Component Platform (MCP)

一个由人工智能驱动的工具,可以从自然语言描述生成现代化的用户界面组件,并与流行的集成开发环境(IDE)集成,从而简化用户界面开发流程。

官方
精选
本地
TypeScript
Audiense Insights MCP Server

Audiense Insights MCP Server

通过模型上下文协议启用与 Audiense Insights 账户的交互,从而促进营销洞察和受众数据的提取和分析,包括人口统计信息、行为和影响者互动。

官方
精选
本地
TypeScript
VeyraX

VeyraX

一个单一的 MCP 工具,连接你所有喜爱的工具:Gmail、日历以及其他 40 多个工具。

官方
精选
本地
graphlit-mcp-server

graphlit-mcp-server

模型上下文协议 (MCP) 服务器实现了 MCP 客户端与 Graphlit 服务之间的集成。 除了网络爬取之外,还可以将任何内容(从 Slack 到 Gmail 再到播客订阅源)导入到 Graphlit 项目中,然后从 MCP 客户端检索相关内容。

官方
精选
TypeScript
Kagi MCP Server

Kagi MCP Server

一个 MCP 服务器,集成了 Kagi 搜索功能和 Claude AI,使 Claude 能够在回答需要最新信息的问题时执行实时网络搜索。

官方
精选
Python
e2b-mcp-server

e2b-mcp-server

使用 MCP 通过 e2b 运行代码。

官方
精选
Neon MCP Server

Neon MCP Server

用于与 Neon 管理 API 和数据库交互的 MCP 服务器

官方
精选
Exa MCP Server

Exa MCP Server

模型上下文协议(MCP)服务器允许像 Claude 这样的 AI 助手使用 Exa AI 搜索 API 进行网络搜索。这种设置允许 AI 模型以安全和受控的方式获取实时的网络信息。

官方
精选