News Crawler MCP Server

News Crawler MCP Server

Enables crawling news articles by category (politics, economy, society, etc.) and generates blog-ready markdown summaries. Provides MCP tools for listing categories, crawling news, getting article details, and saving to files.

Category
访问服务器

README

News Crawler MCP Server

뉴스 기사를 크롤링하여 블로그 포스팅용 마크다운을 자동 생성하는 MCP 서버입니다.

주요 기능

  • 카테고리별 뉴스 크롤링: 정치, 경제, 사회, 생활/문화, 세계, IT/과학
  • 블로그 포맷 출력: 복사하여 바로 사용 가능한 마크다운 형식
  • 일일 뉴스 다이제스트: 모든 카테고리의 주요 뉴스 한번에 수집
  • 자동 스케줄링: Windows Task Scheduler로 매일 자동 실행

빠른 시작

1. 저장소 클론

git clone <repository-url>
cd news-crawler-mcp

2. 가상환경 생성 및 의존성 설치

# Windows
python -m venv venv
.\venv\Scripts\activate
pip install -r requirements.txt
# macOS/Linux
python3 -m venv venv
source venv/bin/activate
pip install -r requirements.txt

3. 테스트 실행

python run_scheduler.py

실행 후 output/ 폴더에 마크다운 파일이 생성됩니다.

Claude Desktop 연동

%APPDATA%\Claude\claude_desktop_config.json (Windows) 또는 ~/Library/Application Support/Claude/claude_desktop_config.json (macOS) 파일에 추가:

{
  "mcpServers": {
    "news-crawler": {
      "command": "절대경로/venv/Scripts/python.exe",
      "args": ["-m", "src.server"],
      "cwd": "절대경로/news-crawler-mcp"
    }
  }
}

Windows 경로 예시: D:\\repository\\news-crawler-mcp

Claude Code 연동

프로젝트 폴더에서 Claude Code 실행 시 mcp.json이 자동 인식됩니다.

사용 가능한 MCP Tools

Tool 설명 주요 매개변수
list_categories 카테고리 목록 조회 -
crawl_news_by_category 특정 카테고리 크롤링 category, max_articles
crawl_daily_news 전체 카테고리 일일 뉴스 categories, max_per_category
get_article_detail 기사 상세 조회 url
save_to_file 마크다운 파일 저장 content, filename

카테고리 ID

ID 이름
politics 정치
economy 경제
society 사회
life 생활/문화
world 세계
it IT/과학

프롬프트 예시

"오늘의 IT 뉴스 5개 크롤링해서 블로그용으로 정리해줘"

"경제 카테고리 주요 기사 요약해줘"

"오늘 하루 뉴스 전체 카테고리별로 정리해줘"

자동 스케줄링 (Windows)

매일 정해진 시간에 자동으로 뉴스를 크롤링하고 파일로 저장합니다.

Task Scheduler 등록

관리자 권한 PowerShell에서 실행:

# 매일 오전 9시 실행
schtasks /create /tn "NewsCrawler" /tr "경로\run_crawler.bat" /sc daily /st 09:00 /f

시간 변경

schtasks /change /tn "NewsCrawler" /st 18:00

등록 확인

schtasks /query /tn "NewsCrawler"

삭제

schtasks /delete /tn "NewsCrawler" /f

프로젝트 구조

news-crawler-mcp/
├── src/
│   ├── server.py           # MCP 서버 메인
│   ├── crawlers/
│   │   └── naver.py        # 네이버 뉴스 크롤러
│   ├── models/
│   │   └── article.py      # Article, Category 데이터 모델
│   ├── formatters/
│   │   └── blog.py         # 마크다운 블로그 포맷터
│   └── utils/
│       └── http.py         # 비동기 HTTP 클라이언트
├── config/
│   └── settings.yaml       # 크롤링 설정
├── output/                  # 생성된 마크다운 저장
├── run_scheduler.py         # 스케줄러 실행 스크립트
├── run_crawler.bat          # Windows 배치 파일
├── mcp.json                 # Claude Code 설정
├── requirements.txt
└── pyproject.toml

의존성

  • Python 3.10+
  • mcp >= 1.0.0
  • httpx >= 0.27.0
  • beautifulsoup4 >= 4.12.0
  • lxml >= 5.0.0
  • pydantic >= 2.0.0
  • pyyaml >= 6.0.0

출력 예시

# [2025.01.27] 오늘의 뉴스 모음

오늘의 주요 뉴스를 카테고리별로 정리했습니다.

---

## IT/과학

### 1. 삼성전자, 갤럭시 S25 시리즈 공개

> 출처: [원문](https://news.naver.com/...)

### 2. AI 스타트업 투자 급증

> 출처: [원문](https://news.naver.com/...)

---

*총 30개의 기사가 수집되었습니다.*

🌐 웹 애플리케이션

뉴스 크롤링 결과를 웹에서 조회하고 블로그 템플릿을 생성할 수 있는 웹 애플리케이션입니다.

기술 스택

  • Backend: FastAPI, Supabase, APScheduler
  • Frontend: React 18, TypeScript, Tailwind CSS, Vite

사전 요구사항

  1. Supabase 프로젝트 생성: supabase.com에서 무료 프로젝트 생성
  2. 테이블 생성: backend/supabase_schema.sql 실행

Backend 실행

cd backend

# 가상환경 생성
python -m venv venv
.\venv\Scripts\activate  # Windows
# source venv/bin/activate  # macOS/Linux

# 의존성 설치
pip install -r requirements.txt

# 환경변수 설정
copy .env.example .env
# .env 파일에 Supabase URL과 Key 입력

# 서버 실행
uvicorn main:app --reload --port 8000

Frontend 실행

cd frontend

# 의존성 설치
npm install

# 개발 서버 실행
npm run dev

접속

  • Frontend: http://localhost:5173
  • Backend API: http://localhost:8000
  • API 문서: http://localhost:8000/docs

API 엔드포인트

Method Endpoint 설명
GET /api/news 뉴스 목록 (페이지네이션, 필터)
GET /api/news/{id} 뉴스 상세
GET /api/news/{id}/template 블로그 템플릿
GET /api/categories 카테고리 목록
GET /api/status 마지막 크롤링 상태
POST /api/news/crawl 수동 크롤링 실행

스케줄러

APScheduler가 매일 오전 9시에 자동으로 모든 카테고리의 뉴스를 크롤링합니다.

# .env에서 설정 변경 가능
SCHEDULER_ENABLED=true
CRAWL_HOUR=9
CRAWL_MINUTE=0

라이선스

MIT License

推荐服务器

Baidu Map

Baidu Map

百度地图核心API现已全面兼容MCP协议,是国内首家兼容MCP协议的地图服务商。

官方
精选
JavaScript
Playwright MCP Server

Playwright MCP Server

一个模型上下文协议服务器,它使大型语言模型能够通过结构化的可访问性快照与网页进行交互,而无需视觉模型或屏幕截图。

官方
精选
TypeScript
Magic Component Platform (MCP)

Magic Component Platform (MCP)

一个由人工智能驱动的工具,可以从自然语言描述生成现代化的用户界面组件,并与流行的集成开发环境(IDE)集成,从而简化用户界面开发流程。

官方
精选
本地
TypeScript
Audiense Insights MCP Server

Audiense Insights MCP Server

通过模型上下文协议启用与 Audiense Insights 账户的交互,从而促进营销洞察和受众数据的提取和分析,包括人口统计信息、行为和影响者互动。

官方
精选
本地
TypeScript
VeyraX

VeyraX

一个单一的 MCP 工具,连接你所有喜爱的工具:Gmail、日历以及其他 40 多个工具。

官方
精选
本地
graphlit-mcp-server

graphlit-mcp-server

模型上下文协议 (MCP) 服务器实现了 MCP 客户端与 Graphlit 服务之间的集成。 除了网络爬取之外,还可以将任何内容(从 Slack 到 Gmail 再到播客订阅源)导入到 Graphlit 项目中,然后从 MCP 客户端检索相关内容。

官方
精选
TypeScript
Kagi MCP Server

Kagi MCP Server

一个 MCP 服务器,集成了 Kagi 搜索功能和 Claude AI,使 Claude 能够在回答需要最新信息的问题时执行实时网络搜索。

官方
精选
Python
e2b-mcp-server

e2b-mcp-server

使用 MCP 通过 e2b 运行代码。

官方
精选
Neon MCP Server

Neon MCP Server

用于与 Neon 管理 API 和数据库交互的 MCP 服务器

官方
精选
Exa MCP Server

Exa MCP Server

模型上下文协议(MCP)服务器允许像 Claude 这样的 AI 助手使用 Exa AI 搜索 API 进行网络搜索。这种设置允许 AI 模型以安全和受控的方式获取实时的网络信息。

官方
精选