MCP Observability Server
Exposes an observability REST API as MCP tools, enabling incident investigation through automated correlation of deploys with errors, log and metrics queries.
README
POC — MCP server + client + REST API (observabilidade)
Stack completo e executável: uma API REST de observabilidade, um servidor MCP que a expõe como ferramentas, e um cliente MCP sem LLM que roda um roteiro de investigação real.
O dataset é sintético mas tem uma história plantada: checkout-api v2.4.0
subiu há 3 horas e quebrou o serviço. A ferramenta de correlação precisa
encontrar isso sozinha — e encontra.
Para o porquê de cada decisão de design, veja
docs/ARCHITECTURE.md.
Rodar
Requer uv e Python 3.14+.
git clone https://github.com/JoaoAndrade18/mcp-server-client-poc.git
cd mcp-server-client-poc
uv sync
./run.sh # sobe tudo, roda o cenário, derruba
uv run pytest -q # 18 testes
Arquitetura
cliente MCP ──MCP/streamable-http──► servidor MCP ──HTTP+Bearer──► API REST
(sem LLM) :8765/mcp (adapter) :8081 (dados)
│
/metrics /healthz
As três camadas são separadas de propósito:
- A API REST (
api.py) não sabe o que é MCP. É o "sistema que já existe" na sua empresa. O servidor MCP é um adaptador na frente dela, não uma reescrita. - O servidor MCP (
mcp_server.py) não tem dados. Traduz protocolo e guarda o token da API. Quem fala MCP nunca vê essa credencial. - O cliente (
client.py) não tem modelo. Tudo que um LLM faria dinamicamente, ele faz por script. Se quebrar, o problema é seu servidor — não o raciocínio do modelo. É o jeito de isolar as duas coisas.
O que o POC demonstra
| Área | Onde |
|---|---|
| Tools com output estruturado (Pydantic) | mcp_server.py — 6 tools |
Annotations (readOnlyHint, destructiveHint) |
idem — só open_incident escreve |
| Resources (estáticos + template) | obs://services, obs://service/{name}/runbook |
| Prompts (workflow reutilizável) | investigate_service |
| Auth por token + escopos | StaticTokenVerifier, _require_scope |
| Métricas por tool (calls/erros/latência) | GET :8765/metrics |
| Health check com upstream | GET :8765/healthz |
| Erros acionáveis | query_logs("does-not-exist") |
Tools
| Tool | Tipo | O que faz |
|---|---|---|
list_services |
read | Catálogo com time, tier e SLOs |
query_logs |
read | Busca por serviço, nível, substring, janela |
get_metrics |
read | Resume 1 métrica + veredito de SLO |
get_deploys |
read | Histórico de deploys |
correlate_deploy_with_errors |
read | Antes/depois do último deploy + veredito + confiança |
open_incident |
write | Abre incidente (exige escopo incidents:write) |
correlate_deploy_with_errors é o ponto principal do design: as tools são
moldadas por tarefa, não por endpoint. Ela responde "por que X quebrou?"
numa chamada só, em vez de obrigar o chamador a costurar
get_deploys + 2×get_metrics + query_logs e fazer a aritmética sozinho.
Rodar as partes separadas
# API REST isolada (docs em /docs)
uv run uvicorn obs.api:app --port 8081
# Servidor MCP — HTTP (produção)
uv run python -m obs.mcp_server
# Servidor MCP — stdio (Claude Desktop, IDEs)
MCP_TRANSPORT=stdio uv run python -m obs.mcp_server
# Inspector oficial
uv run mcp dev src/obs/mcp_server.py
Modo autenticado
Por padrão a auth vem desligada para o demo rodar sem fricção. Para ligar:
MCP_REQUIRE_AUTH=1 uv run python -m obs.mcp_server
MCP_TOKEN=mcp_oncall_token uv run python -m obs.client
Comportamento verificado:
| Token | list_services |
open_incident |
|---|---|---|
| nenhum | HTTP 401 | HTTP 401 |
| inválido | HTTP 401 | HTTP 401 |
mcp_readonly_token (obs:read) |
✅ | ❌ bloqueado no escopo |
mcp_oncall_token (+incidents:write) |
✅ | ✅ |
Os tokens estáticos são só do POC. Em produção, StaticTokenVerifier vira um
verificador de JWT contra o JWKS do seu IdP — o formato do retorno
(AccessToken com escopos) é o mesmo.
Nota sobre o /metrics
O p95 do servidor foi o que revelou um bug real durante a construção deste
POC: correlate_deploy_with_errors reportava p95 abaixo da média, o que é
impossível. A causa era int(n * 0.95) - 1, que com n=2 dá índice 0 e retorna
o mínimo. Está corrigido em percentile() e travado por teste.
É o argumento para instrumentar o servidor MCP desde o dia 1: sem o /metrics
o bug teria passado.
Estrutura
src/obs/
data.py dataset determinístico (seed fixa, incidente plantado)
api.py API REST — FastAPI, bearer auth, /metrics
mcp_server.py servidor MCP — tools, resources, prompts, auth, métricas
client.py cliente MCP — sem LLM, roteiro fixo
tests/test_poc.py
run.sh
推荐服务器
Baidu Map
百度地图核心API现已全面兼容MCP协议,是国内首家兼容MCP协议的地图服务商。
Playwright MCP Server
一个模型上下文协议服务器,它使大型语言模型能够通过结构化的可访问性快照与网页进行交互,而无需视觉模型或屏幕截图。
Magic Component Platform (MCP)
一个由人工智能驱动的工具,可以从自然语言描述生成现代化的用户界面组件,并与流行的集成开发环境(IDE)集成,从而简化用户界面开发流程。
Audiense Insights MCP Server
通过模型上下文协议启用与 Audiense Insights 账户的交互,从而促进营销洞察和受众数据的提取和分析,包括人口统计信息、行为和影响者互动。
VeyraX
一个单一的 MCP 工具,连接你所有喜爱的工具:Gmail、日历以及其他 40 多个工具。
graphlit-mcp-server
模型上下文协议 (MCP) 服务器实现了 MCP 客户端与 Graphlit 服务之间的集成。 除了网络爬取之外,还可以将任何内容(从 Slack 到 Gmail 再到播客订阅源)导入到 Graphlit 项目中,然后从 MCP 客户端检索相关内容。
Kagi MCP Server
一个 MCP 服务器,集成了 Kagi 搜索功能和 Claude AI,使 Claude 能够在回答需要最新信息的问题时执行实时网络搜索。
e2b-mcp-server
使用 MCP 通过 e2b 运行代码。
Neon MCP Server
用于与 Neon 管理 API 和数据库交互的 MCP 服务器
Exa MCP Server
模型上下文协议(MCP)服务器允许像 Claude 这样的 AI 助手使用 Exa AI 搜索 API 进行网络搜索。这种设置允许 AI 模型以安全和受控的方式获取实时的网络信息。