MCP Prompt Tester

MCP Prompt Tester

一个 MCP 服务器,允许代理在 OpenAI 和 Anthropic 模型上测试和比较 LLM 提示词,支持单次测试、并排比较和多轮对话。

Category
访问服务器

README

MCP Prompt Tester

一个简单的 MCP 服务器,允许代理使用不同的提供商测试 LLM prompt。

功能

  • 使用 OpenAI 和 Anthropic 模型测试 prompt
  • 配置系统 prompt、用户 prompt 和其他参数
  • 获取格式化的响应或错误消息
  • 通过 .env 文件支持轻松进行环境设置

安装

# 使用 pip 安装
pip install -e .

# 或者使用 uv 安装
uv install -e .

API 密钥设置

服务器需要您想要使用的提供商的 API 密钥。您可以通过两种方式进行设置:

选项 1:环境变量

设置以下环境变量:

  • OPENAI_API_KEY - 您的 OpenAI API 密钥
  • ANTHROPIC_API_KEY - 您的 Anthropic API 密钥

选项 2:.env 文件(推荐)

  1. 在您的项目目录或主目录中创建一个名为 .env 的文件
  2. 以以下格式添加您的 API 密钥:
OPENAI_API_KEY=your-openai-api-key-here
ANTHROPIC_API_KEY=your-anthropic-api-key-here
  1. 服务器将自动检测并加载这些密钥

为了方便起见,示例模板包含在 .env.example 中。

用法

使用 stdio(默认)或 SSE 传输启动服务器:

# 使用 stdio 传输(默认)
prompt-tester

# 使用 SSE 传输,自定义端口
prompt-tester --transport sse --port 8000

可用工具

服务器为 MCP 赋能的代理公开了以下工具:

1. list_providers

检索可用的 LLM 提供商及其默认模型。

参数:

  • 无需参数

示例响应:

{
  "providers": {
    "openai": [
      {
        "type": "gpt-4",
        "name": "gpt-4",
        "input_cost": 0.03,
        "output_cost": 0.06,
        "description": "最强大的 GPT-4 模型"
      },
      // ... 其他模型 ...
    ],
    "anthropic": [
      // ... 模型 ...
    ]
  }
}

2. test_comparison

并排比较多个 prompt,允许您同时测试不同的提供商、模型和参数。

参数:

  • comparisons (数组): 包含 1-4 个比较配置的列表,每个配置包含:
    • provider (字符串): 要使用的 LLM 提供商 ("openai" 或 "anthropic")
    • model (字符串): 模型名称
    • system_prompt (字符串): 系统 prompt(模型的指令)
    • user_prompt (字符串): 用户的消息/prompt
    • temperature (数字, 可选): 控制随机性
    • max_tokens (整数, 可选): 要生成的最大 token 数
    • top_p (数字, 可选): 通过 nucleus sampling 控制多样性

示例用法:

{
  "comparisons": [
    {
      "provider": "openai",
      "model": "gpt-4",
      "system_prompt": "你是一个乐于助人的助手。",
      "user_prompt": "用简单的术语解释量子计算。",
      "temperature": 0.7
    },
    {
      "provider": "anthropic",
      "model": "claude-3-opus-20240229",
      "system_prompt": "你是一个乐于助人的助手。",
      "user_prompt": "用简单的术语解释量子计算。",
      "temperature": 0.7
    }
  ]
}

3. test_multiturn_conversation

管理与 LLM 提供商的多轮对话,允许您创建和维护有状态的对话。

模式:

  • start: 开始新的对话
  • continue: 继续现有的对话
  • get: 检索对话历史记录
  • list: 列出所有活动对话
  • close: 关闭对话

参数:

  • mode (字符串): 操作模式 ("start", "continue", "get", "list", 或 "close")
  • conversation_id (字符串): 对话的唯一 ID(继续、获取、关闭模式需要)
  • provider (字符串): LLM 提供商(开始模式需要)
  • model (字符串): 模型名称(开始模式需要)
  • system_prompt (字符串): 系统 prompt(开始模式需要)
  • user_prompt (字符串): 用户消息(在开始和继续模式中使用)
  • temperature (数字, 可选): 模型的温度参数
  • max_tokens (整数, 可选): 要生成的最大 token 数
  • top_p (数字, 可选): Top-p 采样参数

示例用法(开始对话):

{
  "mode": "start",
  "provider": "openai",
  "model": "gpt-4",
  "system_prompt": "你是一个专门研究物理学的乐于助人的助手。",
  "user_prompt": "你能解释一下什么是暗物质吗?"
}

示例用法(继续对话):

{
  "mode": "continue",
  "conversation_id": "conv_12345",
  "user_prompt": "这与暗能量有什么关系?"
}

代理的示例用法

使用 MCP 客户端,代理可以使用如下工具:

import asyncio
import json
from mcp.client.session import ClientSession
from mcp.client.stdio import StdioServerParameters, stdio_client

async def main():
    async with stdio_client(
        StdioServerParameters(command="prompt-tester")
    ) as (read, write):
        async with ClientSession(read, write) as session:
            await session.initialize()
            
            # 1. 列出可用的提供商和模型
            providers_result = await session.call_tool("list_providers", {})
            print("Available providers and models:", providers_result)
            
            # 2. 使用单个模型和 prompt 运行基本测试
            comparison_result = await session.call_tool("test_comparison", {
                "comparisons": [
                    {
                        "provider": "openai",
                        "model": "gpt-4",
                        "system_prompt": "你是一个乐于助人的助手。",
                        "user_prompt": "用简单的术语解释量子计算。",
                        "temperature": 0.7,
                        "max_tokens": 500
                    }
                ]
            })
            print("Single model test result:", comparison_result)
            
            # 3. 并排比较多个 prompt/模型
            comparison_result = await session.call_tool("test_comparison", {
                "comparisons": [
                    {
                        "provider": "openai",
                        "model": "gpt-4",
                        "system_prompt": "你是一个乐于助人的助手。",
                        "user_prompt": "用简单的术语解释量子计算。",
                        "temperature": 0.7
                    },
                    {
                        "provider": "anthropic",
                        "model": "claude-3-opus-20240229",
                        "system_prompt": "你是一个乐于助人的助手。",
                        "user_prompt": "用简单的术语解释量子计算。",
                        "temperature": 0.7
                    }
                ]
            })
            print("Comparison result:", comparison_result)
            
            # 4. 开始多轮对话
            conversation_start = await session.call_tool("test_multiturn_conversation", {
                "mode": "start",
                "provider": "openai",
                "model": "gpt-4",
                "system_prompt": "你是一个专门研究物理学的乐于助人的助手。",
                "user_prompt": "你能解释一下什么是暗物质吗?"
            })
            print("Conversation started:", conversation_start)
            
            # 从响应中获取对话 ID
            response_data = json.loads(conversation_start.text)
            conversation_id = response_data.get("conversation_id")
            
            # 继续对话
            if conversation_id:
                conversation_continue = await session.call_tool("test_multiturn_conversation", {
                    "mode": "continue",
                    "conversation_id": conversation_id,
                    "user_prompt": "这与暗能量有什么关系?"
                })
                print("Conversation continued:", conversation_continue)
                
                # 获取对话历史记录
                conversation_history = await session.call_tool("test_multiturn_conversation", {
                    "mode": "get",
                    "conversation_id": conversation_id
                })
                print("Conversation history:", conversation_history)

asyncio.run(main())

MCP 代理集成

对于 MCP 赋能的代理,集成非常简单。当您的代理需要测试 LLM prompt 时:

  1. 发现: 代理可以使用 list_providers 来发现可用的模型及其功能
  2. 简单测试: 对于快速测试,使用带有单个配置的 test_comparison 工具
  3. 比较: 当代理需要评估不同的 prompt 或模型时,它可以使用带有多个配置的 test_comparison
  4. 有状态交互: 对于多轮对话,代理可以使用 test_multiturn_conversation 工具来管理对话

这允许代理:

  • 测试 prompt 变体以找到最有效的措辞
  • 比较不同模型以执行特定任务
  • 在多轮对话中保持上下文
  • 优化温度和 max_tokens 等参数
  • 在开发过程中跟踪 token 使用情况和成本

配置

您可以使用环境变量设置 API 密钥和可选的跟踪配置:

必需的 API 密钥

  • OPENAI_API_KEY - 您的 OpenAI API 密钥
  • ANTHROPIC_API_KEY - 您的 Anthropic API 密钥

可选的 Langfuse 跟踪

服务器支持 Langfuse,用于跟踪和观察 LLM 调用。这些设置是可选的:

  • LANGFUSE_SECRET_KEY - 您的 Langfuse 密钥
  • LANGFUSE_PUBLIC_KEY - 您的 Langfuse 公钥
  • LANGFUSE_HOST - 您的 Langfuse 实例的 URL

如果您不想使用 Langfuse 跟踪,只需将这些设置留空即可。

推荐服务器

Baidu Map

Baidu Map

百度地图核心API现已全面兼容MCP协议,是国内首家兼容MCP协议的地图服务商。

官方
精选
JavaScript
Playwright MCP Server

Playwright MCP Server

一个模型上下文协议服务器,它使大型语言模型能够通过结构化的可访问性快照与网页进行交互,而无需视觉模型或屏幕截图。

官方
精选
TypeScript
Magic Component Platform (MCP)

Magic Component Platform (MCP)

一个由人工智能驱动的工具,可以从自然语言描述生成现代化的用户界面组件,并与流行的集成开发环境(IDE)集成,从而简化用户界面开发流程。

官方
精选
本地
TypeScript
Audiense Insights MCP Server

Audiense Insights MCP Server

通过模型上下文协议启用与 Audiense Insights 账户的交互,从而促进营销洞察和受众数据的提取和分析,包括人口统计信息、行为和影响者互动。

官方
精选
本地
TypeScript
VeyraX

VeyraX

一个单一的 MCP 工具,连接你所有喜爱的工具:Gmail、日历以及其他 40 多个工具。

官方
精选
本地
graphlit-mcp-server

graphlit-mcp-server

模型上下文协议 (MCP) 服务器实现了 MCP 客户端与 Graphlit 服务之间的集成。 除了网络爬取之外,还可以将任何内容(从 Slack 到 Gmail 再到播客订阅源)导入到 Graphlit 项目中,然后从 MCP 客户端检索相关内容。

官方
精选
TypeScript
Kagi MCP Server

Kagi MCP Server

一个 MCP 服务器,集成了 Kagi 搜索功能和 Claude AI,使 Claude 能够在回答需要最新信息的问题时执行实时网络搜索。

官方
精选
Python
e2b-mcp-server

e2b-mcp-server

使用 MCP 通过 e2b 运行代码。

官方
精选
Neon MCP Server

Neon MCP Server

用于与 Neon 管理 API 和数据库交互的 MCP 服务器

官方
精选
Exa MCP Server

Exa MCP Server

模型上下文协议(MCP)服务器允许像 Claude 这样的 AI 助手使用 Exa AI 搜索 API 进行网络搜索。这种设置允许 AI 模型以安全和受控的方式获取实时的网络信息。

官方
精选