MCP Prompt Tester
一个 MCP 服务器,允许代理在 OpenAI 和 Anthropic 模型上测试和比较 LLM 提示词,支持单次测试、并排比较和多轮对话。
README
MCP Prompt Tester
一个简单的 MCP 服务器,允许代理使用不同的提供商测试 LLM prompt。
功能
- 使用 OpenAI 和 Anthropic 模型测试 prompt
- 配置系统 prompt、用户 prompt 和其他参数
- 获取格式化的响应或错误消息
- 通过 .env 文件支持轻松进行环境设置
安装
# 使用 pip 安装
pip install -e .
# 或者使用 uv 安装
uv install -e .
API 密钥设置
服务器需要您想要使用的提供商的 API 密钥。您可以通过两种方式进行设置:
选项 1:环境变量
设置以下环境变量:
OPENAI_API_KEY- 您的 OpenAI API 密钥ANTHROPIC_API_KEY- 您的 Anthropic API 密钥
选项 2:.env 文件(推荐)
- 在您的项目目录或主目录中创建一个名为
.env的文件 - 以以下格式添加您的 API 密钥:
OPENAI_API_KEY=your-openai-api-key-here
ANTHROPIC_API_KEY=your-anthropic-api-key-here
- 服务器将自动检测并加载这些密钥
为了方便起见,示例模板包含在 .env.example 中。
用法
使用 stdio(默认)或 SSE 传输启动服务器:
# 使用 stdio 传输(默认)
prompt-tester
# 使用 SSE 传输,自定义端口
prompt-tester --transport sse --port 8000
可用工具
服务器为 MCP 赋能的代理公开了以下工具:
1. list_providers
检索可用的 LLM 提供商及其默认模型。
参数:
- 无需参数
示例响应:
{
"providers": {
"openai": [
{
"type": "gpt-4",
"name": "gpt-4",
"input_cost": 0.03,
"output_cost": 0.06,
"description": "最强大的 GPT-4 模型"
},
// ... 其他模型 ...
],
"anthropic": [
// ... 模型 ...
]
}
}
2. test_comparison
并排比较多个 prompt,允许您同时测试不同的提供商、模型和参数。
参数:
comparisons(数组): 包含 1-4 个比较配置的列表,每个配置包含:provider(字符串): 要使用的 LLM 提供商 ("openai" 或 "anthropic")model(字符串): 模型名称system_prompt(字符串): 系统 prompt(模型的指令)user_prompt(字符串): 用户的消息/prompttemperature(数字, 可选): 控制随机性max_tokens(整数, 可选): 要生成的最大 token 数top_p(数字, 可选): 通过 nucleus sampling 控制多样性
示例用法:
{
"comparisons": [
{
"provider": "openai",
"model": "gpt-4",
"system_prompt": "你是一个乐于助人的助手。",
"user_prompt": "用简单的术语解释量子计算。",
"temperature": 0.7
},
{
"provider": "anthropic",
"model": "claude-3-opus-20240229",
"system_prompt": "你是一个乐于助人的助手。",
"user_prompt": "用简单的术语解释量子计算。",
"temperature": 0.7
}
]
}
3. test_multiturn_conversation
管理与 LLM 提供商的多轮对话,允许您创建和维护有状态的对话。
模式:
start: 开始新的对话continue: 继续现有的对话get: 检索对话历史记录list: 列出所有活动对话close: 关闭对话
参数:
mode(字符串): 操作模式 ("start", "continue", "get", "list", 或 "close")conversation_id(字符串): 对话的唯一 ID(继续、获取、关闭模式需要)provider(字符串): LLM 提供商(开始模式需要)model(字符串): 模型名称(开始模式需要)system_prompt(字符串): 系统 prompt(开始模式需要)user_prompt(字符串): 用户消息(在开始和继续模式中使用)temperature(数字, 可选): 模型的温度参数max_tokens(整数, 可选): 要生成的最大 token 数top_p(数字, 可选): Top-p 采样参数
示例用法(开始对话):
{
"mode": "start",
"provider": "openai",
"model": "gpt-4",
"system_prompt": "你是一个专门研究物理学的乐于助人的助手。",
"user_prompt": "你能解释一下什么是暗物质吗?"
}
示例用法(继续对话):
{
"mode": "continue",
"conversation_id": "conv_12345",
"user_prompt": "这与暗能量有什么关系?"
}
代理的示例用法
使用 MCP 客户端,代理可以使用如下工具:
import asyncio
import json
from mcp.client.session import ClientSession
from mcp.client.stdio import StdioServerParameters, stdio_client
async def main():
async with stdio_client(
StdioServerParameters(command="prompt-tester")
) as (read, write):
async with ClientSession(read, write) as session:
await session.initialize()
# 1. 列出可用的提供商和模型
providers_result = await session.call_tool("list_providers", {})
print("Available providers and models:", providers_result)
# 2. 使用单个模型和 prompt 运行基本测试
comparison_result = await session.call_tool("test_comparison", {
"comparisons": [
{
"provider": "openai",
"model": "gpt-4",
"system_prompt": "你是一个乐于助人的助手。",
"user_prompt": "用简单的术语解释量子计算。",
"temperature": 0.7,
"max_tokens": 500
}
]
})
print("Single model test result:", comparison_result)
# 3. 并排比较多个 prompt/模型
comparison_result = await session.call_tool("test_comparison", {
"comparisons": [
{
"provider": "openai",
"model": "gpt-4",
"system_prompt": "你是一个乐于助人的助手。",
"user_prompt": "用简单的术语解释量子计算。",
"temperature": 0.7
},
{
"provider": "anthropic",
"model": "claude-3-opus-20240229",
"system_prompt": "你是一个乐于助人的助手。",
"user_prompt": "用简单的术语解释量子计算。",
"temperature": 0.7
}
]
})
print("Comparison result:", comparison_result)
# 4. 开始多轮对话
conversation_start = await session.call_tool("test_multiturn_conversation", {
"mode": "start",
"provider": "openai",
"model": "gpt-4",
"system_prompt": "你是一个专门研究物理学的乐于助人的助手。",
"user_prompt": "你能解释一下什么是暗物质吗?"
})
print("Conversation started:", conversation_start)
# 从响应中获取对话 ID
response_data = json.loads(conversation_start.text)
conversation_id = response_data.get("conversation_id")
# 继续对话
if conversation_id:
conversation_continue = await session.call_tool("test_multiturn_conversation", {
"mode": "continue",
"conversation_id": conversation_id,
"user_prompt": "这与暗能量有什么关系?"
})
print("Conversation continued:", conversation_continue)
# 获取对话历史记录
conversation_history = await session.call_tool("test_multiturn_conversation", {
"mode": "get",
"conversation_id": conversation_id
})
print("Conversation history:", conversation_history)
asyncio.run(main())
MCP 代理集成
对于 MCP 赋能的代理,集成非常简单。当您的代理需要测试 LLM prompt 时:
- 发现: 代理可以使用
list_providers来发现可用的模型及其功能 - 简单测试: 对于快速测试,使用带有单个配置的
test_comparison工具 - 比较: 当代理需要评估不同的 prompt 或模型时,它可以使用带有多个配置的
test_comparison - 有状态交互: 对于多轮对话,代理可以使用
test_multiturn_conversation工具来管理对话
这允许代理:
- 测试 prompt 变体以找到最有效的措辞
- 比较不同模型以执行特定任务
- 在多轮对话中保持上下文
- 优化温度和 max_tokens 等参数
- 在开发过程中跟踪 token 使用情况和成本
配置
您可以使用环境变量设置 API 密钥和可选的跟踪配置:
必需的 API 密钥
OPENAI_API_KEY- 您的 OpenAI API 密钥ANTHROPIC_API_KEY- 您的 Anthropic API 密钥
可选的 Langfuse 跟踪
服务器支持 Langfuse,用于跟踪和观察 LLM 调用。这些设置是可选的:
LANGFUSE_SECRET_KEY- 您的 Langfuse 密钥LANGFUSE_PUBLIC_KEY- 您的 Langfuse 公钥LANGFUSE_HOST- 您的 Langfuse 实例的 URL
如果您不想使用 Langfuse 跟踪,只需将这些设置留空即可。
推荐服务器
Baidu Map
百度地图核心API现已全面兼容MCP协议,是国内首家兼容MCP协议的地图服务商。
Playwright MCP Server
一个模型上下文协议服务器,它使大型语言模型能够通过结构化的可访问性快照与网页进行交互,而无需视觉模型或屏幕截图。
Magic Component Platform (MCP)
一个由人工智能驱动的工具,可以从自然语言描述生成现代化的用户界面组件,并与流行的集成开发环境(IDE)集成,从而简化用户界面开发流程。
Audiense Insights MCP Server
通过模型上下文协议启用与 Audiense Insights 账户的交互,从而促进营销洞察和受众数据的提取和分析,包括人口统计信息、行为和影响者互动。
VeyraX
一个单一的 MCP 工具,连接你所有喜爱的工具:Gmail、日历以及其他 40 多个工具。
graphlit-mcp-server
模型上下文协议 (MCP) 服务器实现了 MCP 客户端与 Graphlit 服务之间的集成。 除了网络爬取之外,还可以将任何内容(从 Slack 到 Gmail 再到播客订阅源)导入到 Graphlit 项目中,然后从 MCP 客户端检索相关内容。
Kagi MCP Server
一个 MCP 服务器,集成了 Kagi 搜索功能和 Claude AI,使 Claude 能够在回答需要最新信息的问题时执行实时网络搜索。
e2b-mcp-server
使用 MCP 通过 e2b 运行代码。
Neon MCP Server
用于与 Neon 管理 API 和数据库交互的 MCP 服务器
Exa MCP Server
模型上下文协议(MCP)服务器允许像 Claude 这样的 AI 助手使用 Exa AI 搜索 API 进行网络搜索。这种设置允许 AI 模型以安全和受控的方式获取实时的网络信息。