Voice Recognition MCP Service
提供语音识别和文本提取功能,支持标准输入输出 (stdio) 和 MCP 模式。可以处理音频文件或 Base64 编码的数据,并返回包含语言、情感和说话人信息的结构化结果。
README
语音识别 MCP 服务
此服务通过 stdio 和 MCP 模式提供语音识别和文本提取功能。
功能
- 从文件进行语音识别
- 从 base64 编码的数据进行语音识别
- 文本提取
- 支持 stdio 和 MCP 模式
- 结构化的语音识别结果
项目结构
voice_service.py- 核心服务实现stdio_server.py- stdio 模式入口点mcp_server.py- MCP 模式入口点build.py- 可执行文件的构建脚本build_exec.sh- 构建执行脚本test_*.sh- 不同功能的测试脚本
安装
- 克隆仓库:
git clone https://github.com/AIO-2030/mcp_voice_identify.git
cd mcp_voice_identify
- 安装依赖:
pip install -r requirements.txt
- 在
.env中设置环境变量:
API_URL=your_api_url
API_KEY=your_api_key
使用
stdio 模式
- 运行服务:
python stdio_server.py
- 通过 stdin 发送 JSON-RPC 请求:
{
"jsonrpc": "2.0",
"method": "help",
"params": {},
"id": 1
}
- 或者使用可执行文件:
./dist/voice_stdio
MCP 模式
- 运行服务:
python mcp_server.py
- 或者使用可执行文件:
./dist/voice_mcp
语音识别结果
该服务提供结构化的语音识别结果。以下是响应格式的示例:
原始 API 响应
{
"jsonrpc": "2.0",
"result": {
"message": "input processed successfully",
"results": "test test test",
"label_result": "<|en|><|EMO_UNKNOWN|><|Speech|><|woitn|>test test test"
},
"id": 1
}
重构后的响应
{
"jsonrpc": "2.0",
"result": {
"message": "input processed successfully",
"results": "test test test",
"label_result": {
"lan": "en",
"emo": "unknown",
"type": "speech",
"speaker": "woitn",
"text": "test test test"
}
},
"id": 1
}
Label Result 字段
label_result 字段包含以下结构化信息:
| 字段 | 描述 | 示例值 |
|---|---|---|
| lan | 语言代码 | "en" |
| emo | 情感状态 | "unknown" |
| type | 音频类型 | "speech" |
| speaker | 说话人标识符 | "woitn" |
| text | 识别的文本内容 | "test test test" |
特殊标签
该服务识别并处理原始响应中的以下特殊标签:
<|en|>- 语言代码<|EMO_UNKNOWN|>- 情感状态<|Speech|>- 音频类型<|woitn|>- 说话人标识符
构建可执行文件
- 使构建脚本可执行:
chmod +x build_exec.sh
- 构建 stdio 模式可执行文件:
./build_exec.sh
- 构建 MCP 模式可执行文件:
./build_exec.sh mcp
可执行文件将在以下位置创建:
- stdio 模式:
dist/voice_stdio - MCP 模式:
dist/voice_mcp
测试
运行测试脚本:
chmod +x test_*.sh
./test_help.sh
./test_voice_file.sh
./test_voice_base64.sh
许可证
此项目根据 MIT 许可证获得许可 - 有关详细信息,请参阅 LICENSE 文件。
推荐服务器
Baidu Map
百度地图核心API现已全面兼容MCP协议,是国内首家兼容MCP协议的地图服务商。
Playwright MCP Server
一个模型上下文协议服务器,它使大型语言模型能够通过结构化的可访问性快照与网页进行交互,而无需视觉模型或屏幕截图。
Magic Component Platform (MCP)
一个由人工智能驱动的工具,可以从自然语言描述生成现代化的用户界面组件,并与流行的集成开发环境(IDE)集成,从而简化用户界面开发流程。
Audiense Insights MCP Server
通过模型上下文协议启用与 Audiense Insights 账户的交互,从而促进营销洞察和受众数据的提取和分析,包括人口统计信息、行为和影响者互动。
VeyraX
一个单一的 MCP 工具,连接你所有喜爱的工具:Gmail、日历以及其他 40 多个工具。
graphlit-mcp-server
模型上下文协议 (MCP) 服务器实现了 MCP 客户端与 Graphlit 服务之间的集成。 除了网络爬取之外,还可以将任何内容(从 Slack 到 Gmail 再到播客订阅源)导入到 Graphlit 项目中,然后从 MCP 客户端检索相关内容。
Kagi MCP Server
一个 MCP 服务器,集成了 Kagi 搜索功能和 Claude AI,使 Claude 能够在回答需要最新信息的问题时执行实时网络搜索。
e2b-mcp-server
使用 MCP 通过 e2b 运行代码。
Neon MCP Server
用于与 Neon 管理 API 和数据库交互的 MCP 服务器
Exa MCP Server
模型上下文协议(MCP)服务器允许像 Claude 这样的 AI 助手使用 Exa AI 搜索 API 进行网络搜索。这种设置允许 AI 模型以安全和受控的方式获取实时的网络信息。