本系统集成功能强大的开源项目,把它们的功能系统的整合起来,形成一个能在本地低配边缘设备上部署,高隐私性的自主感知决策机器人,它能做到:
1,自动监控摄像头,识别人和物的概念,区分人的情绪,姿态,动作手势,转化成文本记录保存下来,作为驱动后续动作的条件(也能调用外部API分析生成相应预测),能根据边缘设备性能手动设置监控频率;
2,能通过关键词和特定手指手势触发,与指定音色人物的自主对话功能,并让系统自主根据情景切换不同音色人物,特别适合情景角色扮演,让人有一种身临其境的感受
各语音视频处理组件:
| 组件 | 功能 | 端口 | 协议 |
|------|------|------|------|
| **indextts** | 高质量中文文本转语音 | 7860 | HTTP/WebSocket |
| **sensevoice** | 多功能语音理解 (ASR、情感识别) | 50000 | HTTP | 快速语音转文本 |
| **whisperlivekit** | 实时语音 | 8000 | WebSocket |
| **stepaudio2** | 高级语音理解和对话 | 50001 7861 5052 | HTTP | 5052中英互译 | 7861界面 | 50001 API调用 |
| **MoJinS** | 太极星云向量编码系统 | 5053 | HTTP | 基于SIMD优化的向量处理 |
| **ffmpeg_push** | 摄像头推流qwen2.5vl:3b分析视频 | 5050 | 占用0.8G-7G显存 |
| **smolvlm2** | Llama.cpp本地编译了smolvlm2模型 | 5055 | 可编译市面绝大部分模型运行在CPU上 |
| **supervision_video** | yolo视频分析平台 | 5051 | 集合以上所有项目 |
## 🚀 快速开始
### 环境要求
- Docker & Docker Compose
- NVIDIA GPU (推荐,用于加速推理)
- 至少 16GB RAM
### 启动服务
```bash
# 启动所有服务
docker compose up -d
# 查看服务状态
docker compose ps
# 查看实时日志
docker compose logs -f
```
### 访问界面
- **IndexTTS 主界面**: http://localhost:7860
- **whisperlivekit 主界面**: http://localhost:8000
- **SenseVoice API**: http://localhost:50000/docs
- **Step-Audio2 API 文档**: http://localhost:50001/docs
- **Step-Audio2 前端界面**: http://localhost:7861
- **Step-Audio2 翻译API**: http://localhost:5052
- **MoJinS API**: http://localhost:5688/docs
curl http://localhost:50001/health
curl http://localhost:5052/health
curl http://stepaudio2:5052/health
curl http://stepaudio2:50001/health
curl http://localhost:50000/memory/health
curl http://sensevoice:50000/memory/health
"WhisperLiveKit (内存健康)": "curl http://localhost:8000/memory/health",
"WhisperLiveKit (振幅状态)": "curl http://localhost:8000/amplitude/status"

评论