本系统集成功能强大的开源项目,把它们的功能系统的整合起来,形成一个能在本地低配边缘设备上部署,高隐私性的自主感知决策机器人,它能做到:

1,自动监控摄像头,识别人和物的概念,区分人的情绪,姿态,动作手势,转化成文本记录保存下来,作为驱动后续动作的条件(也能调用外部API分析生成相应预测),能根据边缘设备性能手动设置监控频率;

2,能通过关键词和特定手指手势触发,与指定音色人物的自主对话功能,并让系统自主根据情景切换不同音色人物,特别适合情景角色扮演,让人有一种身临其境的感受

各语音视频处理组件:


| 组件 | 功能 | 端口 | 协议 |

|------|------|------|------|

| **indextts** | 高质量中文文本转语音 | 7860 | HTTP/WebSocket |

| **sensevoice** | 多功能语音理解 (ASR、情感识别) | 50000 | HTTP | 快速语音转文本 |

| **whisperlivekit** | 实时语音 | 8000 | WebSocket |

| **stepaudio2** | 高级语音理解和对话 | 50001 7861 5052 | HTTP | 5052中英互译 | 7861界面 | 50001 API调用 |

| **MoJinS** | 太极星云向量编码系统 | 5053 | HTTP | 基于SIMD优化的向量处理 |

| **ffmpeg_push** | 摄像头推流qwen2.5vl:3b分析视频 | 5050 |  占用0.8G-7G显存 |

| **smolvlm2** | Llama.cpp本地编译了smolvlm2模型 | 5055 | 可编译市面绝大部分模型运行在CPU上 |

| **supervision_video** | yolo视频分析平台 | 5051 | 集合以上所有项目 |


## 🚀 快速开始


### 环境要求

- Docker & Docker Compose

- NVIDIA GPU (推荐,用于加速推理)

- 至少 16GB RAM


### 启动服务

```bash

# 启动所有服务

docker compose up -d


# 查看服务状态

docker compose ps


# 查看实时日志

docker compose logs -f

```


### 访问界面

- **IndexTTS 主界面**:       http://localhost:7860

- **whisperlivekit 主界面**: http://localhost:8000

- **SenseVoice API**:        http://localhost:50000/docs

- **Step-Audio2 API 文档**:  http://localhost:50001/docs

- **Step-Audio2 前端界面**:  http://localhost:7861

- **Step-Audio2 翻译API**:   http://localhost:5052

- **MoJinS API**:           http://localhost:5688/docs

   

curl http://localhost:50001/health

curl http://localhost:5052/health

curl http://stepaudio2:5052/health

curl http://stepaudio2:50001/health

curl http://localhost:50000/memory/health

curl http://sensevoice:50000/memory/health

"WhisperLiveKit (内存健康)": "curl http://localhost:8000/memory/health",

"WhisperLiveKit (振幅状态)": "curl http://localhost:8000/amplitude/status"

评论