1.2 KiB
1.2 KiB
FunASR 实时语音识别演示
本项目将 FunASR 流式 WebSocket 后端与腾讯演示前端分开运行。前端沿用原有页面文件,界面和消息协议保持不变。
安装与准备模型
requirements.txt 中的 PyTorch 版本面向使用 CUDA 13 的 GB10 环境。部署到其它设备时,请按对应 CUDA 版本调整 PyTorch 软件源和版本。
python -m pip install -r requirements.txt
if (-not (Test-Path .env)) { Copy-Item .env.example .env }
python scripts/download_models.py --funasr-runtime
--funasr-runtime 会下载流式 Paraformer、FSMN-VAD、CAM++ 和标点模型。若要下载 model_manifest.json 中列出的所有可选模型,请运行 python scripts/download_models.py。
启动
在项目根目录打开两个终端,分别运行:
python backend/run_backend.py
python frontend/run_frontend.py
后端负责启动 FunASR 原生 WebSocket 服务、CAM++ 服务和浏览器协议桥接服务。前端提供腾讯演示页面,并将 /ws 和 /api/stop 请求转发给后端。模型路径、设备、VAD 静音时长、说话人聚类参数和端口均可在 .env 中配置。
模型目录和运行细节见 FunASR 使用说明。