ASR-demo/README.md

31 lines
1.7 KiB
Markdown

# FunASR 实时语音识别演示
本项目将 FunASR 流式 WebSocket 后端与腾讯演示前端分开运行。前端沿用原有页面文件,界面和消息协议保持不变。
## 安装与准备模型
`requirements.txt` 中的 PyTorch 版本面向使用 CUDA 13 的 GB10 环境。部署到其它设备时,请按对应 CUDA 版本调整 PyTorch 软件源和版本。
~~~powershell
python -m pip install -r requirements.txt
if (-not (Test-Path .env)) { Copy-Item .env.example .env }
python scripts/download_models.py
~~~
默认运行 `python scripts/download_models.py` 会下载当前 ASR 模型、热词定稿模型及清单中的辅助模型;已完整下载的模型会自动跳过。
## 启动
在项目根目录打开两个终端,分别运行:
~~~powershell
python backend/run_backend.py
python frontend/run_frontend.py
~~~
后端负责启动 FunASR 原生 WebSocket 服务、CAM++ 服务和浏览器协议桥接服务。前端提供腾讯演示页面,并将 `/ws` 和 `/api/stop` 请求转发给后端。模型路径、设备、VAD 静音时长、说话人聚类参数和端口均可在 `.env` 中配置。
模型目录和运行细节见 [FunASR 使用说明](FUNASR_README.md)。
测试热词时,在前端左侧“识别配置”的热词输入框中输入多个词,用逗号、顿号或分号分隔,然后开始识别。服务保留 FunASR 流式首遍预览,并在每段语音结束后用 Contextual Paraformer 做 2-pass 最终解码;最终识别模型与流式模型默认优先使用 `cuda:0`。热词在当前会话启动时生效,识别过程中修改输入不会影响当前会话,需停止后重新开始。运行 `python scripts/download_models.py` 会同时下载流式模型、Contextual 热词模型和配置的辅助模型。