ASR-demo/model_manifest.json

138 lines
4.7 KiB
JSON

{
"default_model": "iic/speech_paraformer-large_asr_nat-zh-cn-16k-common-vocab8404-online",
"hotword_model": "iic/speech_paraformer-large-contextual_asr_nat-zh-cn-16k-common-vocab8404",
"models": {
"iic/speech_paraformer-large_asr_nat-zh-cn-16k-common-vocab8404-online": {
"alias": "paraformer-zh-streaming",
"directory": "iic/speech_paraformer-large_asr_nat-zh-cn-16k-common-vocab8404-online",
"description": "FunASR 流式 Paraformer 语音识别模型,用于实时首遍识别并输出中间结果",
"required_files": [
"configuration.json",
"config.yaml"
],
"any_files": [
"*.pb",
"*.pt",
"*.onnx",
"*.bin",
"*.model",
"*.safetensors"
],
"min_total_size_bytes": 1000000
},
"iic/speech_paraformer-large-contextual_asr_nat-zh-cn-16k-common-vocab8404": {
"alias": "paraformer-zh-contextual",
"directory": "iic/speech_paraformer-large-contextual_asr_nat-zh-cn-16k-common-vocab8404",
"description": "FunASR Contextual Paraformer 热词模型,用于结合会话热词生成最终识别结果",
"revision": "v2.0.4",
"required_files": [
"configuration.json",
"config.yaml"
],
"any_files": [
"*.pt",
"*.bin",
"*.safetensors"
],
"min_total_size_bytes": 1000000
}
},
"auxiliary_models": {
"damo/speech_fsmn_vad_zh-cn-16k-common-pytorch": {
"alias": "vad",
"directory": "damo/speech_fsmn_vad_zh-cn-16k-common-pytorch",
"kind": "vad",
"description": "FSMN 语音活动检测模型,用于检测语音起止并切分语音片段",
"revision": "v2.0.2",
"required_files": [
"configuration.json",
"config.yaml",
"model.pb"
],
"min_total_size_bytes": 1000000,
"funasr_alias": "fsmn-vad"
},
"iic/punc_ct-transformer_zh-cn-common-vocab272727-pytorch": {
"alias": "ct-punc",
"directory": "iic/punc_ct-transformer_zh-cn-common-vocab272727-pytorch",
"kind": "punctuation",
"description": "CT-Transformer 标点恢复模型,用于为识别文本补充标点符号(可选)",
"required_files": [
"configuration.json",
"config.yaml"
],
"any_files": [
"*.pt",
"*.bin",
"*.onnx"
],
"min_total_size_bytes": 1000000
},
"iic/speech_campplus_speaker-diarization_common": {
"alias": "diarization",
"directory": "iic/speech_campplus_speaker-diarization_common",
"kind": "diarization",
"description": "CAM++ 音视频说话人分离扩展包,包含音频检测及人脸关联所需组件",
"required_files": [
"configuration.json",
"config.yaml",
"onnx/asd.onnx",
"onnx/face_recog_ir101.onnx",
"onnx/fqa.onnx",
"onnx/version-RFB-320.onnx"
],
"min_total_size_bytes": 50000000
},
"iic/speech_campplus_sv_zh-cn_16k-common": {
"alias": "speaker",
"directory": "iic/speech_campplus_sv_zh-cn_16k-common",
"kind": "speaker_verification",
"description": "CAM++ 声纹特征模型,用于提取说话人向量并进行会话内说话人匹配",
"revision": "v2.0.2",
"required_files": [
"configuration.json",
"config.yaml",
"campplus_cn_common.bin"
],
"min_total_size_bytes": 10000000
},
"iic/speech_eres2netv2_sv_zh-cn_16k-common": {
"alias": "realtime-speaker",
"directory": "iic/speech_eres2netv2_sv_zh-cn_16k-common",
"kind": "realtime_speaker_verification",
"description": "ERes2NetV2 实时声纹验证模型,用于提取和比对说话人特征",
"required_files": [
"configuration.json"
],
"any_files": [
"*"
],
"min_total_size_bytes": 10000000
},
"damo/speech_campplus_sv_zh-cn_16k-common": {
"alias": "speaker-damo",
"directory": "damo/speech_campplus_sv_zh-cn_16k-common",
"kind": "speaker_verification",
"description": "CAM++ 声纹验证模型资源,供相关说话人识别配置使用",
"required_files": [
"configuration.json",
"config.yaml",
"campplus_cn_common.bin"
],
"min_total_size_bytes": 10000000
},
"damo/speech_campplus-transformer_scl_zh-cn_16k-common": {
"alias": "speaker-transformer",
"directory": "damo/speech_campplus-transformer_scl_zh-cn_16k-common",
"kind": "speaker_transformer",
"description": "CAM++ 说话人聚类的 Transformer/SCL 辅助权重,需与声纹模型配套使用",
"required_files": [
"configuration.json",
"campplus_cn_encoder.pt",
"transformer_backend.pt"
],
"min_total_size_bytes": 10000000
}
}
}