尧图精选

FunASR 安装教程:从零跑通第一个语音识别示例

🕒 发布时间:2026/9/7 15:28:06 📁 来源:尧图网络
FunASR 安装教程从零跑通第一个语音识别示例【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASRFunASR 是阿里巴巴达摩院开源的语音识别工具包可以在自己的机器上完成离线转写、流式识别、VAD、标点恢复与说话人分离也能一键部署成 OpenAI 兼容的 API 服务。它适合需要自建 ASR 能力的开发者以及想在半小时内用 Python 跑通语音识别的新手。这篇 FunASR 安装教程从环境配置讲到跑通最小示例。 30 秒快速上手赶时间的读者先跑这 5 行命令完成安装与验证git clone https://gitcode.com/GitHub_Trending/fun/FunASR.git cd FunASR pip install torch torchaudio pip install -e ./ python -c import funasr; print(funasr.__version__)最后一行能打印出版本号当前为 1.4.14说明环境已就绪。下面逐段拆解每步的细节。FunASR 能力速写它不是单一模型而是一个工具包按场景挑模型中、英、日加方言场景选 Fun-ASR-Nano800M 参数需要 GPUCPU 部署选 SenseVoiceSmall带情绪和音频事件标注纯 CPU 也有约 17 倍实时速度会议录音场景把 fsmn-vad、cam 挂进同一条 AutoModel 流水线直接输出分句说话人标签和时间戳服务化时一条命令起 OpenAI 兼容接口现有代码走/v1/audio/transcriptions即可接入连 Python 都没有的边缘设备也有 GGUF 单文件二进制可跑环境要求一览项目要求与说明操作系统Linux、macOS、Windows 均可Python≥ 3.8官方安装文档建议不超过 3.13PyTorch≥ 1.11torch 与 torchaudio 需同源同版本安装GPU可选。Fun-ASR-Nano 等 GPU 模型必须SenseVoice、Paraformer 可跑 CPU模型权重不随仓库分发首次运行自动从 ModelScope 或 Hugging Face 下载安装实操准备干净的虚拟环境避免与系统 Python 的依赖打架建议用 conda 或 venv 建独立环境conda create -n funasr python3.10 conda activate funasr命令提示符前出现(funasr)前缀即代表虚拟环境已激活。克隆代码到本地git clone https://gitcode.com/GitHub_Trending/fun/FunASR.git cd FunASR执行完当前目录应能看到README.md、funasr/、examples/等目录。如果只当库用、不改源码可跳过此步直接pip install funasr。先装 PyTorchPyTorch 必须先于 funasr 安装。有 GPU 时wheel 要与 NVIDIA 驱动版本匹配对照表见 PyTorch 官网pip install torch torchaudio装完用python -c import torch; print(torch.__version__, torch.cuda.is_available())验证打印True表示 CUDA 可用否则代码里请写devicecpu。安装 FunASR在仓库目录内执行pip install -e ./过程会拉入 librosa、soundfile、modelscope 等依赖看到Successfully installed funasr-...即完成。-e表示可编辑安装本地改源码立刻生效方便二次开发。验证安装python -c import funasr; print(funasr.__version__)无 ImportError 且打印出版本号安装验证通过。跑通最小示例新建demo.py写入以下内容SenseVoiceSmall 可跑 CPU模型首次运行自动下载from funasr import AutoModel model AutoModel(modeliic/SenseVoiceSmall, devicecpu) result model.generate(inputaudio.wav) print(result[0][text])执行python demo.pyaudio.wav换成你自己的 16kHz 音频终端打印出转写文本即跑通。想更快出结果可用命令行方式funasr audio.wav参数见 README.md更多模型组合在 examples/ 目录下。常见报错排查import funasr 报依赖冲突现象安装或 import 时报 numpy、torch 版本冲突原因torch 与 torchaudio 来自不同安装源且 funasr 要求numpy2解决新建空虚拟环境同一源按顺序安装 torch、torchaudio再装 funasrApple Silicon 上 cffi 架构不匹配现象M1/M2 报incompatible architecture (have x86_64, need arm64)原因环境里残留 x86_64 版 cffi 二进制解决pip uninstall cffi pycparser后执行ARCHFLAGS-arch arm64 pip install cffi pycparser --compile --no-cache-dir模型下载慢或中断现象首次运行卡在模型下载原因ModelScope 与 Hugging Face 在不同网络环境下速度差异大解决中国大陆优先用 ModelScope 模型名如示例中的iic/...海外网络 Hugging Face 更快中断后删掉该模型的部分缓存重试详见 docs/troubleshooting.md下一步跑通后用 docs/model_selection.md 选第一个正式模型从 Whisper 或云端 API 迁过来的看 docs/migration_from_whisper.md 做迁移对照。完整参数与安装细节在 docs/installation/installation_zh.md。【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联 返回资讯列表 →