简介
whisper是一种通用的语音识别模型Python3编写的,它在不同音频的大型数据集上进行训练,也是一个多任务模型,可以执行多语言语音识别、语音翻译和语言识别,搭建在本地能实现离线语音识别,准确度还可以使用起来很方便以。
环境搭建

首先建议你下载Python3的版本在 3.7.0 ~ 3.10.0 之间的版本,如果不是在安装过程中可能会遇到些问题,有些第三方库没有更高的版本支持,可能会导致安装失败,不知道如何安装Python3的小伙伴,可以参考这篇文章:Py3安装教程 。
在安装好Python3之后,为了避免不必要的麻烦,请使用管理员身份运行终端,并执行以下命令以安装Whisper。
pip install whisper
我已经成功安装了whisper,现在需要下载PyTorch,你可以从官网自行下载并安装,也可以根据自己的需求选择相应的PyTorch版本进行下载,我用的是CPU版本的你也可以用以下命令进行安装。
pip install torch torchvision torchaudio -i https://mirrors.aliyun.com/pypi/simple/ 


Git国内镜像
再安装Git,安装完后配合Git下载 whisper 按顺序来在终端执行以下两条命令,过程可能有点慢需要耐心等待。
pip install git+https://github.com/openai/whisper.gitpip install --upgrade --no-deps --force-reinstall git+https://github.com/openai/whisper.git
最后一步安装ffmpeg配置到环境变量中,让whisper需要调用的时候不会报错。
ffmpeg官网

以上安装步骤完成后在终端输入 whisper 看看是否能运行起来。

whisper E:\Desktop\5.wav # 音频传参识别whisper E:\Desktop\5.wav --model medium # 离线模型识别whisper默认使用的是base模型,还有一个 medium 模型是需要下载的,运行以上命令会自动下载模型,更多方式请参考官方文档。
Python3调用
import whisper
model = whisper.load_model("base")
result = model.transcribe("audio.mp3")
print(result["text"])import whisper
model = whisper.load_model("base")
audio = whisper.load_audio("audio.mp3")
audio = whisper.pad_or_trim(audio)
mel = whisper.log_mel_spectrogram(audio).to(model.device)
_, probs = model.detect_language(mel)
print(f"Detected language: {max(probs, key=probs.get)}")
options = whisper.DecodingOptions()
result = whisper.decode(model, mel, options)
print(result.text)

评论 (0)