【每日随记】 Whisper 离线语音识别搭建
2023-03-30 / 0 评论 / 41 阅读 / 7 点赞

【每日随记】 Whisper 离线语音识别搭建

发光的神
2023-03-30 / 0 评论 / 41 阅读 / 正在检测是否收录...

简介

whisper是一种通用的语音识别模型Python3编写的,它在不同音频的大型数据集上进行训练,也是一个多任务模型,可以执行多语言语音识别、语音翻译和语言识别,搭建在本地能实现离线语音识别,准确度还可以使用起来很方便以。
lfum40bg.png

环境搭建

lfumhswu.png

首先建议你下载Python3的版本在 3.7.0 ~ 3.10.0 之间的版本,如果不是在安装过程中可能会遇到些问题,有些第三方库没有更高的版本支持,可能会导致安装失败,不知道如何安装Python3的小伙伴,可以参考这篇文章:Py3安装教程

lfumrh75.png
Github项目

在安装好Python3之后,为了避免不必要的麻烦,请使用管理员身份运行终端,并执行以下命令以安装Whisper。

pip install whisper

lfumxfqb.png

我已经成功安装了whisper,现在需要下载PyTorch,你可以从官网自行下载并安装,也可以根据自己的需求选择相应的PyTorch版本进行下载,我用的是CPU版本的你也可以用以下命令进行安装。

pip install torch torchvision torchaudio -i https://mirrors.aliyun.com/pypi/simple/ 

lfun1dmd.png

lfungdiu.png

lfunho7x.png

Git国内镜像
再安装Git,安装完后配合Git下载 whisper 按顺序来在终端执行以下两条命令,过程可能有点慢需要耐心等待。

pip install git+https://github.com/openai/whisper.git
pip install --upgrade --no-deps --force-reinstall git+https://github.com/openai/whisper.git

lfuo26mg.png

最后一步安装ffmpeg配置到环境变量中,让whisper需要调用的时候不会报错。
ffmpeg官网

lfuo6hmb.png

以上安装步骤完成后在终端输入 whisper 看看是否能运行起来。

lfuoa5gq.png

whisper E:\Desktop\5.wav # 音频传参识别
whisper E:\Desktop\5.wav --model medium # 离线模型识别

whisper默认使用的是base模型,还有一个 medium 模型是需要下载的,运行以上命令会自动下载模型,更多方式请参考官方文档。

Python3调用

import whisper

model = whisper.load_model("base")
result = model.transcribe("audio.mp3")
print(result["text"])
import whisper

model = whisper.load_model("base")
audio = whisper.load_audio("audio.mp3")

audio = whisper.pad_or_trim(audio)
mel = whisper.log_mel_spectrogram(audio).to(model.device)
_, probs = model.detect_language(mel)

print(f"Detected language: {max(probs, key=probs.get)}")
options = whisper.DecodingOptions()
result = whisper.decode(model, mel, options)

print(result.text)
7

评论 (0)

取消
0:00