如何使用 OpenAI 的 Whisper for Windows 將語音轉換為文字

OpenAI 推出的 Whisper 是一款全新的 AI 解決方案,可協助您以獨特的方式將語音轉錄為文字。最重要的是,它是免費的。

然而,有一個相對較小的問題:它的安裝和使用比標準的 Windows 工具更困難,尤其是當你想利用 Nvidia 顯示卡的 Tensor 核心來獲得更好的效能提升時。查看 最好的基於人工智慧的工具,可以免費從你的寫作中創造藝術形象.

不過,別灰心。這就是我們來這裡的原因!繼續閱讀,了解如何安裝和使用它。此外,如果您擁有 Nvidia 顯示卡,我們也會向您展示 Whisper 如何從中受益。

OpenAI 的 Whisper 是什麼?

ChatGPT 很快就在用戶中流行起來,我們已經看到如何使用它。 OpenAI 的 ChatGPT然而,這並不是 OpenAI 唯一有趣的項目。

Whisper 是一款自然語言處理系統,由深度學習和神經網路驅動,能夠「理解」語音並將其轉換為文字。此外,它還擁有多種自訂配置,其效能優於同類解決方案,這得益於:

  1. Whisper 是一款經過自然語言「訓練」的人工智慧解決方案。因此,它比以往的解決方案更能理解「自然」的人類語音。
  2. Whisper 沒有自備介面,也無法錄製音訊。它只能獲取現有的音訊檔案並輸出文字檔案。
  3. 由於在「語言理解」方面非常出色,Whisper 在自動翻譯方面也擁有絕對的優勢。
  4. Whisper 不是一項線上服務,可以完全離線工作。
  5. 如果您有 Nvidia 顯示卡(GTX970 或更新版本),Whisper 可以在「硬體加速模式」下運作以提高其回應速度。
  6. 無需註冊、購買許可證或購買訂閱。

為什麼不支援AMD顯示卡?

GPU 要不只用於圖形輸出,就必須具備完全可程式化的處理器功能。正因如此,Nvidia 創建了 CUDA 架構,正式名稱為「平行運算平台和程式設計模型」。

CUDA 是 Nvidia 的專有技術,僅與 Nvidia GPU 相容。 AMD 最接近的替代方案是 OpenCL 和 Radeon 運算平台。

與其他替代方案相比,CUDA 被認為更成熟、性能更高、更易於使用。因此,大多數開發者只針對 CUDA,這意味著他們的應用程式只能利用 Nvidia GPU 上的硬體功能。這其中就包括 Whisper。查看 Linux 上的 AMD 與 NVIDIA 顯示卡:您應該使用哪一款?

如何下載和安裝 Whisper

不幸的是,Whisper 不是一個可以正常下載、安裝和運行的獨立應用程式。它依賴其他必須安裝的依賴項。

對於 Windows,為了簡化本指南,我們將使用廣受歡迎的 Chocolatey 來安裝大部分必要的應用程式元件。請參閱我們的指南 安裝 Windows 應用程式的最快方法 有關 Chocolatey 的更多資訊。

對於 Linux 和 Mac,安裝過程(Windows 路徑變數和我們將建立的方便的批次檔除外)應該相似。

choco 安裝 ffmpeg

  • 另外,使用以下命令安裝其 Python 版本:
使用 pip3 安裝 python-ffmpeg
  • 最後,從 Github 頁面安裝 Whisper:
pip3 install git+https://github.com/openai/whisper.git

取得支援 CUDA 的 Whisper 版本

雖然 Whisper 主要並非使用 Nvidia GPU,但它所基於的 Torch 軟體包提供了 CUDA 加速版本。使用它來代替「常規」版本的 Whisper,可以藉助 Nvidia 顯示卡更快地完成轉錄任務。

要取得使用 Nvidia CUDA 的 Whisper:

  • 如果您已經安裝了 Torch 的原始版本,請卸載它並使用以下命令刪除所有剩餘檔案:
pip3 卸載 torch
  • 完成後,執行以下命令:
pip 快取清除
  • 使用以下命令安裝 Torch 的支援 CUDA 的版本:
pip3 install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu117

  • 若要檢查 Whisper 是否可以使用 Nvidia GPU,請使用:
whisper — help | findstr -i pytorch

您應該看到 (default: cuda) 而不是 (default: cpu)。檢查 ChatGPT 不會接手你的內容寫作工作的 5 個理由.

Torch 安裝失敗怎麼辦

如果在安裝 Torch 時遇到「找不到版本」錯誤,則可能需要安裝與目前版本並行的舊版本的 Python。

使用此命令來執行此操作:

choco install python --version OLDER_VERSION --side-by-side

將“OLDER_VERSION”替換為 3.10 之類的版本。

接下來,對所有“通用” Whisper 命令使用輔助版本路徑(例如,“c:\Python310\Scripts\pip.exe「而不僅僅是「pip」」。

如何錄製你的聲音

你可以使用任何錄音應用程式將語音轉換為 WAV 或 MP3 檔案。 Windows 系統自備了這樣的應用程序,更多資訊請參閱如何使用 Windows 10 上的錄音機應用.

如需功能齊全的選項,請嘗試 Audacity。請參閱我們的指南 如何使用 Audacity 在 Windows 和 Mac 上錄製音訊。

如何開始使用 Whisper 寫作

儘管 Whisper 沒有配備簡單的圖形使用者介面,但使用起來非常流暢。

假設我們在 c:\MyAudioFiles 資料夾中有一個包含希臘語演講的 LatestNote.mp3 文件,我們想要將其翻譯成英文並將其複製到文字檔案中。

cd C:\MyAudioFiles
  • 我們在文件中運行 Whisper:
耳語 — 模型基礎 — 語言 gr — 任務翻譯 LatestNote.mp3

處理完成後,文字檔案(名為“LatestNote.mp3.txt”)將出現在同一資料夾中。使用文字編輯器(例如記事本)開啟該文件即可查看翻譯後的文字。

我們使用了一個範例翻譯,因為英文翻譯更直接:你只需要使用標籤「lose」、「-language」和「-task」。因此,對於簡單的轉錄,上述命令將是:

耳語 — 模型基礎 LatestNote.mp3

由於 Whisper 使用了多種不同的選項,因此需要使用「model」標籤。讓我們來詳細了解一下,以幫助您選擇最符合您需求的選項。請查看 音頻轉錄有什麼功能?它的作用是什麼?它是如何運作的?

您選擇哪種型號?

Whisper 提供不同的語言模式。模型越大,準確率越高,但對硬體的要求也越高。這些模型包括:

  • 微小的。
  • 基礎。
  • 小。
  • 中。
  • 大的。

對於大多數英語使用者來說,Tiny 或 Base 模型應該就足夠了。對於非英語母語人士,使用較大的模型(例如 Medium 和 Large)可能會獲得更好的效果。

但請注意,中型和大型型號需要超過 8GB 的​​ VRAM(即圖形處理器的內存“)。

若要指定其中一個,請在指令中的「—model」開關後指定模型:

耳語 — 型號 tiny/small/medium/large [檔案]

例如:

耳語 — 小型號 My_Voice_Note.mp3

如何簡化音訊轉錄

每次轉錄音訊時都要輸入完整的 Whisper 指令,這很快就會變得很繁瑣。讓我們建立一個全域可存取的批次檔來簡化這個過程。

  • 啟動 Windows 資源管理器並存取該磁碟機。 C:.
  • 為文字建立一個資料夾,並將其路徑複製到剪貼簿。
  • 在 Windows 開始功能表中,搜尋「路徑」並選擇 修改系統環境變數.

  • ابحثعن 路徑改變者 在「使用者變數」下,選擇 YOUR_USERNAME。雙擊它進行編輯。點選 جديد 將路徑貼到腳本資料夾。按一下「確定」接受變更。

  • 傳回 Windows 資源管理器中的「Scripts」資料夾。在其中建立一個名為「wht.bat」的新批次檔。在其中加入以下命令:
耳語 — 微縮模型 — 語言 %1

  • 建立兩個批次檔“whs”和“whm”。
  • 在第一個文件中新增此命令:
耳語 — 小模型 — 語言 %1
  • 在第二個文件中新增此命令:
耳語 — 模式媒介 — 語言 en %1

恭喜,您現在擁有三個文件,可以輕鬆地將 Whisper 的小型、中型和基本型號與您的音訊檔案一起使用!將任何音訊檔案轉換為文字:

  • 使用 Windows 檔案總管找到該檔案。
  • 右鍵單擊空白處並選擇在終端機中開啟。
  • 鍵入此命令,將“whs”或“whm”替換“wht”以使用小型或中型語言模型:
wht YOUR_AUDIO_FILE.mp3

使用 Whisper 快速編寫音訊內容

即使是打字速度最快的人也趕不上我們說話的速度。然而,直到最近,說話而不是打字並不是創建文件的最佳方式。

大多數語音轉文字解決方案的效果都平平。有些方案值得一試,但要么操作複雜,要么價格昂貴。幸運的是,Whisper 改變了這一切。

完成上述步驟後,您只需一個命令即可高精度地轉錄或翻譯您的語音。現在您可以查看 適用於筆記記錄、會議和講座的最佳音訊轉文字應用程式.

轉到頂部按鈕