在 macOS 上,如果您希望實現高精準度且極速的本地語音轉文字,mlx-whisper 是目前最佳的解決方案。mlx-whisper 是一個專為 Apple Silicon(M1/M2/M3/M4 系列晶片)打造的語音識別工具,它基於 Apple 官方開源的 MLX 機器學習框架,將 OpenAI 的 Whisper 模型進行深度硬體加速與記憶體優化。
為什麼選擇 mlx-whisper?Apple Silicon 專屬優勢解析
傳統的 OpenAI Whisper 在 macOS 上執行時,通常需要透過 PyTorch 框架轉譯,這往往無法完整釋放 Apple 晶片的 GPU 與 Neural Engine 算力。相比之下,mlx-whisper 具備以下核心優勢:
- 統一記憶體架構(Unified Memory)極致利用:mlx-whisper 能直接利用 Mac 的統一記憶體,無須在 CPU 與 GPU 之間進行繁重的資料複製(Zero-copy),顯著降低記憶體佔用與延遲。
- 轉錄速度提升 3 到 5 倍:在 M 系列晶片上執行
large-v3或distil-whisper模型時,mlx-whisper 的處理速度遠超越傳統 Python 實作。 - 完全本地端運行與隱私安全:所有音訊轉錄過程皆在您的 Mac 本機完成,敏感的會議紀錄或私人錄音絕不傳輸至雲端。
mlx-whisper 安裝與環境設定步驟
以下是在 macOS 上完整安裝與設定 mlx-whisper 的詳細步驟:
步驟一:安裝 Homebrew 套件管理器
Homebrew 是 macOS 上最推薦的套件管理工具,能簡化後續元件的安裝過程。
1. 打開 Mac 的「終端機」(Terminal)。
2. 輸入以下指令安裝 Homebrew:
/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)"
3. 安裝完成後,執行更新命令:
brew update
步驟二:安裝多媒體處理工具 FFmpeg
FFmpeg 是強大的多媒體處理工具,mlx-whisper 必須依賴它來處理解析各種格式的音訊與影片檔案(如 MP3, WAV, M4A, MP4 等)。
在終端機輸入以下指令安裝 FFmpeg:
brew install ffmpeg
步驟三:檢查與安裝 Python 環境
mlx-whisper 需要 Python 3.8 或更新版本。請先檢查您的 Python 版本:
1. 檢查系統中的 Python3:
python3 --version
2. 若版本過舊或未安裝,可使用 Homebrew 進行安裝:
brew install python
步驟四:透過 Pip 安裝 mlx-whisper
確認 Python 與 Pip 環境無誤後,即可直接透過 PyPI 安裝官方的 mlx-whisper 套件:
pip install mlx-whisper
如何使用 mlx-whisper 進行語音轉錄與字幕生成
安裝完成後,您可以在終端機中透過簡單的命令開始使用 mlx-whisper:
1. 基本轉錄指令
輸入以下指令即可對指定的音訊檔案進行轉錄:
mlx_whisper audio_file.mp3
預設情況下,mlx-whisper 會自動調用適合的模型,並在當前目錄生成包含逐字稿的文字檔案。
2. 指定輸出格式與進階模型
您可以使用 -f 參數指定輸出格式(例如 srt, vtt, txt, json),並使用 --model 指定特定的 Whisper 模型:
mlx_whisper audio_file.mp3 -f srt --model mlx-community/whisper-large-v3-mlx
這將生成帶有時間軸的 SRT 字幕檔,極適合影音創作者製作影片字幕。
mlx-whisper 模型選擇與進階效能調優
為了在轉錄速度與準確率之間取得最佳平衡,建議根據您的 Mac 硬體規格選擇適合的 mlx-whisper 模型:
- tiny / base / small 模型:適合硬體資源有限(如 8GB RAM)或追求極致轉錄速度的日常筆記情境。
- medium / large-v3 模型:針對多國語言(含繁體中文、粵語、英語混合)及專有名詞識別有極高準確率,建議具備 16GB 或更高記憶體的 Mac 使用。
- distil-whisper 模型:經過蒸餾優化的輕量化模型,能以極小的算力負擔提供接近 large 模型等級的識別率。
使用 mlx-whisper 的注意事項與常見問題
1. 確保環境變數正確:mlx-whisper 必須依賴 FFmpeg 載入音訊,安裝後請確保 FFmpeg 已正確加入 PATH 系統路徑中。
2. 廣泛的格式支援度:得益於 FFmpeg,mlx-whisper 支援直接輸入 MP3, AAC, FLAC, WAV, MP4, MOV 等幾乎所有常見影音格式。
3. 首次執行說明:首次使用特定模型時,mlx-whisper 會自動從 Hugging Face 下載相應的模型權重,下載時間視網路速度而定。
透過上述步驟,您就能在 macOS 上全面發揮 Apple Silicon 的硬體潛能,運用 mlx-whisper 打造流暢且專業的語音轉文字工作流!



