コンテンツにスキップ

ローカルWhisperに必要なマシンスペック

Reki noteのローカルWhisperは、お使いのPCの中だけで文字起こしを実行します。ここでは、どのくらいのPCスペックがあれば快適に動くかの目安と、モデルごとの違いをまとめています。

最終更新日:2026年9月30日

ローカルWhisperは、OpenAIの文字起こしモデル「Whisper」を、クラウドではなくお使いのPCの中で実行する方式です。Reki noteは whisper.cpp 系のランタイムを内蔵しており、音声・文字起こしが外部に送信されません。

処理はすべてPCのCPUまたはGPUで行われるため、マシンの性能が文字起こしの速さと使えるモデルの大きさを左右します。

以下は、ローカルWhisperを実用的な速さで動かすための目安です。GPUは必須ではなく、CPUだけでもモデルを選べば十分に使えます。

  • メモリ(RAM):最低8GB、推奨16GB。実行時に使うのはおおむね2〜4GB程度ですが、8GBの場合は空きを3〜4GB確保したいところです。

  • CPU:現代的で4コア以上を推奨。AVX2に対応したCPUだと安定して速くなります。

  • GPU:必須ではありません。NVIDIAの6〜8GB VRAMがあるとより大きなモデルを高速に処理できます。Apple Silicon(Mシリーズ)の内蔵GPUにも対応しています。

  • ストレージ:ダウンロードしたモデルを保存する空き容量。モデルは約77MB〜3.1GBです。

モデル別のサイズと必要スペック

Section titled “モデル別のサイズと必要スペック”

Whisperにはモデルの大きさの違いがあり、大きいほど高精度ですが、その分だけファイルサイズ・メモリ・処理時間が増えます。Reki noteで選べるおもなモデルは次のとおりです。

  1. tiny(約77MB):最も軽く最速。精度は低め。VRAM目安は約1GB。
  2. base(約148MB):速度と精度のバランスが良い。VRAM目安は約1GB。
  3. small(約488MB):精度が上がる。VRAM目安は約2GB。
  4. medium(約1.5GB):高精度。VRAM目安は約5GB。
  5. large-v3-turbo(約1.6GB):速くて高精度。VRAM目安は約6GB。
  6. large-v3-turbo-q5_0(約574MB):軽量に量子化した高速・高精度モデル。VRAM目安は約3GB。
  7. large-v3(約3.1GB):最も高精度。VRAM目安は約10GB。CPUのみでは遅くなりがちです。

whisper.cpp のモデル一覧

GPUがない・メモリが8GB程度のPCでは、large-v3-turbo-q5_0 か small が扱いやすい選択です。量子化されたモデル(q5_0)はメモリと読み込み時間を抑えられ、精度の差は通常ほとんど気になりません。

メモリが16GB以上あり、快適さを優先する場合は large-v3-turbo を使ってみてください。会議の文字起こしサンプルで一度試し、動作が重いと感じたら一段小さいモデルに切り替えるのがおすすめです。

自分のPCで動くか確認したいとき

Section titled “自分のPCで動くか確認したいとき”

推奨スペックは目安であり、実際の速さはCPU・GPU・OS・モデルによって変わります。最終的には、ご自身のPCのスペックをAIチャットに伝えて確認するのが手軽で確実です。

  1. PCのスペックを確認します。macOSはアップルメニューの「このMacについて」、Windowsは「設定」→「システム」→「バージョン情報」で確認できます。
  2. 分かった情報(OS・CPU・メモリ・GPU)をChatGPTやClaude、GeminiなどのAIチャットに貼り付けます。
  3. 「このPCでwhisper.cppのlarge-v3-turboは実用的な速さで動作しますか?CPUのみ/GPUありの両方で教えてください」のように質問します。
  4. 厳しそうと言われたら、small や large-v3-turbo-q5_0 など軽いモデルに切り替えてください。

より詳しい情報は、次の公式リポジトリでも確認できます。

whisper.cpp(GitHub)

openai/whisper(GitHub)