Whisperとは?AI文字起こし入門
Whisperとは?基本概念をわかりやすく解説
Whisperとは、OpenAIが開発した自動音声認識(ASR)システムです。 音声データをテキストに変換する技術で、2022年9月に公開されました。
最大の特徴は、68万時間という膨大な音声データで学習している点です。 これは、アルバイトが24時間働き続けて約77年かかる分量に相当します。 その規模のおかげで、日本語を含む99言語に対応し、アクセントや背景ノイズにも強くなっています。
Whisperはオープンソースとして公開されており、無料でダウンロードして使えます。 MITライセンスのため、商用利用も可能です。 OpenAIのAPIを通じて使う方法と、自分のパソコンで直接動かす方法の2択があります。
たとえば、1時間の会議音声を渡すと、数分以内にほぼ正確な議事録テキストが出力されます。 以前は専門の文字起こしサービスに依頼していた作業が、自動化できるようになりました。
Whisperでできること|主要機能を徹底解説
機能①:多言語音声の高精度文字起こし
99言語の音声をテキストに変換できます。 日本語の認識精度は特に高く、一般的な会話であれば精度95%以上を実現することも珍しくありません。
たとえば、インタビュー音声(約30分)を処理すると、固有名詞の誤認識は数か所程度というレポートが複数あります。 これまで手動で2〜3時間かかっていた作業が、数分で完了します。
機能②:音声から英語への翻訳
日本語や他言語の音声を、そのまま英語テキストに翻訳する機能があります。 文字起こしと翻訳を一度に行える点が他のツールと異なります。
たとえば、日本語で収録した動画を英語字幕付きで配信したいとき、Whisperに音声を渡すだけで英語テキストが得られます。 別途翻訳サービスを使う手間が省けます。
機能③:タイムスタンプ付き出力
発話のタイミングをミリ秒単位で記録したSRTファイル(字幕ファイル形式)を出力できます。 動画編集ソフトに直接読み込めるため、字幕制作の手間が大幅に減ります。
たとえば、YouTubeにアップロードする動画の字幕を作るとき、Whisperが出力したSRTファイルを動画編集ソフトに貼り付けるだけで完成します。 字幕のタイミング合わせ作業がゼロになります。
Whisperの使い方|初心者向けステップガイド
ステップ1:APIキーを取得する(API利用の場合)
OpenAI公式サイト(openai.com)にアクセスし、アカウントを作成します。 ダッシュボードから「API Keys」ページを開き、新しいキーを生成します。
💡 初心者向けTips APIキーは一度しか表示されません。必ずテキストファイルに保存してください。
ステップ2:環境を準備する
API利用の場合: OpenAIのAPIキーがあれば、追加インストールは不要です。ブラウザ上のPlaygroundからも試せます。
ローカル実行の場合: PythonとWhisperライブラリをインストールします。
pip install openai-whisper
コマンド1行で準備完了です。
💡 初心者向けTips Pythonの経験がない場合は、まずAPIを使うほうが手軽です。月に数時間程度の文字起こしなら料金も数百円以内に収まります。
ステップ3:音声ファイルを準備する
MP3・MP4・WAV・WEBMなど主要フォーマットに対応しています。 API利用の場合、1ファイルあたりの上限は25MBです。
💡 初心者向けTips 長い録音は分割ツール(例:Audacity)で25MB以下に分けてから処理するとスムーズです。
ステップ4:文字起こしを実行する
API(Python)の場合:
from openai import OpenAI
client = OpenAI()
with open("meeting.mp3", "rb") as audio_file:
transcript = client.audio.transcriptions.create(
model="whisper-1",
file=audio_file
)
print(transcript.text)
ローカル実行の場合:
whisper meeting.mp3 --language Japanese
コマンド1行で日本語の文字起こしが完了します。
💡 初心者向けTips
--language Japaneseを指定すると日本語認識の精度が上がります。省略すると自動検出しますが、精度がやや下がることがあります。
モデル・プラン別の選び方
| モデル/プラン | 料金 | 主な用途 | こんな人向け |
|---|---|---|---|
| Whisper API | $0.006/分(約¥0.9) | 手軽に試したい・少量利用 | プログラミング初心者・短時間利用 |
| ローカル small | 無料(要GPU) | 中精度・軽量・高速 | 精度より速さを優先したい人 |
| ローカル large-v3 | 無料(要10GB VRAM) | 最高精度・プロ用途 | 精度最優先・GPU環境がある人 |
| ローカル large-v3-turbo | 無料(要6GB VRAM) | 精度と速度のバランス | 普段使いのローカル運用に最適 |
2026年現在のおすすめ構成は?
ビジネス用途でたまに使うならWhisper APIが最も手軽です。 月に10時間の文字起こしをしても料金は約540円と、缶コーヒー5本分程度です。
毎日大量に使うならローカルのlarge-v3-turboが費用対効果最高です。 large-v3と比べて精度をほぼ維持しつつ、処理速度が約8倍になっています。
活用シーン|こんな場面で使える
シーン①:週次会議の議事録作成
⛔ Before:1時間の会議が終わるたびに、担当者が30〜60分かけて手動で議事録を作成していた。
✅ After:会議音声をWhisperに渡すと5分以内にテキスト化。確認・修正だけで議事録が完成する。
会議後すぐに議事録を共有できるようになり、意思決定のスピードが上がります。 たとえば、週5回の会議がある場合、月換算で約20〜40時間の削減につながります。
シーン②:YouTubeやPodcastの字幕・文字起こし
⛔ Before:動画の字幕を作るために、再生しながら手入力。1時間の動画に3〜4時間かかっていた。
✅ After:動画ファイルをWhisperに渡すとSRTファイルが生成される。タイムスタンプ付きで動画編集ソフトにそのまま使える。
字幕があると動画の視聴完了率が上がると言われています。 SEO効果も期待でき、検索流入が増えるという報告もあります。
シーン③:インタビュー・取材音声のテキスト化
⛔ Before:インタビュー音声を聴き返しながら手打ち。1時間分で2〜3時間の作業が必要だった。
✅ After:音声ファイルをWhisperで処理し、数分でテキスト化。誤認識箇所だけ修正すれば完成。
ライターやジャーナリストにとって、取材から記事化までの時間が大幅に短縮されます。 インタビュー対象者ごとに複数の音声ファイルがある場合でも、バッチ処理で一気に変換できます。
山梨 AIを仕事や地域活動で活かすには
山梨県内の企業、個人事業主、地域団体でも、今回のAIを日常業務に活用できます。
まずは文章の下書き、情報整理、資料作成など、小さな作業から試す方法がおすすめです。観光、農業、製造業、店舗運営など、それぞれの現場に合わせて使い方を調整しましょう。
AIの回答が常に正しいとは限りません。地域名、制度、料金、営業時間などは、公開前に人が確認することが大切です。
まとめ:Whisperを使うべき人・使わなくていい人
山梨 AI活用では、ツールの特徴を理解し、小さな業務から試すことが大切です。
Whisperを使うべき人は、会議録・動画字幕・インタビューテキスト化など、定期的に音声をテキストにしたいビジネスパーソンやクリエイターです。 特に月10時間以上の文字起こし作業がある方は、コスト削減効果が大きくなります。
ローカル実行がおすすめな人は、毎日大量に処理する方や、会話内容を外部サービスに送りたくない方です。 医療・法務など機密性の高い音声を扱う場合は、ローカル実行が安心です。
使わなくていい人は、文字起こしが月に数回以下で、スマホアプリ(Notta・Otter.aiなど)で十分な方です。 GUIで直感的に使えるサービスのほうが、セットアップの手間がなく使いやすい場合もあります。
Whisperは無料から始められるので、まずAPIで1ファイル試してみるのが一番の近道です。
情報は 2026-05-25 時点のものです。 参照: https://openai.com/index/whisper/