← ブログ一覧へ戻る
ブログ

Whisperとは?AI文字起こし入門

Whisperとは?基本概念をわかりやすく解説

Whisperとは、OpenAIが開発した自動音声認識(ASR)システムです。 音声データをテキストに変換する技術で、2022年9月に公開されました。

最大の特徴は、68万時間という膨大な音声データで学習している点です。 これは、アルバイトが24時間働き続けて約77年かかる分量に相当します。 その規模のおかげで、日本語を含む99言語に対応し、アクセントや背景ノイズにも強くなっています。

Whisperはオープンソースとして公開されており、無料でダウンロードして使えます。 MITライセンスのため、商用利用も可能です。 OpenAIのAPIを通じて使う方法と、自分のパソコンで直接動かす方法の2択があります。

たとえば、1時間の会議音声を渡すと、数分以内にほぼ正確な議事録テキストが出力されます。 以前は専門の文字起こしサービスに依頼していた作業が、自動化できるようになりました。

Whisperでできること|主要機能を徹底解説

機能①:多言語音声の高精度文字起こし

99言語の音声をテキストに変換できます。 日本語の認識精度は特に高く、一般的な会話であれば精度95%以上を実現することも珍しくありません。

たとえば、インタビュー音声(約30分)を処理すると、固有名詞の誤認識は数か所程度というレポートが複数あります。 これまで手動で2〜3時間かかっていた作業が、数分で完了します。

機能②:音声から英語への翻訳

日本語や他言語の音声を、そのまま英語テキストに翻訳する機能があります。 文字起こしと翻訳を一度に行える点が他のツールと異なります。

たとえば、日本語で収録した動画を英語字幕付きで配信したいとき、Whisperに音声を渡すだけで英語テキストが得られます。 別途翻訳サービスを使う手間が省けます。

機能③:タイムスタンプ付き出力

発話のタイミングをミリ秒単位で記録したSRTファイル(字幕ファイル形式)を出力できます。 動画編集ソフトに直接読み込めるため、字幕制作の手間が大幅に減ります。

たとえば、YouTubeにアップロードする動画の字幕を作るとき、Whisperが出力したSRTファイルを動画編集ソフトに貼り付けるだけで完成します。 字幕のタイミング合わせ作業がゼロになります。

Whisperの使い方|初心者向けステップガイド

ステップ1:APIキーを取得する(API利用の場合)

OpenAI公式サイト(openai.com)にアクセスし、アカウントを作成します。 ダッシュボードから「API Keys」ページを開き、新しいキーを生成します。

💡 初心者向けTips APIキーは一度しか表示されません。必ずテキストファイルに保存してください。

ステップ2:環境を準備する

API利用の場合: OpenAIのAPIキーがあれば、追加インストールは不要です。ブラウザ上のPlaygroundからも試せます。

ローカル実行の場合: PythonとWhisperライブラリをインストールします。

pip install openai-whisper

コマンド1行で準備完了です。

💡 初心者向けTips Pythonの経験がない場合は、まずAPIを使うほうが手軽です。月に数時間程度の文字起こしなら料金も数百円以内に収まります。

ステップ3:音声ファイルを準備する

MP3・MP4・WAV・WEBMなど主要フォーマットに対応しています。 API利用の場合、1ファイルあたりの上限は25MBです。

💡 初心者向けTips 長い録音は分割ツール(例:Audacity)で25MB以下に分けてから処理するとスムーズです。

ステップ4:文字起こしを実行する

API(Python)の場合:

from openai import OpenAI
client = OpenAI()

with open("meeting.mp3", "rb") as audio_file:
    transcript = client.audio.transcriptions.create(
        model="whisper-1",
        file=audio_file
    )
print(transcript.text)

ローカル実行の場合:

whisper meeting.mp3 --language Japanese

コマンド1行で日本語の文字起こしが完了します。

💡 初心者向けTips --language Japanese を指定すると日本語認識の精度が上がります。省略すると自動検出しますが、精度がやや下がることがあります。

モデル・プラン別の選び方

モデル/プラン料金主な用途こんな人向け
Whisper API$0.006/分(約¥0.9)手軽に試したい・少量利用プログラミング初心者・短時間利用
ローカル small無料(要GPU)中精度・軽量・高速精度より速さを優先したい人
ローカル large-v3無料(要10GB VRAM)最高精度・プロ用途精度最優先・GPU環境がある人
ローカル large-v3-turbo無料(要6GB VRAM)精度と速度のバランス普段使いのローカル運用に最適

2026年現在のおすすめ構成は?

ビジネス用途でたまに使うならWhisper APIが最も手軽です。 月に10時間の文字起こしをしても料金は約540円と、缶コーヒー5本分程度です。

毎日大量に使うならローカルのlarge-v3-turboが費用対効果最高です。 large-v3と比べて精度をほぼ維持しつつ、処理速度が約8倍になっています。

活用シーン|こんな場面で使える

シーン①:週次会議の議事録作成

⛔ Before:1時間の会議が終わるたびに、担当者が30〜60分かけて手動で議事録を作成していた。
✅ After:会議音声をWhisperに渡すと5分以内にテキスト化。確認・修正だけで議事録が完成する。

会議後すぐに議事録を共有できるようになり、意思決定のスピードが上がります。 たとえば、週5回の会議がある場合、月換算で約20〜40時間の削減につながります。

シーン②:YouTubeやPodcastの字幕・文字起こし

⛔ Before:動画の字幕を作るために、再生しながら手入力。1時間の動画に3〜4時間かかっていた。
✅ After:動画ファイルをWhisperに渡すとSRTファイルが生成される。タイムスタンプ付きで動画編集ソフトにそのまま使える。

字幕があると動画の視聴完了率が上がると言われています。 SEO効果も期待でき、検索流入が増えるという報告もあります。

シーン③:インタビュー・取材音声のテキスト化

⛔ Before:インタビュー音声を聴き返しながら手打ち。1時間分で2〜3時間の作業が必要だった。
✅ After:音声ファイルをWhisperで処理し、数分でテキスト化。誤認識箇所だけ修正すれば完成。

ライターやジャーナリストにとって、取材から記事化までの時間が大幅に短縮されます。 インタビュー対象者ごとに複数の音声ファイルがある場合でも、バッチ処理で一気に変換できます。

山梨 AIを仕事や地域活動で活かすには

山梨県内の企業、個人事業主、地域団体でも、今回のAIを日常業務に活用できます。

まずは文章の下書き、情報整理、資料作成など、小さな作業から試す方法がおすすめです。観光、農業、製造業、店舗運営など、それぞれの現場に合わせて使い方を調整しましょう。

AIの回答が常に正しいとは限りません。地域名、制度、料金、営業時間などは、公開前に人が確認することが大切です。

まとめ:Whisperを使うべき人・使わなくていい人

山梨 AI活用では、ツールの特徴を理解し、小さな業務から試すことが大切です。

Whisperを使うべき人は、会議録・動画字幕・インタビューテキスト化など、定期的に音声をテキストにしたいビジネスパーソンやクリエイターです。 特に月10時間以上の文字起こし作業がある方は、コスト削減効果が大きくなります。

ローカル実行がおすすめな人は、毎日大量に処理する方や、会話内容を外部サービスに送りたくない方です。 医療・法務など機密性の高い音声を扱う場合は、ローカル実行が安心です。

使わなくていい人は、文字起こしが月に数回以下で、スマホアプリ(Notta・Otter.aiなど)で十分な方です。 GUIで直感的に使えるサービスのほうが、セットアップの手間がなく使いやすい場合もあります。

Whisperは無料から始められるので、まずAPIで1ファイル試してみるのが一番の近道です。

情報は 2026-05-25 時点のものです。 参照: https://openai.com/index/whisper/