音声をテキストに変換する最も速い方法は、TranscribeNextのようなAI文字起こしサービスに録音をアップロードすることです。MP3、WAV、M4A、MP4など対応形式のファイルをアップロードすれば、文字起こしは自動的に生成されます。1時間の録音は通常数分で完成しますが、手動での文字起こしは一般的に3〜6時間かかります。下のボックスにファイルをドロップして今すぐ試してみましょう。アカウント登録なしで無料の5分間プレビューを利用できます。
文字起こしガイド・2026年7月更新・読了目安8分
音声をテキストに変換する方法:簡単な5つの方法
録音をアップロードするだけで、数分で正確な文字起こしが手に入ります。あわせて、Word、Windowsの音声入力、オフラインのWhisperのほうが適しているケースも紹介します。
無料プレビューでは最初の5分間をその場で文字起こしします。クレジットカードは不要です。その後サインインすると、全文の文字起こし、話者ラベル、エクスポートが利用できます。
簡単な答え:音声をテキストに変換するには、録音をAI文字起こしツールにアップロードし、言語を自動検出させてから文字起こしを開始します。聞き取りにくい箇所は音声を確認しながら生成されたテキストを見直し、話者名を変更し、最終的な文字起こしをTXT、DOCX、PDF、SRT、VTT、JSONのいずれかでダウンロードします。
開示事項:TranscribeNextは弊社の文字起こしサービスです。本ガイドでは、Microsoft Word、Windowsの音声入力、Audacity、あるいは手動での文字起こしのほうが適している場合についても説明します。
音声をテキストに変換する5つのステップ
音声をテキストに変換するには、TranscribeNextなどのAI文字起こしサービスに録音をアップロードし、言語を自動検出させ、生成されたテキストを確認したうえで、最終的な文字起こしをエクスポートします。
- 録音を準備する。元の音声・動画ファイルを見つけ、利用可能な中で最も高品質なバージョンを使用します。繰り返し変換や圧縮を行うのは避けましょう。MP3、WAV、M4A、MP4、FLAC、AAC、OGG、MOV、AVI、MKV、WebMなどの一般的な形式はそのままアップロードできます。
- 音声をアップロードする。上のボックスにファイルをドロップするか、デバイスから選択します。動画の録画は、事前に音声を抽出しなくてもそのままアップロードできます。
- 言語を確認する。自動検出でほとんどの録音に対応できますが、サインイン済みのアカウントでは言語を手動で設定したり、インタビューや会議、ポッドキャストなどで話者検出を有効にしたりすることもできます。
- 文字起こしを生成して確認する。AIが録音を処理するのを待ち、人名や数字、専門用語、引用、背景音や発言の重複の影響を受けた箇所を確認します。
- 編集してエクスポートする。話者名を変更し、不確かな単語を修正したうえで、用途に応じた形式を選びます。編集にはDOCX、共有にはPDF、プレーンテキストにはTXT、字幕にはSRTまたはVTT、ソフトウェア連携にはJSONが適しています。
TranscribeNextは音声・動画のアップロード、話者ラベル、タイムスタンプ、100以上の言語に対応し、TXT、DOCX、PDF、SRT、VTT、JSONへのエクスポートが可能です。Businessプランでは最大8時間、5 GBまでの録音を扱えます。
音声をテキストに変換する最も速い方法は?
音声をテキストに変換する最も速い方法はAI文字起こしです。手作業で入力するよりもはるかに速く録音を処理できます。1時間の音声を手動で文字起こしすると一般的に3〜6時間かかるため、自動処理はおおよそ一桁速いといえます。
| 方法 | 最適な用途 | 主な制限 |
|---|---|---|
| AI文字起こしサービス | ほとんどの会議、インタビュー、講義、ポッドキャスト、動画 | 校正が必要 |
| Microsoft Word Transcribe | WordでMicrosoft 365を使うユーザー | アップロード形式が少ない。音声はOneDriveに保存される |
| Windowsの音声入力 | テキストフィールドへのリアルタイム音声入力 | 事前録音したファイルはアップロードできない |
| オフラインWhisper(Audacity / Mac) | 機密ファイルや無制限のローカル処理 | インストールとモデルのダウンロードが必要。速度はハードウェア次第 |
| 手動での文字起こし | 短時間で機密性が高い、または聞き取りが難しい録音 | 遅い(音声1時間あたり3〜6時間) |
| プロの人力サービス | 出版、法的レビュー、専門用語を含む内容 | コストが高く、納期は数時間〜数日 |
方法1:TranscribeNextで音声をテキストに変換する
TranscribeNextを使えば、5つのステップで音声をテキストに変換し、TXT、DOCX、PDF、SRT、VTT、JSONの6形式で結果をエクスポートできます。
- このページ上部のボックスにファイルをドロップします(またはTranscribeNext.comを開きます)。
- 音声または動画ファイルをアップロードします。Businessプランでは最大8時間、5 GBまで対応しています。
- 話されている言語を自動検出させるか、サインイン済みであれば手動で設定します。
- 複数人が話す録音では話者検出をオンにします。
- 文字起こしを確認・編集し、エクスポートします。
TranscribeNextは、単なるプレーンテキストの塊以上のものが必要なときに真価を発揮します。エディターはテキストとタイムスタンプを連携させ、話者を分離し、要約やアクションアイテム、会議メモ、重要な引用を生成できます。内部で動いているのはOpenAI WhisperとNVIDIA Parakeet — Whisperベースのツールが使うのと同じエンジンです — つまり精度はマーケティングではなくモデルそのものに由来します。無料プランはクレジットカード不要で利用でき、有料プランを選ぶ前に、自分の録音でワークフローと精度を試すことができます。
方法2:Microsoft Wordで音声をテキストに変換する
Microsoft Wordは、ホーム → ディクテーション → 文字起こしから、アップロードされたWAV、MP4、M4A、MP3の4形式を文字起こしできます。Microsoft 365にサインインしてWordを開き、「文字起こし」を選択してファイルをアップロードし、文字起こしが完了するのを待ってから、文書に挿入します。
WordはアップロードされたファイルをOneDrive内の「文字起こしされたファイル」フォルダに保存し、会話を話者1、話者2……のように分割できます。Microsoftによれば、処理には音声ファイルとほぼ同じ長さの時間がかかる場合があるとのことです。すでにMicrosoft 365を利用しており、テキストを文書内に取り込みたい場合にはWordが便利ですが、対応フォーマットの多さ、処理の速さ、字幕、AI要約、チーム共有、より長い録音への対応が必要な場合は、専用プラットフォームのほうが適していることが多いです。
方法3:Windowsでリアルタイムの音声をテキストに変換する
Windowsの音声入力は、1つのショートカットでリアルタイムの音声をテキストに変換します。テキストフィールドにカーソルがある状態でWindows + Hを押してから話すだけです。これはリアルタイムのディクテーション用であり、保存済みのインタビューや会議、講義をアップロードするためのものではありません。事前に録音したファイルを処理するには、TranscribeNext、Microsoft Word Transcribe、またはWhisperを使ったAudacityを利用してください。
方法4:無料でオフラインで音声をテキストに変換する
Audacityは公式のWhisperプラグインを使えば、録音をアップロードしたりクラウドの分数制限に達したりすることなく、ローカルで音声を文字起こしできます。Audacityと各種AIプラグインをインストールし、ファイルを取り込み、「解析」メニューを開いてWhisperの文字起こしを実行したら、ラベルトラックを字幕またはテキストファイルとしてエクスポートします。これは機密性の高い録音、無制限の個人利用の文字起こし、インターネットに接続できない状況に適しています。処理速度は使用するコンピューターと選んだモデルによって変わります。
OpenAIは、教師あり方式で収集された680,000時間におよぶ多言語・マルチタスクの音声データで学習させた多言語音声認識システムとしてWhisperを開発しました。そのため、さまざまなアクセント、背景音、言語、専門的な話し方にもうまく対応できます。ただし、どの文字起こしも見直しは必要です。
Macでプライベートに文字起こしする方法
TranscribeNext for Macは、もう一つのオフラインの選択肢です。このデスクトップアプリはシステム音声とマイク入力を録音し、WhisperまたはNVIDIA Parakeetをローカルで実行して話者を識別し、録音をサーバーに送信することなく会議メモを生成します。Apple Silicon、macOS 14.2以降、8 GB以上のRAMが必要です。モデルをダウンロードしておけば、録音、文字起こし、話者検出、ローカルでの要約はすべてインターネット接続なしで動作します。
方法5:手動で音声を文字起こしする方法
1時間の音声を手動で文字起こしすると、タイピング速度、音質、専門用語、アクセント、話者の人数によって、一般的に3〜6時間かかります。まず一度通して聞き、人名や用語のリストを作成し、ヘッドフォンとキーボードショートカット対応のプレーヤーを使い、10〜30秒単位で作業を進め、不明瞭な単語は推測せずに印をつけ、録音と照らし合わせて校正します。熟練した文字起こし担当者でも録音1時間あたりおよそ3〜4時間、初心者では6〜8時間かかることもあります。実用的なハイブリッド手法としては、AIで最初の下書きを作成し、人名、数字、引用、不明瞭な箇所を手動で確認するという方法があります。
音声文字起こしの精度を高める方法
精度を高めるには、処理の前後で次の7つの要素を最適化します。
- 元の録音を使う。ファイルを繰り返し変換したり圧縮したりするのは避けます。
- 背景音を減らす。扇風機や交通音、音楽、キーボードの音は、子音や短い単語をかき消してしまうことがあります。
- マイクを近くに置く。広い部屋で離れた場所にあるノートPCのマイクよりも、近くで録音したスマートフォンの音声のほうが明瞭です。
- 発言の重複を避ける。複数人が同時に話すと、話者検出と単語認識の精度が低下します。
- 正しい言語を選択する。短い録音や多言語が混在する録音では、言語を手動で選択すると誤検出を減らせます。
- 人名や専門用語を確認する。製品名、姓、略語、薬品名、専門用語は手動での確認が必要です。
- タイムスタンプから確認する。文脈だけで不確かなテキストを修正せず、元の音声を再生して確認しましょう。
どのAI文字起こしツールも100%正確だと見なすべきではありません。法律、医療、金融、学術、雇用、出版に関わる内容では、追加の確認が不可欠です。
文字起こしの精度を測定する方法
AI文字起こしの精度を測定するには、100語の基準サンプルと比較し、置換・削除・挿入から単語誤り率(WER)を計算します。
WER = (置換数+削除数+挿入数)÷ 基準となる単語数 × 100
例えば、確認済みの100語の文章に4語の置換、2語の欠落、1語の挿入があった場合、(4 + 2 + 1) ÷ 100 × 100 = 7%となり、単語正解率はおよそ93%です。代表的なテストとしては、クリアな箇所、ノイズの多い箇所、複数話者や専門用語を含む箇所の、少なくとも3つの区間を測定します。
精度はモデル自体の特性であるため、現在の多くのツールの背後にあるエンジンについて公表されているベンチマークを紹介します。ほとんどの文字起こしガイドが引用しない数値です。
| エンジン | 単語誤り率(WER) | ベンチマーク |
|---|---|---|
| OpenAI Whisper large-v3 | 2.5% | LibriSpeech test-clean(クリーンな英語) |
| Whisper medium | 2.9% | LibriSpeech test-clean |
| Whisper small | 3.4% | LibriSpeech test-clean |
| NVIDIA Parakeet TDT 0.6B v3 | 6.34% | Open ASR Leaderboard(25言語、多領域) |
これらのベンチマークは単純に比較できません。LibriSpeech test-cleanはクリアに朗読された英語である一方、Open ASR Leaderboardは25言語とより難易度の高い領域を含んでいます。背景音のある実際の音声はどちらよりもスコアが悪くなるため、校正は依然として重要です。
複数話者の音声を文字起こしする方法
2人以上の話者がいる音声では、処理前に話者検出を有効にし、確認の際にすべての話者の切り替わりを検証します。可能であれば別々のマイクやチャンネルを使用し、発言が重ならないよう参加者に依頼し、最初の数回の話者切り替わりを確認し、話者1・話者2のような汎用ラベルを実際の名前に変更したうえで、ラベルを含めて文字起こしをエクスポートします。話者の識別と単語の認識は別の指標です。文字起こしの単語自体は正しくても、誤った話者に割り当てられていることがあるため、両方を確認しましょう。
長時間の音声ファイルを文字起こしする方法
TranscribeNextはBusinessプランで最大8時間、5 GBまでの録音を処理できるため、ほとんどのインタビュー、講義、ポッドキャスト、ワークショップ、会議は事前に分割する必要がありません。制限内であれば元のファイルをそのままアップロードし、言語を確認し、話者検出を有効にして、大きな動画ファイルには追加の処理時間を見込んでください。ファイルを分割するのは、アップロード制限を超える場合や、明確に分かれたセッションを含む場合のみにし、文の途中ではなく自然な区切りでカットして、分割点の前後数秒分の文脈を残すようにします。
どの音声・動画フォーマットを文字起こしできますか?
一般的な音声・動画フォーマットは15種類以上アップロードでき、通常は動画から音声を事前に抽出する必要はありません。サービスがMP4、MOV、AVI、MKV、WebMファイル内の音声トラックを直接読み取ります。
| フォーマット | 種類 | 典型的な出所 |
|---|---|---|
| MP3 | 圧縮音声 | ポッドキャスト、ボイスレコーダー、ダウンロードファイル |
| WAV | 非圧縮音声 | 業務用レコーダー、スタジオ音声 |
| M4A | 圧縮音声 | iPhoneのボイスメモ、Appleデバイス |
| FLAC | 可逆圧縮音声 | 高品質なアーカイブや音楽 |
| AAC / OGG / Opus | 圧縮音声 | モバイル端末、ストリーミング、オープンソースアプリ |
| WMA | 音声 | 古いWindowsでの録音 |
| MP4 / MOV | 動画 | 会議、ウェビナー、iPhone、カメラ |
| AVI / MKV / WebM | 動画 | 古いカメラ、画面録画、ブラウザ動画 |
どの文字起こしフォーマットをダウンロードすべきですか?
次に行う作業に応じて、TXT、DOCX、PDF、SRT、VTT、JSONの6つの文字起こしフォーマットから1つを選びます。
| フォーマット | こんなときに選ぶ |
|---|---|
| TXT | プレーンテキストを他のアプリにコピーしたいとき |
| DOCX | Wordで編集・書式設定・共同作業をしたいとき |
| 編集不可の安定した文書として共有したいとき | |
| SRT | 動画にタイミング付きの字幕を追加したいとき |
| VTT | WebサイトやHTML5動画にキャプションを追加したいとき |
| JSON | タイムスタンプ、セグメント、話者データをソフトウェアに送りたいとき |
無料プランではTXTとJSONのエクスポート、または元の音声のダウンロードが可能です。PDF、DOCX、SRT、VTTは有料プランの機能です。文字起こしを複数の目的で使う場合は、複数の形式をダウンロードしましょう。例えば、編集用にDOCX、字幕付き動画用にSRTなどです。
動画から音声を文字起こしできますか?
できます。MP4、MOV、AVI、MKV、WebMのいずれかのファイルをアップロードすると、プラットフォームが音声を抽出し、文字起こしを生成し、タイムスタンプを追加し、字幕も作成できます。事前に音声を抽出する必要はありません。YouTubeなど対応プラットフォームの場合、動画をダウンロードせずにURLを貼り付けるだけで済むことがよくあります。処理するコンテンツの権利を保有しているか、処理する許可を得ていることを確認してください。
音声を無料でテキストに変換できますか?
できますが、無料の文字起こしには通常、最大分数、ファイルの長さ、アップロード回数、エクスポート制限、処理速度の低下、ローカルのハードウェア要件など、少なくとも1つの制限が伴います。手軽な無料の選択肢としては、オンライン文字起こしにはTranscribeNextの無料プラン、ローカルでの録音と文字起こしにはTranscribeNext for Mac、すでにMicrosoft 365を契約しているならMicrosoft Word、リアルタイムのディクテーションにはWindows + H、ローカルファイルにはWhisperプラグインを備えたAudacityが挙げられます。「無料」だからといって常に無制限だったり機密ファイルに安全とは限りません。アップロード制限、保存期間、エクスポート制限、音声がローカルで処理されるかサーバーに送信されるかを確認してください。
AIの文字起こしは校正すべきですか?
すべきです。録音がクリアに聞こえる場合でも、AIが生成した文字起こしは少なくとも一度は確認してください。特に、人名・社名、日付、価格、数量やパーセンテージ、引用、略語や専門用語、話者ラベル、発言の重複、無音・音楽・背景音のある箇所には注意を払いましょう。通常のメモであればざっと確認するだけで十分ですが、法的証拠、医療記録、公表される引用、学術研究、雇用に関わる判断、金融関連の指示については、重要な発言すべてを元の録音と照らし合わせて確認してください。
オンラインとオフライン、どちらの文字起こしが優れていますか?
オンラインの文字起こしは、速度、共有、他ツールとの連携、ブラウザからのアクセス、翻訳、エクスポートの面で優れていることが多く、チーム会議、ポッドキャスト、講義、検索可能なクラウドアーカイブに向いています。オフラインの文字起こしは、録音をデバイス内にとどめる必要がある場合やインターネット接続が不安定な場合に優れています。機密性の高い会議、センシティブな研究、出張中、セキュリティ施設内などです。多くの人にとって最適なワークフローはハイブリッド型です。日常的な録音はTranscribeNextのWebアプリで処理し、ローカルにとどめる必要がある録音にはTranscribeNext for MacやAudacityを使用します。
音声のテキスト変換を始める
最もシンプルなワークフローとしては、このページ上部のボックスに録音をドロップし、言語を検出させて、プレビューを確認してください。サインインすると、全文の文字起こしが解放され、話者名の変更やTXT、DOCX、PDF、SRT、VTT、JSONでのエクスポートが可能になります。Mac上でプライベートに処理したい録音には、TranscribeNext for Macをダウンロードし、クラウドにアップロードすることなくローカルで音声を処理してください。