TranscribeNext.comTranscribeNext.com
BlogReview

2026年 文字起こしソフト比較:12のサービスを実際に試しました

👨‍💻

TranscribeNext Team

読了時間 14分
softwarereviewcomparison2026audio-to-textAI transcription

2026年に音声をテキスト化するソフトAI文字起こしツールを探すと、選択肢は山ほど見つかります。どの「おすすめ比較」も精度99%をうたいますが、現実の雑然とした音声で何が起きるかを見せているものはほとんどありません。

Free

先月、見つけられる限りの主要サービスを試すのに347ドルと23時間を使いました。明らかに使ったことのない人が書いた比較記事に、うんざりしていたのです。

テストファイルは全社共通です。45分のポッドキャスト取材で、強い訛り、カフェの背景雑音、KubernetesやAPIエンドポイントといった専門用語つき。どのサービスにも同じファイルを渡しました。

精度99%をうたうものも、「AIによる魔法」のような言葉を並べるものもありました。大半は宣伝に届きませんでした。

この記事の内容

要約:30秒で分かる結論

時間がない方へ、まとめだけ先に。

  • 総合で最良: TranscribeNext。精度89%、1分0.15ドル、今回の検証で最速。
  • リアルタイム会議: Otter.ai。Zoom/Meetに組み込め、話者ラベルの扱いが良好。
  • 精度が最優先: Rev Human。精度96%だが納期18時間、1分1.50ドル。
  • 動画制作者: Descript。テキストを編集すると動画が編集される仕組み。突飛ですが、よく機能します。
  • 開発者: AssemblyAI。APIが素直でドキュメントも良く、感情分析やPII検出などの追加機能つき。
  • 以降では、なぜこれらが勝ったのか、そしてそれぞれがどこで崩れるのかを説明します。

    この記事が役立つ人

    現実の音声を実際に抱えている人のために書きました。

  • 何時間ものインタビューがハードディスクに眠っている記者や研究者
  • 番組ノートや字幕のために書き起こしが要るポッドキャスターやYouTuber
  • 顧客との通話を録音するコンサルタントやコーチ
  • 音声認識を組み込むアプリを作る開発者
  • 呼び方が文字起こしソフトでも、音声テキスト化アプリでも、音声認識ツールでも構いません。この記事は、現実の録音で使える選択肢に絞っています。当てはまる方なら、無駄な出費と手間をいくらか減らせるはずです。

    検証の方法

    テストファイル:

  • ソフトウェアエンジニアへの45分のインタビュー
  • インド訛り、早口(毎分約180語)
  • カフェで録音、背景でエスプレッソマシンが稼働
  • 専門用語が多数:Kubernetes、PostgreSQL、APIエンドポイント
  • MP3、128kbps
  • 測定した項目:

  • 精度(誤りを手で数えました。途方もない時間がかかりました)
  • 処理時間
  • 事前に明示されない費用まで含めた総額
  • 誤りの直しやすさ
  • 書き出し形式
  • 質問したときのサポートの反応速度
  • 費用はすべて自費です。アフィリエイトも提供も受けていません。

    比較表

    以下の数値はすべて同じテストファイルによるものです。同じ訛り、同じ背景雑音、同じ専門用語。条件は揃えてあります。

    サービス 精度 費用(45分) 処理時間 向いている用途
    TranscribeNext 89% $6.75 8分 汎用、多言語
    Rev AI 87% $11.25 15分 高い精度が必要な場合
    AssemblyAI 86% $9.00 7分 開発者、API連携
    Sonix 85% $15.00 11分 多言語
    Otter.ai 84% $8.33 12分 リアルタイム会議、共同作業
    Descript 82% $12/月 10分 動画編集の流れ
    Trint 81% $20.00 14分 報道機関、記者
    Happy Scribe 80% $17.00 13分 字幕、動画コンテンツ

    *Rev Human(AIではなく実際の人)は精度96%でしたが、費用67.50ドル、所要18時間でした。*

    法外な出費なしにまともな精度が欲しいなら、今回のファイルではTranscribeNext、Rev AI、AssemblyAIが前に出ました。

    各サービスの詳細

    1. TranscribeNext — 費用対効果で最良

    良かった点:

  • 価格に対する精度が最も高い。難しいテストファイルで89%。
  • 処理が最速。45分の音声を8分で。
  • エディタが素直。タイムスタンプがクリック可能で、移動と修正がしやすい。
  • 50以上の言語に対応。英語以外でも追加料金なし。
  • TXT、DOCX、PDF、SRT、VTTに書き出し可能。
  • 惜しい点:

  • リアルタイム文字起こしがない。ファイルをアップロードして待つ方式です(処理自体は速い)。
  • 話者ラベルは手直しが要ることがある。
  • モバイルアプリがない。
  • 検証結果:

  • 総語数:8,234
  • 誤り:905
  • 精度:89.01%
  • よくある誤り:専門用語(Kubernetesが「communities」に)、早口の区間
  • 価格:

  • 無料:月30分
  • 従量課金:1分0.15ドル。45分のファイルで6.75ドル。
  • サブスクリプション不要。
  • 隠れコスト:なし。探しました。
  • 向いている人: フリーランス、研究者、ポッドキャスター。難しく考えずにまともな精度が欲しい人。

    所感: 現在、自分の仕事にはこれを使っています。価格と精度の比は簡単には超えられません。

    2. Otter.ai — リアルタイム会議に最適

    予定表がZoomとMeetで埋まっているなら、Otterは向いています。会議に組み込まれ、その場で文字起こしします。

    良かった点:

  • リアルタイムの文字起こしが追随する。字幕が速く出て、一文まるごと遅れることがない。
  • 話者検出が良い。今回のファイルでも、多くのサービスより話者をうまく分けました。
  • モバイルアプリがよくできている。スマホで録音すればアカウントに同期されます。
  • 検索できるアーカイブ。過去の会議が探せるようになり、音声ファイルを漁らずに済みます。
  • 惜しい点:

  • 難しい音声では精度が落ちる。カフェのファイルで84%。使えますが、良くはありません。
  • 専門用語で混乱する。Kubernetesは独創的な何かに、APIエンドポイントも別の何かになりました。
  • 無料プランの上限にすぐ当たる。月300分は十分に聞こえますが、1件あたり30分の上限があります。
  • 検証結果(他社と同じファイル):

  • 精度:84.12%
  • 苦手:早口、開発の専門用語
  • 得意:話者ラベル、タイムスタンプの正確さ
  • 価格:

  • 無料:月300分、1件あたり最大30分
  • Pro:月10ドル前後、1,200分、書き出しが充実
  • 45分のファイル:Proで約8.33ドル
  • 隠れコスト:有用な書き出し機能の多くは有料プラン限定
  • 向いている人: 一日中ビデオ通話をしていて、手動アップロードなしに検索できるメモが欲しい人。

    所感: リアルタイム会議ならOtterは機能します。Zoom中心の働き方に馴染み、話者ラベルもうまく扱います。録音済みのポッドキャストや雑音の多い取材には、より良い選択肢があります。

    3. Rev AI — 価格より精度を優先するとき

    Revは長年この分野にいます。AIモデルにもその経験が表れており、難しいファイルを多くのサービスより上手に処理しました。

    良かった点:

  • AIとして2位の精度(87%)。人が書き起こした音声で長年学習してきた蓄積が出ています。
  • 人によるレビューに切り替えられる。重要なファイルはサービスを変えずに人へ回せます。
  • APIとドキュメントが良い。何かを作るなら開発体験は堅実です。
  • タイムスタンプが正確。多くのサービスより精密で、引用に使えます。
  • 惜しい点:

  • 高い。1分0.25ドルは、同程度の精度のTranscribeNextのほぼ2倍です。
  • 今回で最も遅い処理。他社が7〜8分のところ15分。
  • Webの画面が古い。動きますが、美しくはありません。
  • エディタが内蔵されていない。テキストが返るだけなので、修正は自前の道具で。
  • 検証結果(他社と同じファイル):

  • 精度:87.34%
  • 得意:技術語彙(Kubernetes、PostgreSQL)。学習データが良いのだと思われます。
  • 苦手:強い訛り、早口
  • 価格:

  • AI文字起こし:1分0.25ドル=45分で11.25ドル
  • 人力:1分1.50ドル=67.50ドル(ただし精度96%、18時間待ち)
  • 隠れコスト:プランに入っていないと編集ツールが別料金
  • 向いている人: 法務、医療、学術。数パーセントの精度差が倍の出費を正当化する場面。

    所感: その数パーセントが必要で、支払えるならRevは応えます。日常業務には、小さな差に多く払うことになります。

    4. Descript — 動画制作者に最適(それ以外には過剰)

    Descriptは、たまたま文字起こしも含んでいる動画編集スイートです。すでに動画を編集しているなら最適ですが、書き起こしだけが欲しいなら、ドライバー1本で足りるところに工具箱一式を買うことになります。

    良かった点:

  • テキストを編集すると動画が編集される。一文を選んで削除すると、動画側も切れます。初めて試したとき、しばらく画面を眺めていました。
  • Overdubで自分の声を複製できる。言い間違いを録り直さずに直せます。奇妙な機能ですが、驚くほどうまく動きます。
  • 一箇所に揃っている。画面収録、編集、文字起こし、字幕。
  • 共同作業ができる。複数人が同じプロジェクトを編集できます。
  • 惜しい点:

  • 文字起こしの精度は主眼ではない。82%で、専用ツールの多くに及びませんでした。
  • 習得に数時間かかる。強力ですが、直感的ではありません。
  • サブスクのみ。従量課金はなく、月1回でも毎日でも月12ドルです。
  • 書き起こしだけが目的なら、機能の9割は無関係です。
  • 検証結果(他社と同じファイル):

  • 精度:82.16%
  • 苦手:背景雑音、発言の重なり
  • 話者ラベルは他社より手直しが必要でした
  • 価格:

  • 無料:月1時間(試すには十分)
  • Creator:月12ドル、文字起こし無制限
  • 45分のファイル:「込み」ですが、使わなくても月12ドルは発生します
  • 隠れコスト:文字起こしだけで足りる場合でも、動画スイート一式に払うことになります
  • 向いている人: YouTuber、動画ポッドキャスター、講座制作者。動画を編集していて、文字起こしも内蔵で欲しい人。

    所感: 動画制作をしているならDescriptは筋が通ります。音声だけの文字起こしには、道具として大きすぎます。

    5. AssemblyAI — 開発者に最適

    良かった点:

  • APIとドキュメントが良い。読んでいて物を投げたくならない種類のものです。
  • AIの追加機能。感情分析、話題検出、個人情報の伏字。必要なら有用です。
  • 精度86%。今回3位。
  • 処理7分。最速の部類。
  • 惜しい点:

  • Web画面がない。APIのみ。コードを書けないなら向きません。
  • 従量課金のみ。サブスクの選択肢はありません。
  • 検証結果:

  • 精度:86.22%
  • 処理:7分
  • APIは安定。タイムアウトも妙なエラーもありませんでした。
  • 価格:

  • 基本の文字起こし:1分0.20ドル=45分で9.00ドル
  • 追加機能(感情、話題):各+1分0.04ドル
  • 隠れコスト:画面は自分で作る必要があります
  • 向いている人: 音声認識を組み込むアプリを作る開発者。自動化された処理、大量の一括処理。

    所感: コードを書いていて文字起こしを組み込むなら、これはよく機能します。書かないなら、他を見てください。

    精度の実態

    どの文字起こしサービスも、トップページでは精度99%をうたいます。

    その数字は実験条件でしか存在しません。話者1人、スタジオ用マイク、雑音なし、標準的なアメリカ英語。現実の音声を入れた瞬間に数字は落ちます。音声認識のベンチマークに関する独立した研究でも、実環境の性能が宣伝値よりはるかに低いことが一貫して示されています。

    精度に影響するもの:

  • 音質。スタジオ用マイクか、カフェでのスマホか(きれいな音声にしたいならShureの録音のヒントが出発点として役立ちます)。
  • 訛りと話す速さ。
  • 専門的、あるいは珍しい語彙。
  • 背景雑音。
  • 複数の話者が重なって話すこと。
  • AIの精度を85〜90%以上に近づけたいなら、まず録音そのものを直してください。具体的な手順は音声ファイルを素早く文字起こしする方法で解説しています。

    難しいが現実的なファイルでの結果:

  • AIの最高:89%(TranscribeNext)
  • AIの最低:78%(名前は伏せます)
  • 人力の最高:96%(Rev Human)
  • 精度89%は実感としてどうか。

    45分のインタビューは約8,000語でした。精度89%なら、細かな誤りが約900か所。氏名の綴り間違い、壊れた専門用語、ところどころの脱落です。

    修正には20〜25分の編集を要しました。

    アップロードからきれいな書き起こしまでの合計:

  • 処理待ち8分
  • 誤りの修正25分
  • 合計およそ33分
  • 自分で打つ場合の4〜6時間と比べれば、荒いファイルでも大きな勝ちです。

    誰も書かない隠れコスト

    347ドルを使って、予想していなかったことがいくつかありました。

    サブスクの罠:

  • 使わなくても毎月課金されるサービスがある
  • 「無制限」プランに、細かい字でファイル単位の上限が書いてある
  • 解約にサポートへのメールが必要なサービスが1つ。2026年に、です。
  • 書き出しの追加料金:

  • SRT字幕はHappy Scribeでファイルあたり5ドル追加
  • タイムスタンプが上位プラン限定のサービスもある
  • API利用にはプラン変更が必要
  • 使用量の膨張:

  • 無料枠は寛大に見えて、2日目には上限に当たる
  • 超過料金が通常単価の2倍になることがある
  • 年間前払いの「割引」で1年間縛られる
  • 実際の使用量が分かるまでは、従量課金のサービス(TranscribeNext、Rev、AssemblyAI)から始めてください。

    どれを選ぶべきか

    TranscribeNext が向く場合:

  • 高い出費なしにまともな精度が欲しい
  • 毎日ではなく、時々文字起こしする
  • 複数の言語を扱う
  • 月額ではなくファイル単位で払いたい
  • フリーランス、学生、小規模事業者で、余計な複雑さなしに信頼できる音声テキスト化が欲しい
  • Otter.ai が向く場合:

  • 週に5件以上のビデオ会議がある
  • 通話中のリアルタイム文字起こしが要る
  • チームでの共同作業が重要
  • 精度84%で十分
  • Rev AI/Human が向く場合:

  • 精度が決定的(法務、医療、学術)
  • 人力の12〜24時間を待てる
  • 正確さのためなら予算は二の次
  • Descript が向く場合:

  • 動画を作り、編集する必要がある
  • 文字起こしは作業の一部にすぎない
  • 他の機能も使う
  • AssemblyAI が向く場合:

  • ソフトウェアを作っている
  • APIが必要
  • コードを書ける
  • 無料で使える文字起こしソフトと無料プラン

    無料の文字起こしソフトを探しているなら、試したうえで信用できるのは次のとおりです。

  • TranscribeNextの無料枠 — 月30分。支払う前に、実ファイルでAIの精度を確かめたい場合に最適。
  • Otter.aiの無料プラン — 月300分(1件あたり30分の上限)。軽い会議の文字起こしに向きます。
  • Descriptの無料プラン — 月1時間。テキストベースの動画編集も試したい場合に有用。
  • いずれも本物の無料枠で、カード登録の小細工はありません。ただしどの無料プランにも上限があります。本格的に使うなら、自分に合うツールが分かった時点で有料へ移ると考えてください。

    よくある質問

    Q:AIで精度99%は出せますか。

    A:現実には出ません。理想的な条件(スタジオ品質、話者1人、専門用語なし)でおそらく95%。通常の音声なら85〜90%を見込んでください。99%が必要なら人力です。

    Q:Googleドキュメントの音声入力ではだめですか。無料ですが。

    A:試しました。今回のファイルで精度71%。個人のメモには十分ですが、仕事には使えません。タイムスタンプも話者ラベルもなく、複数ファイルの一括処理もできません。

    Q:人力の費用に見合いますか。

    A:45分のファイルで計算してみてください。

  • AI+自分の編集時間:7〜15ドルと25分の作業
  • 人力:60〜75ドルと確認の5分
  • 自分の時間が1分3ドル以上の価値なら人力が勝ちます。この判断はAI文字起こしと人力文字起こしの比較で詳しく扱っています。

    Q:英語以外に強いサービスは。

    A:検証したのは英語のみです。調べた範囲では次のとおりです。

  • 多言語:TranscribeNext、Sonix
  • スペイン語:Sonix
  • アジア系言語:AssemblyAI
  • まず自分の言語で試してください。結果は変わります。
  • Q:無料枠は本物ですか。

    A:本物ですが、制限があります。

  • TranscribeNext:月30分
  • Otter:月300分(1件30分の上限)
  • Descript:月1時間
  • カード登録の要否と、自動的な上位プラン移行には注意してください。

    Q:自分の音声を誰が聞くのですか。

    A:サービスによります。

  • AIサービス:機械が処理し、人は関与しません
  • 人力サービス(Rev Human、Trint):実際に人が聞きます
  • 機微な内容ではプライバシーポリシーを確認してください。AssemblyAIにはデータを保持しない選択肢があります。
  • 私自身の使い分け

    よく聞かれるので、自分の構成を書いておきます。

    顧客向けの仕事: TranscribeNext(1分0.15ドル)

  • 月あたり10〜15時間の音声
  • 費用:月90〜135ドル
  • 会議: Otter.aiの無料枠

  • 月300分で自分の会議量は足ります
  • 費用:0ドル
  • 重要なインタビュー: Rev Human(1分1.50ドル)

  • 精度が要る月1〜2件
  • 費用:月50〜100ドル
  • 月合計: 140〜235ドル

    これらを見つける前は、Upworkのフリーランスに書き起こしを頼んで月800〜1,200ドル払っていました。いまは約8割減です。

    結論

    12のサービスを試したうえで。

    現実の録音全般に対して2026年で最良のAI文字起こしソフトを1つ挙げるなら、今回の検証では精度・速度・価格の釣り合いでTranscribeNextが最良でした。

    総合で最良:TranscribeNext。 精度89%、1分0.15ドル、高速。多くの人にはこれを勧めます。

    会議なら:Otter.ai。 一日中Zoomにいるなら、Proの月10ドルは見合います。

    精度が決定的なら:Rev Human。 96%以上が必要で、支払える場合。

    動画制作者なら:Descript。 主眼はテキストベースの動画編集で、文字起こしは副産物です。

    開発者なら:AssemblyAI。 APIもドキュメントも良く、価格も妥当です。

    ---

    どこから始めるか迷うなら:

    1. 実ファイルをTranscribeNextの無料枠に上げ、精度が自分の用途に足りるか見る。

    2. 足りなければ、1週間分の会議でOtterを試す。

    3. どちらも不十分なら、おそらくRev Humanが必要です。

    ひとつだけ。必ず自分の音声で試してください。訛り、マイク、背景雑音への強さはサービスごとに違います。10分のテストファイルが、誤った決断を防いでくれます。

    *検証は2026年7月。全サービスに同じ45分のファイルを渡しました。価格とプランは変わるため、購入前に最新の料金をご確認ください。*

    音声を文字起こしする準備はできましたか?

    TranscribeNextを無料で試して、AIによる文字起こしを体験してください

    無料トライアルを開始 - クレジットカード不要

    © 2026 TranscribeNext.com. All rights reserved.

    2026年 文字起こしソフト12本を実測比較 | TranscribeNext