
Transcriber は、音声・動画ファイルをブラウザの中で文字起こしする無料の Web ツールです。OpenAI が公開している音声認識モデル「Whisper」をお使いの端末の上で動かすため、音声データをサーバーへアップロードしません。会員登録は不要で、利用時間・回数の制限もありません。ページを開いてファイルを選ぶと、そのまま処理が始まります。
主な機能
- 文字起こし:Whisper の 6 種類のモデル(Tiny〜Large v3)から選べます。端末の性能に合った推奨モデルが最初から選ばれていて、WebGPU が使えるパソコンでは GPU で処理します。処理中は確定した行から順に表示され、途中で止まった場合もそこまでの結果は残ります。
- 対応言語:日本語・英語・中国語・韓国語・スペイン語・フランス語・ドイツ語など 11 言語。「自動検出」を選ぶと、それ以外の言語も文字起こしできます。
- 話者分離(ベータ版):誰が話したかを判定し、発言者ごとに色分けして表示します。話者の人数は自動で推定します。話者に名前を付ける、誤って分かれた話者をまとめる、行ごとに話者を直す、といった修正も画面上でできます。
- 結果の編集:本文の修正、行の分割・追加・削除、時刻の修正、検索と置換、編集の取り消しに対応しています。行をクリックすると、再生位置がその行へ移動します。
- 動画の字幕表示:MP4 などの動画は、音声に変換せずそのまま読み込めます。文字起こしのあとは、結果を字幕として動画に重ねて再生できます。
- 翻訳:デスクトップ版の Chrome / Edge に内蔵された翻訳機能で、各行に訳文を付けます。翻訳も端末内で処理し、文字起こしの結果は外部へ送信されません。
- 書き出し:TXT と SRT(タイムコード付き字幕)で保存できます。翻訳した場合は原文・訳文・対訳から選べます。
- 履歴:完了した文字起こしはこの端末のブラウザ内に保存され、あとから開き直して再生・編集できます。
対応形式
音声:MP3・WAV・M4A・AAC・FLAC・OGG・Opus・AIFF・WMA・AMR・WebM
動画:MP4・MOV・MKV・WebM・AVI・WMV・FLV・MPEG-TS・3GP
1 ファイル 2 GB まで(スマートフォンは 500 MB まで)。画面の表示言語は日本語・英語・中国語・スペイン語・韓国語に対応しています。
使いみちの例
会議の議事録、インタビューや取材の書き起こし、YouTube などの動画の字幕作成、講義の記録、スマートフォンで録ったボイスメモの整理、ポッドキャストの書き起こし。社外に出せない録音も、外部のサーバーへ送らずに文字にできます。
注意点
処理速度はお使いの端末の GPU / CPU の性能で決まります。初回だけ AI モデルのダウンロード(選ぶモデルにより約 40 MB〜1.6 GB)が必要で、2 回目以降はブラウザに保存したモデルを使います。スマートフォンではメモリを抑えた方式で動くため、長時間の音声はパソコンでの利用をおすすめします。翻訳機能はスマートフォン・Firefox・Safari では使えません。
技術的なこと
Whisper は Transformers.js(ONNX Runtime Web)でブラウザ上で実行し、動画からの音声の取り出しは ffmpeg.wasm で行っています。話者分離は、pyannote 3.1 をブラウザ向けに移植したものと NVIDIA Nemotron 3 Diarization を、端末の環境に応じて使い分けています。サイトは Next.js で作っています。
