Video to Text ユーザーガイド | アップロードから文字起こし・書き出しまで

Video to Text の使い方をアップロードから書き出しまで解説。ファイル制限や言語オプションも紹介します。

Dkphhh

Video to Text は、音声や動画を、ダウンロードして再利用できる文字起こしに変換します。このガイドでは、サインインから書き出しまで、現在のワークフローを順番に解説します。

1. まずはサインイン

文字起こしを始めるには、アカウントが必要です。サインインしておくと、アプリが利用可能なクレジット残高を確認し、結果をアカウントのセッションに紐付けられます。

新規ユーザーには無料の 30 クレジットが付与されます。選択したファイルに対して残りクレジットが足りない場合、処理が始まる前にアプリからチャージを促されます。

2. 対応ファイルをアップロードする

文字起こししたい音声または動画ファイルを選びます。

Video to Text が現在受け付けているファイルは次のとおりです。

  • 音声:.aac、.flac、.m4a、.mp3、.oga、.ogg、.opus、.wav
  • 動画:.mp4、.m4v、.webm

現在のアップロード制限は次のとおりです。

  • 最大ファイルサイズ:5 GB
  • 最大メディア長:10 時間未満

ファイルが大きすぎる、または長すぎる場合、文字起こしが始まる前にアプリが処理を止めます。

3. 言語設定を選ぶ

ファイルを送信する前に、録音内容に最も合う言語オプションを選びます。

  • 言語が分かっている場合は、特定の言語を選択する
  • よく分からない場合は、自動言語検出を使う
  • 話者が言語を切り替える場合は、多言語検出を使う

インタビュー、国際会議、授業、ポッドキャスト、複数の言語が混ざる録音で便利です。

4. 必要に応じて話者ラベルをオンにする

録音に話者が複数人いる場合は、話者ラベルを有効にできます。文字起こしの構造が整理され、書き出したファイルの見直しも楽になります。

話者ラベルが特に役立つのは、次のような場面です。

  • 会議
  • インタビュー
  • パネルディスカッション
  • 授業の録音

5. 文字起こしを開始する

アップロードが完了すると、アプリが文字起こしを開始します。処理時間は、ファイルサイズ、アップロード速度、メディアの長さ、音声の明瞭さによって変わります。

この製品はスピーディな処理を狙って作られており、ほとんどのファイルは短時間で完了します。ただし、文字起こしを終えるにはファイルのアップロード自体が必要なため、長いファイルほど時間がかかる場合があります。

6. 結果を書き出す

文字起こしが完成すると、Video to Text は書き出しページへ移動します。結果は次の形式で書き出せます。

  • csv
  • srt
  • vtt
  • txt

字幕には srt か vtt、構造化されたレビューには csv、プレーンテキストの編集には txt を使います。

実用的なコツ

  • できるだけきれいな音源のファイルをアップロードする
  • 可能な場合は正しい言語オプションを選ぶ
  • 複数話者のコンテンツでは話者ラベルをオンにする
  • サービスを長期保存先として使わず、結果は早めに書き出す
タグ
ガイド,チュートリアル,video to text