Video to Text ユーザーガイド | アップロードから文字起こし・書き出しまで
Video to Text の使い方をアップロードから書き出しまで解説。ファイル制限や言語オプションも紹介します。
Video to Text は、音声や動画を、ダウンロードして再利用できる文字起こしに変換します。このガイドでは、サインインから書き出しまで、現在のワークフローを順番に解説します。
1. まずはサインイン
文字起こしを始めるには、アカウントが必要です。サインインしておくと、アプリが利用可能なクレジット残高を確認し、結果をアカウントのセッションに紐付けられます。
新規ユーザーには無料の 30 クレジットが付与されます。選択したファイルに対して残りクレジットが足りない場合、処理が始まる前にアプリからチャージを促されます。
2. 対応ファイルをアップロードする
文字起こししたい音声または動画ファイルを選びます。
Video to Text が現在受け付けているファイルは次のとおりです。
- 音声:
.aac、.flac、.m4a、.mp3、.oga、.ogg、.opus、.wav - 動画:
.mp4、.m4v、.webm
現在のアップロード制限は次のとおりです。
- 最大ファイルサイズ:5 GB
- 最大メディア長:10 時間未満
ファイルが大きすぎる、または長すぎる場合、文字起こしが始まる前にアプリが処理を止めます。
3. 言語設定を選ぶ
ファイルを送信する前に、録音内容に最も合う言語オプションを選びます。
- 言語が分かっている場合は、特定の言語を選択する
- よく分からない場合は、自動言語検出を使う
- 話者が言語を切り替える場合は、多言語検出を使う
インタビュー、国際会議、授業、ポッドキャスト、複数の言語が混ざる録音で便利です。
4. 必要に応じて話者ラベルをオンにする
録音に話者が複数人いる場合は、話者ラベルを有効にできます。文字起こしの構造が整理され、書き出したファイルの見直しも楽になります。
話者ラベルが特に役立つのは、次のような場面です。
- 会議
- インタビュー
- パネルディスカッション
- 授業の録音
5. 文字起こしを開始する
アップロードが完了すると、アプリが文字起こしを開始します。処理時間は、ファイルサイズ、アップロード速度、メディアの長さ、音声の明瞭さによって変わります。
この製品はスピーディな処理を狙って作られており、ほとんどのファイルは短時間で完了します。ただし、文字起こしを終えるにはファイルのアップロード自体が必要なため、長いファイルほど時間がかかる場合があります。
6. 結果を書き出す
文字起こしが完成すると、Video to Text は書き出しページへ移動します。結果は次の形式で書き出せます。
csvsrtvtttxt
字幕には srt か vtt、構造化されたレビューには csv、プレーンテキストの編集には txt を使います。
実用的なコツ
- できるだけきれいな音源のファイルをアップロードする
- 可能な場合は正しい言語オプションを選ぶ
- 複数話者のコンテンツでは話者ラベルをオンにする
- サービスを長期保存先として使わず、結果は早めに書き出す
