Video to Text にはどれくらい時間がかかる?
Video to Text の文字起こし速度に影響する要素(ファイルサイズ、アップロード時間など)と、現実的なベンチマーク例を解説します。
Video to Text の所要時間は、アップロード時間と文字起こし時間の両方で決まります。実際には、ほとんどのファイルは短時間で完了します。現在の製品ドキュメントでは、文字起こし速度の目安としてリアルタイムファクター(RTF)0.008x を使用しています。
この数値は、文字起こしの段階が元のメディアの長さよりはるかに速いことを意味します。ただし、全体の所要時間にはファイルのアップロード、ネットワークの状態、ファイルの複雑さも含まれます。
まだツールを使ったことがない方は、Video to Text の使い方から始めてください。ファイルの準備中であれば、Video to Text の対応メディア形式を確認しましょう。
現在の処理時間の例
プロジェクト資料で使用しているベンチマーク例は次のとおりです。
| 録音の種類 | メディアの長さ | 完了時間の例 |
|---|---|---|
| ミーティング | 1 時間 3 分 | 35 秒 |
| ポッドキャスト | 3 時間 15 分 | 133 秒 |
| 動画講座 | 8 時間 21 分 | 300 秒 |
これらの例は目安を設定するのに役立ちますが、実際の結果は変わる場合があります。
待ち時間に影響する要素
1. アップロード速度
文字起こしを始めるには、アプリがソースファイルをアップロードする必要があります。接続が遅かったり不安定だったりすると、特に大きな動画ファイルでは顕著に時間がかかります。
2. ファイルの長さ
長い録音ほど、処理に時間がかかるのが普通です。とはいえ、文字起こしの段階はリアルタイムよりはるかに速く進むように設計されています。
3. ファイルサイズと形式
コンパクトな音声形式の長いファイルは、はるかに大きい形式の短いファイルより速くアップロードできることがあります。動画ファイルは音声のみのファイルより大きくなりがちなので、アップロードの段階が主な遅延原因になることがあります。
4. 音声の明瞭さ
背景ノイズ、話者の重なり、多言語が混ざる内容があると、きれいな単一話者の録音に比べて処理時間が読みにくくなります。
長いファイルでは何を想定すべきか
メディアファイルが長さの上限に近い場合は、全体の待ち時間が長くなると想定してください。ファイルはまずアップロードする必要があり、大きなアップロードは文字起こし自体より時間がかかることがあります。
現在のアップロードルールは次のとおりです。
- ファイルサイズは最大 5 GB
- メディアの長さは 10 時間未満
大きな録音ファイルの場合、何よりも安定したインターネット接続が役立ちます。
実際に早く終わらせる方法
話の内容自体は変えられませんが、避けられる遅延は減らせます。
- 文字起こしだけが必要なら、動画ではなく音声をアップロードする
- アップロードを始める前に、安定した接続を使う
- 書き出す前に、不要なイントロ、アウトロ、空白部分をカットする
- 当てずっぽうではなく、正しい言語オプションを選ぶ
文字起こし完了後
文字起こしが完成すると、エクスポートページに移動します。そこから出力を次の形式でダウンロードできます。
csvsrtvtttxt
すぐに字幕が必要なら、まず srt か vtt を選びましょう。文字起こしを表計算で確認する予定なら、csv を使いましょう。
