AI音声で作ったナレーションと、収録済みの音声や効果音を同じ動画へ入れると、音声が二重に鳴る、字幕だけがずれる、再生成で外部音声が消える、といった問題が起こりがちです。原因の多くは音声ファイルではなく、タイムライン上の状態と字幕の正本が混ざっていることにあります。
結論:音源種別・再生状態・字幕状態を別々に持つ
外部音声をTTSと同じ扱いにすると、まとめて再生成した時に上書きされたり、同じ区間が二重に再生されたりします。音源の種別、タイムライン上の開始・終了、字幕の確定状態を分け、出力時には確定したものだけを集めます。これにより、音声の差し替えや分割をしても、字幕と再生位置を追跡できます。

混在編集で起こりやすい3つの問題
| 症状 | よくある原因 | 先に確認すること |
|---|---|---|
| 同じ箇所が二重に鳴る | 元ブロックと分割後ブロックを両方出力している | 出力対象IDと開始・終了時刻 |
| 字幕が音声と合わない | 編集済みテキストと適用済み字幕が混在している | 字幕の確定状態とタイムスタンプ |
| 再生成で外部音声が消える | 一括TTS処理が外部音声まで上書きしている | 音源種別ごとの更新対象 |
単一のナレーションだけを扱う時は、テキスト、音声、字幕を一つのブロックとして管理しても大きな問題になりにくいものです。しかし、外部から取り込んだ音声は、テキストから再生成できない場合があります。TTSと同じ更新規則を適用すると、元の音声を失う、または古い音声と新しい音声が共存する危険があります。
ブロックに持たせるべき状態
- 音源種別: TTSか外部音声か。処理対象を分けるための最初の条件です。
- 開始・終了時刻: タイムラインの位置。音声ファイルの長さと別に持ちます。
- 元ファイルの参照: 取り込み元ではなく、アプリ管理領域へ保存した正規化済み音声を使います。
- 字幕テキストと確定状態: 編集途中の文字列と出力してよい字幕を混ぜません。
- 出力対象フラグ: 置換済み、無効、分割前などのブロックを誤って結合しないために使います。
- 外部音声をWAVなど扱いやすい形式へ正規化し、作業用の管理領域へ保存する
- ブロックへ音源種別、長さ、開始時刻、元ファイルの参照を登録する
- 字幕を入力し、音声を聴いてから「適用済み」へ確定する
- 分割する時は、音声、開始・終了時刻、字幕、確定状態を同時に二つへ分ける
- 結合前に有効なブロックだけを時刻順に並べ、重複区間がないか確認する
- SRTは確定済み字幕だけから作り、動画と同じタイムラインで試聴する
- 字幕の開始・終了が音声の開始・終了と同じタイムライン基準か
- 分割後の前半と後半へ字幕が重複または欠落していないか
- 編集後に未適用状態へ戻すルールがあるか
- 空白や無音の区間を字幕の長さだけで詰めていないか
- 動画への書き出し前に、SRTと最終音声を同時に試聴したか
ここでの要点は、画面に表示する文字と、SRTへ出してよい字幕を同じものと決めつけないことです。字幕を編集した直後に音声との対応を確認していないなら、その文字列は「編集中」です。確定操作を通った字幕だけを出力対象にすれば、音声が古いまま新しい字幕だけが公開される事故を避けられます。
取り込みから出力までの安全な流れ
音声を取り込む時点で、元のパスをそのまま参照し続ける設計も避けたいところです。外付けドライブや同期フォルダの位置が変わると、プロジェクトを開いた時に音が見つからなくなります。編集用に正規化したコピーをアプリ側の管理領域へ置き、元ファイルとの関係だけを記録しておくと、再現性が上がります。
正規化の際は、サンプルレート、チャンネル数、ビット深度を一定にしておくと、結合時の予期しない速度変化や音切れを減らせます。ただし、正規化は音声の利用許諾を引き継ぐだけで、権利上の利用範囲を広げるものではありません。外部音声を使う前に、用途に必要な権利を確認します。

二重再生を防ぐルール
音声を分割・差し替えした後は、古いブロックを消したつもりでも、結合対象の一覧に残っていることがあります。二重再生を防ぐには、ファイル名の違いではなく、ブロックID、開始・終了時刻、有効状態で判定します。結合直前に同一IDの重複、時間帯の重なり、同じ元音声を参照する有効ブロックを検査すると、公開前に止められます。
一括TTS生成は外部音声を更新対象から外す
TTSの声や速度を一括で変える処理は便利ですが、外部音声まで再生成または削除の対象にしてはいけません。処理の入口で音源種別を判定し、外部音声は保持します。これだけで、再生成後に外部音声が消える、古い波形と新しい字幕が混ざる事故を大きく減らせます。
字幕ずれを防ぐ確認項目
短いテスト音声で、通常TTS、無音、外部音声を順に配置し、開始・終了時刻と全体長が一致するかを先に確認すると安全です。この小さな検証で状態の混同を見つけてから、長い台本や本番の音声へ広げます。長文TTSそのものの読み崩れを減らす方法は、台本2行分割と部分再生成の検証手順も参考になります。
公開前に残す記録
音声制作は、あとから問題が見つかることを前提にします。各ブロックの音源種別、元ファイルの識別子、開始・終了時刻、字幕の確定状態、生成設定、最終出力の日時を残してください。MP3を書き出して編集工程へ渡す基礎は、AI音声をMP3で書き出す方法で確認できます。記録があれば、差し替えた一箇所だけを安全に戻せます。
検証は、完成した長尺を一度だけ再生して終わりにせず、短い混在サンプルと最終出力の二段階で行います。短いサンプルでは時刻計算と状態遷移を確認し、最終出力では区間の境目、字幕の読みやすさ、二重音、無音の長さを実際に聴いて確かめます。機械チェックと実聴を分けて残すと、次の修正箇所を判断しやすくなります。
よくある質問
Q. 外部音声を取り込んだら、TTSと同じブロックで管理してよいですか?
A. 画面上は同じタイムラインに置けますが、更新規則は分けます。外部音声はテキストから再生成できないため、音源種別を持たせて一括TTS処理から保護します。
Q. 字幕を修正したらすぐSRTを書き出してよいですか?
A. 音声との対応を確認するまでは編集中として扱います。適用済みの字幕だけをSRTへ出すと、音声と合わない編集途中の文を公開する事故を防げます。
Q. 分割後に二重再生する時は何を確認しますか?
A. 元ブロックと分割後ブロックの有効状態、開始・終了時刻、結合対象IDを確認します。ファイルが存在するだけで出力対象にしない設計が重要です。
Q. 外部音声の元ファイルは移動しても大丈夫ですか?
A. プロジェクト内で必要な形式へ正規化したコピーを管理領域へ保存していれば、元の置き場所が変わっても再編集しやすくなります。利用権や原本の保管ルールは別途守ってください。
まとめ
AI音声と外部音声を混在させる時は、音源種別、タイムライン、字幕の確定状態を別々に管理します。外部音声を一括TTS処理から除外し、分割時には音声と字幕の状態を同時に更新し、結合前に有効ブロックだけを確認してください。二重再生と字幕ずれを、公開後の修正ではなく設計段階で防げます。
音声生成や動画制作のワークフローを整えたい場合はACSの開発依頼、使うサービスを整理したい場合はサービス選択診断をご覧ください。
タイムライン表示を定期更新する時は、画面更新で操作を中断しない設計も確認してください。
再生状態の扱いでは、再生開始・停止の障害を分ける確認手順も確認してください。
この記事は役に立ちましたか?
ありがとうございます!