回到頂部
概念插畫:音訊工作者將交疊的薄荷綠與珊瑚色實體聲帶分開排列,呈現重疊人聲分離後仍需逐軌聆聽

Premiere AI 音訊更新:重疊人聲怎麼分離、點數怎麼算?

Premiere 更新 AI 音訊與時間軸生成工具。看懂 Separate Crosstalk 的處理費用、前後保留音訊與測試版限制,並分清降噪、音景生成和配樂,避免選錯工具或多花點數。

內容查核: 來源查核:

訪談兩人搶話,可以先試 Premiere 的 Separate Crosstalk,但不要把整段錄音送去處理,也不要以為它不扣點數。 Adobe 在 9 月 8 日的影片工具更新中,介紹時間軸生成工具與音訊公開測試功能。對剪輯師來說,先分清「修原音」和「生成新聲音」,比把所有新按鈕各按一次更省時間。

你遇到的聲音問題,該用哪一項?

問題優先看檢查結果時注意
兩位受訪者同時說話Separate Crosstalk各自的字尾有沒有被切掉或混到另一軌
同段音訊含人聲、音樂與環境音Enhance Audio,公開測試調整後人聲是否失真、背景是否不自然
配樂常蓋過旁白Dynamic Auto Ducking,公開測試對話前後音量起伏是否突兀
畫面缺腳步、門聲等音效Generate Sound Effects動作時間點與空間感是否對得上
想依畫面建立環境聲草稿Generate Soundscape,測試版新生成的聲音是否改變觀眾對現場的理解

官方把新的音訊修整工具列為公開測試;這不等於整份公告裡的工具都處在同一發布階段。安裝或更新前,先確認 Creative Cloud 顯示的版本和帳號可用項目。正在交付的專案先留副本,不要只為試功能就覆寫主檔。

Separate Crosstalk 怎麼操作與計費?

依官方操作文件,先在時間軸裁出重疊說話的區段,選取後從右鍵選單或屬性面板開啟 Separate Crosstalk。處理前先看確認視窗中的用量,再決定是否執行。

文件列出的限制與費用很具體:一次處理一個片段,不支援多片段一起選取;片段長度範圍為 1 秒至 10 分鐘,每處理一秒使用 1 點生成點數。它還會在前後各加入 2 秒保留音訊,並把這部分反映在處理費用中。

舉例來說,若你選取 10 秒,且前後都加入完整保留區段,依上述費率估算就是 14 秒、14 點。這是計算範例,不是所有片段固定扣這個數量;實際仍看確認視窗,尤其要檢查素材邊界與選取範圍。

完成後會產生分離的人聲與背景軌,原始音軌自動停用而非刪除。保留原軌,才能逐段比對是否真的改善;不要因為多了幾條軌道,就把它當成已救回錄音。

分軌之後,要聽的是字句完整性

我的建議是先挑一段最難的重疊對話:人名、數字、否定詞或句尾轉折都很適合。依序獨聽各軌,再聽混音,確認沒有把「不是」的「不」削掉,也沒有讓另一位說話者的聲音殘留得像回音。這是驗收方法,本文沒有實測特定中文錄音的還原率。

台灣訪談常見國語、台語與英文詞混用,測試時應放入自己的素材。若關鍵句仍聽不清,回到原錄音或請受訪者確認;不建議用新生成的語音補出對方原本沒說清楚的意思,再當作現場原音發布。

需要完整字幕的人,也要另外做轉錄與字幕時間軸校正。人聲分離與逐字稿不是同一項交付,聲音聽起來乾淨,不保證文字就正確。

生成音效、音景與配樂,要另外算用量

音訊生成文件說明,音效可用文字描述,也能錄製參考聲音引導時間與強弱;音景則根據選取範圍的可見畫面生成環境聲。音樂還能指定情緒、樂器、速度或循環需求。

先做一個事件,例如「杯子放上桌面」,比同時要求全片所有聲音更容易判斷。生成後仍要放回前後鏡頭聽,檢查突兀切換與音量;這些是新創作的聲音,不是原始現場錄音的復原。Firefly 網頁版的分工可另讀 AI 音樂、配音與音效指南。

目前的 Generative Media Tool FAQ指出,生成用量會隨模型與設定改變,合作模型可用性也受地區及方案影響。不要把人聲分離的每秒費率套到生成影片或配樂,更不要把另一個服務的訂閱額度當成 Adobe 點數。

留在 Premiere 裡,不等於全部在本機處理

上述 FAQ 明確說明,生成媒體需要網路,提示與參考素材會送往雲端處理;Adobe 表示這些輸入不會用於訓練 Adobe 或合作模型。「不拿去訓練」與「沒有上傳」是兩件事,未公開訪談或客戶素材仍應先確認專案允許的處理方式。

交付時保留原片、生成片段與人工修改紀錄,並依匯出文件檢查 Content Credentials。來源憑證可補充製作資訊,不能代替畫面與敘述的查證;需要理解它的界線,可接著看 C2PA 驗證能證明哪些事。

常見問題

Separate Crosstalk 是免費功能嗎?

官方文件列為使用生成點數的進階功能,按實際處理音訊長度計費,前後保留音訊也可能增加用量。執行前以確認視窗顯示的點數為準。

它可以把整場多人會議都自動分成每人一軌嗎?

不要把這項重疊對話處理工具當成整場多人會議分軌方案。公告描述的用途是分離兩位同時說話的人;先裁出問題片段測試,整場轉錄與說話者標示要另行處理。

生成的音景可以當作原始現場聲音嗎?

不可以混為一談。音景是依畫面引導產生的新音訊,適合創作與設計;新聞、紀錄或其他需要呈現事實的內容,應避免讓觀眾誤以為它就是當時錄到的聲音。

參考來源

№ · further reading

延伸閱讀