回到頂部
創作者在 VTuber、預設虛擬主播與取得本人同意的數位分身三種方案間做選擇

AI VTuber 怎麼做?2D/3D 製作、Avatar 與數位分身

想用 AI 製作 VTuber 或不露臉影片?本文比較 2D Live2D、3D VRM、預設 Avatar 與數位分身,整理模型、臉部追蹤、OBS 和授權流程。

內容查核: 來源查核:

想做 AI VTuber,先決定你要「即時直播角色」還是「輸入文稿就產生影片的 AI Avatar」。 直播型 VTuber 需要角色模型、臉部追蹤軟體、麥克風與 OBS;AI 可以協助概念圖、腳本或背景,但一張生成圖片不會自動變成能眨眼、轉頭與對嘴的模型。2D 角色仍要分層與 rigging,3D 角色則要有可供追蹤軟體讀取的模型格式。

「不露臉」可再分成四條路:2D VTuber、3D VTuber、平台已提供的虛擬主播,以及把自己的外貌與聲音做成 AI 數位分身。四者的製作方式、互動能力和權利風險差很多,不適合只用價格與畫質比較。

如果你只是第一次做知識影片,先用螢幕錄影、旁白與字幕也能不露臉;只有在固定角色能提升辨識度、需要大量多語版本,或真人反覆錄製成本很高時,數位分身才真正有價值。

VTuber、預設 Avatar、Digital Twin 怎麼選

方案適合你要準備主要風險
2D VTuber/Live2D雜談、遊戲、長期角色頻道分層 PSD、rigging、臉部追蹤、OBS原畫分層工時、模型與素材授權
3D VTuber/VRM大幅動作、舞蹈、全身演出3D 模型、相容追蹤軟體、OBS動作捕捉設備、穿模與即時效能
平台預設 Avatar內部培訓、簡短播報、快速多語版文稿、品牌素材、人工審片畫面模板感、方案與輸出限制
自己的 Digital Twin個人品牌、重複教學、跨語內容本人錄影、同意驗證、聲音與文稿肖像、聲音、帳號權限與濫用
別人的數位分身經授權主持人或員工明確用途、期限、地區、撤回與本人驗證假代言、勞務關係、撤回後持續使用

逼真不代表更適合。教學影片若重點是螢幕操作,固定真人半身可能只佔畫面空間;品牌若需要可信任的專家說明,觀眾也可能更在意是不是本人真的審過文稿。

若你做的是不露臉社群內容,可以先比較 AI 短影音製作流程 的螢幕錄影與旁白方案;需要合成旁白或多語版本時,再看 AI 配音工具選擇。先把內容形式定下來,通常比先買數位分身方案省事。

AI VTuber 製作:2D 與 3D 怎麼開始

2D 路線的交付物是一組可動的 Live2D 模型檔,不是一張 PNG。 先確定角色正面設計與商用範圍,再把頭髮、眉毛、眼白、瞳孔、眼皮、嘴型、臉、身體與配件等需要獨立變形的部位拆成圖層。AI 圖若出現左右不一致、遮擋部位沒有畫完整或衣服邊界黏在身體上,進入分層後仍要人工補繪。

完成原畫後,以 PSD 匯入 Live2D Cubism 做 rigging,把臉部角度、眨眼、嘴型與物理擺動綁到參數。Live2D 官方手冊要求 PSD 使用 RGB、8 bit/channel 與 sRGB,並提醒每個要獨立動作的部件需整理成可匯入的圖層。輸出模型後放進 VTube Studio;它的入門文件列出必要的 model3.json.moc3、材質與物理檔,首次載入可執行 Auto-Setup,再用手機或網路攝影機校正表情追蹤。

3D 路線適合想快速做出可轉身、揮手或全身動作的新手。 可先在 VRoid Studio 調整臉型、髮型、服裝和材質,確認所有素材的使用條款,再依官方匯出說明輸出 VRM 1.0。接著要選明確支援 VRM 的臉部或全身追蹤軟體;VTube Studio 本身是 Live2D 工具,不能直接拿來載入 3D VRM。

兩條路最後都進 OBS。先用追蹤軟體的透明背景或去背輸出,再於 OBS 加入角色視窗、遊戲或桌面、麥克風與字幕。OBS 的快速入門建議先跑 Auto-Configuration Wizard、加入 Sources、確認 Audio Mixer,並在正式直播前錄一小段測試。測試時做抬頭、低頭、快速轉向、閉眼、張嘴與爆音句,查看追蹤是否跳動、嘴型是否延遲、角色是否遮住遊戲資訊,以及 CPU/GPU 是否掉幀。

新手可先用試用模型完成「追蹤軟體 → OBS → 一分鐘測錄」,確定電腦與工作流可行,再投入原畫和 rigging。若先花錢買完整模型,最後才發現追蹤、音訊或直播內容沒有準備好,成本很難收回。

用自己的數位分身:7 步安全流程

  1. 先寫用途和權限。 明確限定頻道、語言、內容類型、使用者、期限與可否做廣告。團隊帳號要知道誰能生成、下載和刪除素材。
  2. 選有本人驗證的服務。 HeyGen 官方目前要求影片型 Digital Twin 另外錄製 consent video;替別人建立時,也要由本人自行完成,而不是製作者代替同意。
  3. 錄製乾淨素材。 光線均勻、背景安靜、鏡頭固定、眼睛看鏡頭。不要把客戶文件、住址、螢幕通知或未授權人物拍進去。
  4. 聲音分開確認。 使用平台語音、本人錄音或自己的聲音克隆前,確認聲音權利和可用範圍;別把取得影像同意當成取得聲音同意。
  5. 先做 20 秒測試。 測名字、數字、英文縮寫、品牌詞與停頓,再決定是否製作長片。
  6. 人工逐句審核。 看嘴型、發音、眼神、手勢、字幕、數字和文稿是否一致。醫療、財務、法律、政治與公司公告要由負責人審稿。
  7. 發布時完成揭露與保存紀錄。 依 YouTube、TikTok 等平台規則標示 AI 內容,保留同意、文稿、版本、發布位置與撤回流程。

可以先用這種文稿格式減少不自然口型:

每句 12 至 22 個中文字,句子之間留停頓。
數字、英文縮寫與專有名詞另外標註讀法。
不要寫過長括號、連續清單或難以自然口說的表格句。
所有事實、價格與日期先由人工確認,不讓工具自行補充。

同意不是一個勾選框就結束

至少要分開處理:外貌影像、聲音、文稿、品牌或角色、生成輸出,以及發布平台。若替員工、講師、客戶或演員製作,書面範圍應包含誰能操作、允許說哪些內容、可用多久、能否投放廣告、離職或合作結束怎麼撤回,以及既有影片是否下架。

不要用網路照片、訪談片段或社群影片測試別人的數位分身。即使技術上能生成、也加了 AI 標籤,仍可能涉及肖像、個資、著作權、假冒與平台規範。

發布前怎麼驗收

先確認角色與聲音都有明確來源和用途授權,而且本人看過最終文稿與成片,不只是在建立模型時錄過一次同意。名字、數字、產品功能、價格與日期要逐項核對;文稿不能加入本人未同意的推薦、政治立場或敏感陳述。

成片要再看字幕、口型和語氣是否讓觀眾誤解。帳號應開啟雙因素驗證,生成權限只交給必要人員;發布時完成 YouTube、TikTok 等平台所需 AI 標示,並保存撤回同意、刪除模型及處理舊影片的方法。

以內部培訓為例,最容易忽略的是員工離職後的處理。若講師的分身仍留在團隊帳號,新同事可能繼續產生新課程。公司應在合作結束時停止生成權限,約定既有課程保留多久,並決定法規或產品更新後由誰重審內容。這些治理成本應在導入前就算進去。

常見問題

不露臉做 YouTube,一定要用 AI 分身嗎?

不一定。螢幕錄影、實物、圖表、授權 B-roll 加自己的旁白通常更快。需要固定角色、直播互動可用 VTuber;需要大量重複或多語播報,再考慮數位分身。

可以替員工或客戶做 Digital Twin 嗎?

應由本人完成平台要求的同意驗證,並另外約定用途、期限、語言、操作者、廣告、撤回與刪除方式。一次同意不應被解讀為所有未來內容都可使用。

使用自己的照片就完全沒風險嗎?

仍要保護帳號、原始素材與聲音模型,並審核生成文稿。若帳號被共用或 API key 外洩,別人可能用你的分身生成未授權內容。

AI 分身影片要標示嗎?

真實感人物說出未實際錄製的內容,通常落在平台 AI 揭露重點。YouTube 與 TikTok 都有相應標示流程;發布當下應查看最新規則。

參考來源

№ · further reading

延伸閱讀